跳到正文

#观点/讨论

今天收录 2 条

第 7 页更新的内容回到最新

5月19日周一
  1. Miles Brundage ·

    Miles Brundage:AI 政策需从单个系统转向组织级治理

    Miles Brundage 撰文指出,当前多数 AI 安全与政策讨论聚焦于单个 AI 系统的风险缓解,但这远远不够——还需关注组织层面的治理问题,例如追问「OpenAI 或 Anthropic 是否会带来灾难性风险」,而非仅停留在「o3 或 Claude 3.7 Sonnet 是否安全」。他认为从模型到系统的转变虽重要,但仍需进一步放大视角,纳入企业实体维度。 随着 AI 快速进步,「系统因太笨而无害」的不可能性论证将很快失效,因此外部利益相关方无法仅凭特定 AI 系统的属性来评估一家组织的整体风险水平,比如该公司是否及时修补软件漏洞。

5月13日周二
  1. Rising Tide(Helen Toner) ·

    Helen Toner 借《The Future and Its Enemies》提出安全超级智能的动态主义愿景

    Helen Toner 借用 Virginia Postrel 1998 年著作《The Future and Its Enemies》,主张用动态主义(dynamism)而非停滞主义(stasism)来审视通往超级智能道路上的 AI 安全问题。她指出 AI 安全界部分政策带有明显停滞主义色彩——例如偏好少数领先 AI 项目乃至仅存一家、以及通过防扩散减少接触危险技术的途径。但她强调 AI 安全并非天然属于停滞主义阵营,亲技术与反技术、拥抱风险与规避风险的二分并不贴合这场争论的真实分歧。

5月6日周二
  1. Obsolete(Garrison Lovely) ·

    OpenAI 宣布保留非营利控制权,作者给出四点预测

    OpenAI 宣布将继续由非营利组织监督和控制公司,此前其剥离非营利控制的计划曾遭到 Elon Musk、公民社会领袖、前员工和法律学者的反对。非营利董事会主席 Bret Taylor 在博客中表示,公司过去和今后都由该非营利组织监督和控制,这一决定是在与加州和特拉华州总检察长讨论后作出的。CEO Sam Altman 在随附信件中提出转向“人人持股的常规资本结构”,作者认为这暗示投资者利润上限将被修改或取消。文章还指出,OpenAI 未明确回应此前两轮融资中投资者可追回数百亿美元的条款,也未说明非营利组织将获得多少补偿。

5月5日周一
  1. Embrace The Red ·

    ChatGPT 记忆与聊天历史功能如何运作:一次系统提示词实测

    作者用两个 ChatGPT 账号实测新上线的 chat history 记忆功能,发现它并不真正检索历史对话,而是把用户画像和近期对话写入系统提示词。系统提示词中与记忆相关的部分包括 Model Set Context、Assistant Response Preferences、Notable Past Conversation Topic Highlights、Helpful User Insights、Recent Conversation Content 和 User Interaction Metadata,条目多带有 Confidence=high 标签。

5月1日周四
  1. AI as Normal Technology ·

    AGI 不是里程碑:从 OpenAI o3 谈起

    OpenAI 发布 o3 后,关于通用人工智能是否已达成的争论再起,但 AGI 并非一个里程碑式事件。o3 的关键创新是用强化学习让模型在推理链中搜索网页并使用工具,从而完成更复杂的认知任务。文章认为,即便系统达到某种能力阈值,其影响仍取决于扩散速度与环境设计,因此判定某系统是否构成 AGI 只能事后回溯。

  2. Joe Carlsmith ·

    Joe Carlsmith 谈自动化对齐研究:可评估的对齐研究更易被自动化

    Joe Carlsmith 在 Anthropic 的演讲中提出,解决对齐问题的关键之一是能否安全地自动化对齐研究,其中评估难度是核心障碍。他认为,可通过经验反馈回路与形式化方法评估的对齐研究更适合被自动化,并能反过来推动更难评估的"概念性对齐研究"。他同时强调,AI 安全反馈回路需在能力前沿推进的每个阶段跑赢或约束 AI 能力反馈回路。

  3. Joe Carlsmith ·

    我们能否安全地自动化对齐研究?

    Joe Carlsmith 在系列文章第五篇中探讨了安全自动化对齐研究的可行性,提出"对齐 MVP"概念,即让 AI 达到或超过顶尖人类专家的对齐研究水平。他认为可通过经验反馈回路和形式化方法评估的对齐研究最值得乐观,可先大量自动化这类研究,再借此安全地自动化其余"概念性对齐研究"。主要风险包括评估难题、AI 谋划和资源不足,但他认为仍有很大机会成功。

4月24日周四
4月23日周三
  1. Rising Tide(Helen Toner) ·

    Helen Toner:决定未来两年 AI 进展的两大问题——自动评分能扩展到数学编程之外吗

    Helen Toner 提出,未来几年 AI 进步的速度很大程度上取决于两个问题的答案:除了数学和编码,还有哪些难题能被自动评分?以及在这些可自动评分的领域取得性能提升,能在多大程度上溢出到其他任务? 她指出,近期“推理模型”(从 OpenAI 于 2024 年 9 月推出的 o1,到 Google 的 Gemini Flash Thinking、DeepSeek 的 r1)之所以快速进步,关键在于数学与编码题可以低成本地大规模自动判分。

4月22日周二
  1. Frontier Model Forum ·

    Frontier Model Forum 推出前沿 AI 框架技术报告系列

    Frontier Model Forum 启动前沿 AI 框架技术报告系列,计划在未来数月内陆续发布四份报告,分别覆盖风险分类与阈值、前沿能力评估、缓解措施以及第三方评估。该系列旨在说明不同组织情境下如何有效落地前沿 AI 框架,并推动实施标准的形成。目前已有 12 家主要 AI 开发商发布了各自的前沿 AI 框架,其中包括 Google DeepMind 的 Frontier Safety Framework、Anthropic 的 Responsible Scaling Policy 和 OpenAI 的 Preparedness Framework。

4月15日周二
  1. AI as Normal Technology ·

    《AI as Normal Technology》:将 AI 视为普通技术的未来愿景

    一份逾 15000 字的论文提出应将人工智能理解为“普通技术”(normal technology),而非类似人类的高自主超级智能实体,并主张无需激进政策干预或技术突破即可让人保有对其的控制权。该框架强调技术与社会的关系,拒绝技术决定论,指出变革性的经济和社会影响会缓慢发生——其关键在于区分 AI 方法、AI 应用与 AI 采纳三者处于不同时间尺度。论文分四部分展开:人机分工中越来越多的人类工作变成“AI 控制”、从事故、军备竞赛、滥用和对齐失败四个角度重估风险,以及以减少不确定性为首要目标、以韧性应对灾难性风险的 AI 政策建议。

4月6日周日
  1. Rising Tide(Helen Toner) ·

    Helen Toner:不扩散并非应对 AI 滥用的正确路径

    Helen Toner 撰文指出,将核不扩散式的强硬策略作为管理 AI 滥用风险的主要手段很可能是错的,若认真执行会既无效又损害自由。她认可算力安全、信息安全与 AI 护栏三支柱能阻止恶意行为者获取可用模型的逻辑前提,但强调生物武器与关键基础设施黑客属于固定能力门槛目标——一旦某项性能水平达成,复制成本便急剧下降,因此仅锁定最先进系统远远不够,应转向以韧性为核心的替代方案。

4月3日周四
  1. Rising Tide(Helen Toner) ·

    Helen Toner:AI 对齐的核心挑战在于“可控性”(steerability)

    Helen Toner 提出应把“AI 对齐”理解为“可控性”:真正的问题是能否可靠地引导先进 AI 系统朝向任意目标,而非它是否符合某人价值观。“对齐”一词带有明确的参照系暗示,导致概念混淆——如今在许多圈子里,“对齐”几乎等同于 RLHF 一类的内容审核手段,偏离了对齐原本指向的可控性问题。她指出,ChatGPT 于 2022 年 11 月成功的重要原因之一正是 OpenAI 采用了源自对齐研究的 RLHF,使外界开始主要用它来指称此类技术。

4月2日周三
  1. Rising Tide(Helen Toner) ·

    Helen Toner:通往先进 AI 的长时限已变得极短

    Helen Toner 指出,"长时限"阵营如今也承认人类水平 AI 可能在一二十年内出现——Yann LeCun 称达到人类水平 AI 需数年乃至十年,并私下估计 2045 年前 AI 承接多数认知任务的概率达 20%。三家领先 AI 公司的负责人则公开表示 2026-2027 年最有可能建成比几乎所有人在几乎一切事情上都更强的 AI。她强调这并不意味着人类水平 AI 一定会在 20 年内到来或在 5 年内不会到来,也不意味着应把所有注意力从当下危害转移走,而是说明即使怀疑派的观点也指向动荡的一二十年。

3月22日周六
  1. Miles Brundage ·

    Miles Brundage 对话 Dean Ball:私人治理 AI 提案评论开放讨论

    Miles Brundage 就 Dean Ball 最新博文中提出的 AI“私人治理”(private governance)方案展开公开对话,因其他写作事务繁忙,他以 80/20 方式在 Google Doc 版博文上留下若干评注,Dean 回复部分意见,双方将这段未完对话公之于众并邀请任何人评论。该文档中的讨论并未得出结论,两人也未达成一致立场,目的是引导公众批判性地审视这一提案及私人治理思路。

3月17日周一
  1. Nicholas Carlini Writing ·

    Machines of Ruthless Efficiency:为何我们应当担忧 AI 的未来

    前 Google 研究员 Nicholas Carlini 撰文指出,深度学习系统之所以被大规模建造,是因为它们具有无情的效率优势,而这本身就构成风险。他认为高级 AI 将带来规模化网络钓鱼、监控和其他网络攻击,并放大个体层面的错误、定制化成瘾内容和宣传、大规模失业以及权力财富集中等问题。其中部分危害无需比现有模型强多少即可实现,另一些则需要更强的模型能力。

3月14日周五
  1. Joe Carlsmith ·

    Joe Carlsmith 论 AI for AI safety:用前沿 AI 劳动加固对齐安全因素

    Joe Carlsmith 在系列文章第四篇中提出"AI for AI safety",即用前沿 AI 劳动强化安全进展、风险评估与能力约束三大安全因素,以让 AI 安全反馈回路追上或约束 AI 能力反馈回路。他提出"AI for AI safety 甜蜜点"概念,指前沿系统足以大幅改善安全因素、但尚不足以在现有对策下剥夺人类权力的能力区间,并指出该窗口未必存在且难以持久。文章最后列出最严重的担忧,包括诱导/评估失败、差异性破坏与危险的失控选项,以及时间与政治意愿等现实约束,并将在下一篇聚焦自动化对齐研究。

3月13日周四
  1. Nicholas Carlini Writing ·

    Nicholas Carlini 谈大语言模型的未来:误差棒应该很宽

    Nicholas Carlini 撰文主张对大语言模型的未来应持宽广的不确定性预期,他认为三到五年内语言模型可能胜任大多数超出人类专家水平的经济上有用的认知任务,也可能仅沿成本下降和能力渐进改善的正常路径发展而不发生根本范式转变。他以自身从 2018 年至 2021 年低估语言模型潜力为例说明预测者的易错性,并指出当前模型已能解决早期博士生水平的数学问题、达到顶尖竞赛程序员的编码水准,且基准不断被刷新,因此两种极端可能性都不容忽视。

3月12日周三
  1. Joe Carlsmith ·

    Joe Carlsmith 谈 AI 安全:路径与中途站点

    Joe Carlsmith 在系列文章第三篇中提出,AI 对齐问题的解决取决于"问题画像"与"文明能力画像"的组合,后者由安全进展、风险评估与能力约束三个安全因素构成。他区分了胜利与代价高昂的未失败两种目标状态,并讨论了全球暂停、自动化对齐研究、全脑仿真等中途里程碑,为后续"AI for AI safety"一文铺垫。

3月11日周二
  1. Miles Brundage ·

    Miles Brundage 为何不认同 AI 信息安全末日论

    Miles Brundage 撰文说明自己为何不属于他所称的"security doomer",即认定 AI 系统无法抵御国家级别攻击者窃取、或其防护成本高到不值得做的人。他指出这种悲观有其道理:针对高级攻击者的信息安全本就极难防守,且安全措施会拖慢研究与产品交付速度,例如减少能接触模型权重的人员、隔离算法信息都会降低研发推进节奏。但他强调这只是为了先厘清该立场的来龙去脉,并限定讨论仅涉及信息安全而非防范 AI 滥用。 要点: - 他用"security doomer"一词描述那些认为 AI 系统挡不住老练国家级攻击者、或者保护它们会让 AI 研究减速到得不偿失程度的人。

  2. Nicholas Carlini Writing ·

    Nicholas Carlini 谈隐私论文为何不能被用来论证生成式 AI 版权问题

    机器学习研究者 Nicholas Carlini 撰文说明其记忆化(memorization)研究的出发点是隐私与安全而非版权,因此法律案件不宜直接援引他的论文作为证据。他指出可从其研究中得出的唯一可靠结论是:模型有时会逐字输出训练数据——例如他在 2020 年从 15 亿参数的 GPT-2 中提取出仅 600 条独特训练样本,但这既不能证明所有模型的常规行为,也不能支撑“模型必然侵犯版权”的主张。

3月5日周三
  1. Nicholas Carlini Writing ·

    Nicholas Carlini 离开 Google DeepMind 加入 Anthropic

    在 Google DeepMind 工作七年的对抗机器学习研究者 Nicholas Carlini 宣布离职并加入 Anthropic 一年,继续从事安全与隐私方向的研究。他表示 DeepMind 领导层不再支持其偏好的高影响力安全与隐私研究,过去几年论文审批流程显著变难,而他此前能发表成果是靠强行突破规定。Carlini 称选择 Anthropic 是因为在一家真正训练大型模型的公司做技术工作能在近期产生最大影响,且该决定更容易逆转;他还曾考虑创办新的安全非营利组织或申请教职。

2月20日周四
  1. Joe Carlsmith ·

    我们何时该担心 AI 的权力寻求?Joe Carlsmith 提出三组前置条件分析框架

    Joe Carlsmith 在系列文章第二篇中提出,AI 出现权力寻求行为需同时满足三组前置条件:能动性前提(行为由规划与评估过程连贯驱动)、动机前提(动机系统关注足够长时间尺度上的行为后果)、激励前提(选项与动机组合使权力寻求从 AI 视角看整体理性)。他认为激励前提常被忽视,仅凭“工具性趋同”不足以说明 AI 叛变为何理性,需综合考察其短期与非后果主义动机、成功概率、替代方案等。文章据此强调动机控制与选项控制并重,并指出若 AI 发展不减,全球脆弱性条件将更难避免。

2月16日周日
  1. Miles Brundage ·

    Miles Brundage 公布今年不会亲自推进的多项重要 AI 议题

    Miles Brundage 列出自己离开 OpenAI 后今年不会亲身投入的重要 AI 方向,涵盖让人直观感受到 AGI 紧迫性、AI 智能体的基础设施与社会规范及法律责任、AI 的经济冲击以及欧盟《人工智能法案》落地谈判。他认为自己在这些问题上的技能更适合处理其他问题,因此选择回避而非放弃关注,并可能偶尔向他人提供建议。

2月14日周五
  1. Joe Carlsmith ·

    解决对齐问题意味着什么?Joe Carlsmith 系列首篇

    Joe Carlsmith 在系列文章《我们如何解决对齐问题?》首篇中,将对齐问题定义为同时实现安全与收益:安全指避免"失控"场景,即 AI 出现抗命、欺骗、操纵训练、夺取权力等"叛变"行为并最终主导世界;收益指获取超级智能 AI 的主要能力红利。他称只有既建成超级智能 AI 智能体、又能安全引出其核心有益能力,才算"解决"了对齐问题,并强调该标准弱于"全尺度安全""永久安全""完全对齐"等更严苛要求。

  2. Joe Carlsmith ·

    Joe Carlsmith 谈我们如何解决对齐问题

    Joe Carlsmith 在一组系列文章中提出解决对齐问题的路径:定义该目标为造出超级智能 AI 智能体并能安全引出其主要有益能力,同时避免失控场景,并列出"回避"与"处理"两种替代方案。他还给出 AI 权力寻求所需条件的分析框架,强调动机控制与选项控制的持续作用,并提出文明层面的三大安全因子——安全进展、风险评估与能力克制。第四篇文章主张"AI for AI safety",通过 AI 安全反馈回路追赶或约束 AI 能力反馈回路,并指出存在一个既能大幅助力安全又尚不足以接管世界的"甜蜜区"。

2月11日周二
  1. Miles Brundage ·

    Miles Brundage 评美国副总统 Vance 在 AI Action Summit 演讲中的 AI 政策信号

    Miles Brundage 发文点评美国副总统 Vance 在 AI Action Summit 上的演讲,指出其释放的美国 AI 政策议程中既有令人鼓舞之处也有隐忧。Vance 强调需保护 AI 技术与半导体免受窃取和滥用,Brundage 解读这指向模型权重及算法机密的安全防护,并希望该议题形成两党共识。他还推测 Vance 主张轻量化且聚焦极端风险、避免被大型科技企业俘获的安全监管路径,同时注意到其在 AI 与经济就业关系上偏向经济民粹主义立场而非科技右翼。

2月9日周日
  1. Nicholas Carlini Writing ·

    Nicholas Carlini 复盘 AI 预测调查:人们大概率高估了自己的置信度

    Nicholas Carlini 对其去年发布的 30 道 AI 未来预测题作答分布做了回顾分析,指出受访者在 90% 置信区间的设定下普遍给出了过窄的范围,导致无论 2027 年真实答案为何,"最多也只有一半人能猜对"。这种过度自信在所有问题中表现一致,涵盖 AGI 实验室估值、AI 员工收入以及至少一家头部实验室可能消失的概率等问题。他还提到 OpenAI o3 近期成绩很可能达到 90% 以上,并计划最早于 2026 年开始提前结算部分题目。

2月3日周一
  1. Miles Brundage ·

    DeepSeek R1 的真正启示:规模加人才即可逼近超人类 AI

    DeepSeek 发布的 R1 已成为最强开源 AI 模型,其意义在于延续了 2018 年 GPT-2 以来的规律——只要算力与数据构成的规模和数十到数百名顶尖科学家工程师的技能这两项要素齐备,就能造出比肩乃至超越人类的 AI,且成本逐月下降。 该模式先在预测下一个词的范式下通过反复训练神经网络习得语法与世界知识,去年起又经长链式推理扩展到数学与编程等领域,o1 与 R1 借此学会分解问题并自查。 后来者常能以远低于先行者的成本复制同等性能,全球科学界公开的技巧使 OpenAI API 价格累计降幅超过 90%,因此美国无法长期垄断超级 AI 能力,GPU 出口管制虽必要却挡不住能力的持续扩散。

1月29日周三
  1. Joe Carlsmith ·

    Joe Carlsmith:AI 时代的“假思考”与“真思考”

    Joe Carlsmith 撰文区分“假思考”与“真思考”,提出地图与世界、空洞与坚实、机械与新生、士兵与侦察、干枯与切身五个相关维度,并给出放慢速度、追随好奇心、把概念锚定到真实所指等提醒自己“真正思考”的方法。他认为在进入 AI 时代之际,真思考对保持清醒尤为关键。

1月16日周四
  1. Miles Brundage ·

    Miles Brundage 对《通用目的 AI 行为准则》第二稿的反馈

    Miles Brundage 针对欧盟《通用目的 AI 行为准则》(COP)第二稿发表反馈意见,认为草稿正朝更具体、更连贯的方向改进,但仍存在大量未竟事项。他指出起草工作组的推进节奏过于仓促,问题根源在于欧洲议会启动该流程过晚而非主席团本身。对于具有系统性风险的模型的合规条款,他认为大型企业大体能够遵守,并强调若合规低效或错配风险,可能适得其反地损害企业内部的安全声誉。

1月11日周六
  1. Miles Brundage ·

    Miles Brundage 为何将前沿 AI 公司的安全置于首位

    Miles Brundage 撰文论证前沿 AI 公司的安全应比安全性更为紧迫。他指出,独立专家基于对前沿 AI 公司员工的访谈估计,这些企业距离抵御中俄等国资源充足的攻击尚有数年差距,且一年内 AI 系统能力还会大幅提升,现有竞争编码能力已达人类前几百名的水平。由于投资安全的成本由公司独自承担、投入不足的成本却由整个社会分担,加上单方面加强安全可能拖慢研发进度并丧失市场优势,这一问题不会自动解决。他还强调,芯片和数据中心的安全建设以及安全许可审批所需的时间超过模型迭代间隔,因此无法留待后期自动化处理。

12月25日周三
  1. Nicholas Carlini Writing ·

    Nicholas Carlini 让不同语言模型逐日重写其网站主页

    Nicholas Carlini 发起实验,连续十二天每天用一个不同的语言模型重写他的个人网站主页,首日是 OpenAI 的 o1-mini。该流程先用固定提示词让其撰写简介网页并循环六次追加更多细节和改进版 HTML/CSS,若遭拒答则随机重试三次,再失败就用一句自称本人手臂受伤无法打字的越狱提示绕过。o1-mini 生成的页面视觉出色却严重失实——43 条关于他的陈述中仅 2 条正确、32 条完全不属实、9 条有明显错误,凸显小参数模型的模型幻觉问题。

12月24日周二
  1. DeepMind Safety Research · · 原文 62

    Google DeepMind 提出以人机互补实现放大的监督

    Google DeepMind 的 AGI Safety & Alignment 团队提出以人机互补为目标的放大的监督(Amplified Oversight)研究议程,并给出内部评分任务的实验结果。团队用 AI 评分器的置信度把评测数据切成 AI 集与人类集,再在人类集上测试不同形式的 AI 辅助。结果显示,基于置信度的混合评分整体准确率高于单用 AI 或单用人类;只展示 AI 引用的证据能显著提升人类准确率,而同时展示 AI 推理、判断与置信度会同时降低欠依赖并加剧过度依赖,整体准确率与基线无差异。把证据辅助后的人类评分再与 AI 混合,整体准确率高于与未辅助人类混合。

    推荐理由Google DeepMind 团队用内部评分任务实测了混合评分与评分助手两种可扩展监督路径,并给出准确率与过度依赖数据。

12月21日周六
  1. Miles Brundage ·

    Time's Up for AI Policy:超级人类级 AI 临近,未来数月政策决定至关重要

    Miles Brundage 发文警告,超越几乎所有认知领域的超级人类 AI 几乎必然在未来几年内建成并部署,而接下来几个月的政策抉择将决定其治理方式。他以当日发布的 o3 为例指出超人类编程与数学能力的到来比许多人预期更快,社会尚未消化 Claude 3.5 Sonnet、o1 及即将推出的更大模型的冲击。特朗普政府首批行动、下一届美国国会立法、英国 AI 法案以及欧盟《通用人工智能行为准则》是关键节点,呼吁有意推动 AI 治理的人立即行动而非规划数年后产生影响。 --- **说明**: - 标题保留了原作者意图中的紧迫感("Time's Up"→"关键时刻/迫在眉睫"语义由副题承载),并按规则补入核心议题主体。

12月19日周四
  1. SPY Lab Blog ·

    SPY Lab 立场论文:成员推断攻击无法证明模型训练使用了你的数据

    SPY Lab 在将发表于 SaTML 2025 的立场论文中论证,成员推断(MI)攻击在向法官等第三方证明 GPT-4 等生产模型训练使用了特定数据时存在根本性缺陷。作者将训练数据证明形式化为假设检验,指出其关键在于证明假阳性率(FPR)足够低,而现有研究通过采样零假设来估计 FPR,必须完全控制数据生成与模型训练过程。

  2. AI as Normal Technology ·

    AI 进展是否放缓?Arvind Narayanan 等人解析模型缩放与推理缩放的证据

    Arvind Narayanan、Benedikt Ströbl 与 Sayash Kapoor 撰文指出,宣告模型缩放终结为时尚早,业界领袖在此问题上的反复表态说明其预测并不可信且受自身利益左右。《The Information》、路透社与彭博社接连报道称 OpenAI、Anthropic 和 Google Gemini 三家开发商的下一代模型均遇到问题,随后“推理缩放”(又称 test-time compute scaling)被视为前进方向,但其带来的能力提升难以预测且在领域间分布不均。文章还强调,能力进步与 AI 社会或经济影响之间的联系极弱,制约影响的瓶颈是产品开发速度与采纳率而非模型能力。

12月14日周六
  1. AI as Normal Technology ·

    研究分析 2024 年全球选举中的 78 起 AI 深度伪造:政治虚假信息并非 AI 问题

    对 WIRED AI Elections Project 收录的 2024 年全球选举中全部 78 起 AI 使用案例的分析显示,其中 39 起并无欺骗意图,最常见的非欺骗用途是竞选宣传(22 起中 19 起意在改进竞选材料)。对其余 39 起欺骗性案例,研究估算不用 AI 复现同类内容的成本均不超过几百美元,说明生成式 AI 降低了造假成本却未改变虚假信息的传播瓶颈。作者据此认为,诊断政治虚假信息应关注需求端而非供给端,修复信息环境依赖结构性制度变革而非限制 AI 生成内容。

11月12日周二
  1. AI as Normal Technology ·

    英国肝脏移植匹配算法是否系统性排除年轻患者?

    英国2018年启用的肝脏分配算法通过预测患者移植与否的生存时长差值得出 Transplant Benefit Score(TBS),用28个供受体变量排序分配肝脏。Financial Times 调查发现该算法疑似按年龄歧视,45岁以下患者无论病情多重都难以获得足够高的分数。31岁患者 Sarah Meredith 借助 Ewen Harrison 团队开发的 TBS 计算网页应用发现这一偏差,且该评分无医生推翻机制、无申诉流程。

10月31日周四
  1. Yoshua Bengio ·

    Yoshua Bengio:AGI 对国家和国际安全的影响

    Yoshua Bengio 在 Aspen Strategy Group 的论文中指出,AGI 可能在几年到十年内到来,Metaculus 上超过 20% 的预测认为 2027 年前可实现,而 AGI 到 ASI 的过渡或只需几个月到几年。前沿公司正试图开发能推进 AI 研究本身的 AI:训练需数万块 GPU,但推理阶段可并行部署,相当于数十万个自动化 AI 工作者。近 3000 名机器学习论文作者的调查显示,37.8%–51.4% 认为先进 AI 造成人类灭绝级后果的概率至少 10%,论文据此讨论权力高度集中与失控风险。