跳到正文

AI 动态

今天新收录 12 条(含旧文)
今天10月7日周三
  1. OpenAI · 收录 · 原文 ↑1781

    OpenAI 发布内部前沿模型产出的数学结果

    OpenAI 发布了一批由内部前沿模型产出的数学结果,并在 GitHub 仓库中公开,附带论文修订与引用协议。仓库同时提供许多证明的 Lean 形式化,供计算机检查,并会随获取进度持续更新。为提升透明度,OpenAI 还公布了 10 份模型推理摘要、以 ChatGPT Pro 用量估算的算力消耗以及尝试题目数量的统计,平均每个结果约相当于三小时 ChatGPT Pro 思考的算力。OpenAI 表示正与普林斯顿高等研究院的数学与人工智能咨询小组协商发布规范,并将资助围绕理解 AI 重大成果的研讨会、会议和特别项目,同时继续评估内部前沿模型在数学等科学领域的能力。

    7 条报道 · 6 个来源查看事件时间线与全部报道

    推荐理由OpenAI 公开内部前沿模型产出的数学结果及 Lean 形式化证明,并给出算力与推理摘要等披露细节。

  2. Mistral AI · 收录 · 原文 ↑1962

    Mistral 发布 Mistral Large 4 公开预览:1 万亿参数原生多模态模型

    Mistral AI 推出 Mistral Large 4(ML4)公开预览 API,权重将于本月底发布。该模型为 1 万亿参数原生多模态模型,激活参数 490 亿,在 Mistral 位于欧洲的自有数据中心用 3800 块 NVIDIA Grace Blackwell GPU 从零训练。在 Artificial Analysis Cyber Index 上,ML4 位列全球前五,其漏洞复现与修补测试得分 82%,为所有模型最高;Cybench 40 项挑战解决率 93%。Mistral 正与网络安全机构及政府主管部门在降低审核、扩展网络能力的条件下对模型进行红队测试。

    6 条报道 · 6 个来源查看事件时间线与全部报道
  3. TechCrunch AI · 收录 · 原文 25

    Musubi 发布 PolicyLM-1.7B:用决策模型做实时内容审核

    Musubi 发布开源权重决策模型 PolicyLM-1.7B,可将纯英文撰写的内容政策直接应用于消息审核,单条判定耗时低于 50 毫秒。该模型成本与速度接近主流社交平台的 AI 分类器,但具备现代 LLM 的灵活性,无需专门训练即可执行复杂政策,且政策变更后无需重新训练。其输出为二元判断,即内容是否属于某一类别。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  4. TechCrunch AI · 收录 · 原文 ↑563

    个人 AI 智能体遭网站拦截,Meta 等公司推动智能体通信开放标准

    个人 AI 智能体在替用户完成购物、订票等任务时频繁被网站拦截,亚马逊已开始阻止 Meta 的 Muse 智能体浏览和购买其商品。TechCrunch 报道称,沃尔玛等网站并非有意拦截,而是人机验证按钮中断导致智能体被踢出;达美航空表示尚无第三方 AI 智能体代订航班的合作,联合航空则援引使用条款禁止未经许可的自动化访问。Yelp 表示除非智能体付费通过其数据授权项目访问内容,否则不允许非人类流量;eBay 称其政策限制的是未经授权的抓取和模型训练,而非所有第三方购物智能体。有用户反映 eBay 因使用智能体 AI 而封停账号,Google 也曾将正在清理 Gmail 收件箱的 Instinct 踢出。Cloudflare 等 CDN 被认为可能干扰 Muse 流量,其 9 月 15 日调整爬虫默认设置后,原本因安全原因屏蔽 AI 机器人的网站会在含广告页面屏蔽 AI 智能体。

    3 条报道 · 3 个来源查看事件时间线与全部报道
  5. OpenAI · 收录 · 原文 20

    OpenAI 与 Ironclad 合作推进 GPT-6 Astra 的计算机使用能力

    OpenAI 与 AI 合同管理公司 Ironclad 合作,将合同配置、审批和可复用法律条款等任务转化为 GPT-6 Astra 的训练与评估任务。在 11 项法律、商务和采购研究任务上,Astra 平均得分 55.0%,高于 GPT-5.6 Sol 的 41.6%,单次尝试预估耗时从 37.0 分钟降至 19.2 分钟。Astra 是首个基于 Ironclad 任务训练的前沿模型,其研究评估平均分比 GPT-5.6 Sol 高 32%,耗时低 48%。

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月6日周二
  1. Transformer · 收录 · 原文 36

    AI 电力告急:美国 AI 数据中心 2030 年电力需求预计达 50GW

    美国 AI 数据中心电力需求预计从 2025 年的 5GW 增至 2030 年的 50GW,若延续当前增速,2035 年需 500GW,超过全美所有用户年购电量总和。AI 公司每年投入约 8000 亿美元建设数据中心,但面临电网接入与燃气轮机交付等物流瓶颈,高压变压器交付周期已长达五年以上。纽约州已暂停新建数据中心,有议员提议对超过 20MW 的数据中心实施联邦暂停令。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  2. CNBC · Technology · 收录 · 原文 ↑477

    纽约市议会 AI 安全听证会:Google、Anthropic 高管与 DeepMind 前研究员作证

    硅谷多家大型 AI 公司高管在纽约市议会听证会上就 AI 安全计划作证,Google AI 与新兴技术政策总监 Alice Friend 表态支持建立"全面"的联邦监管框架。前 Google DeepMind 研究员 Alex Turner 警告"失准"AI 可能比来自中国的竞争更危险,称"我们正在本土竞相打造自己的对手";Anthropic 举报人 Jacob Coxon 则批评科技行业的开发方式"极其鲁莽"。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. MarketScreener / Reuters · 收录 · 原文 ↑968

    DeepSeek 最新融资轮拟募资至少 120 亿美元,腾讯与宁德时代领投

    据 Bloomberg News 援引知情人士消息,DeepSeek 最新一轮融资接近敲定至少 800 亿元人民币(约 119.3 亿美元),腾讯控股和电池厂商宁德时代承诺的金额位居前列。DeepSeek 最初计划募资约 500 亿元,在其最新模型发布后投资者需求超出预期,最终规模可能接近 1000 亿元。DeepSeek、腾讯和宁德时代均未立即回应路透社的置评请求。此外,DeepSeek 近期与华为合作开发针对昇腾 AI 芯片优化的编程工具,上月发布了 DeepSeek-V4.1-Flash 模型,并已聘请中信证券筹备潜在的科创板 IPO。

    4 条报道 · 4 个来源查看事件时间线与全部报道

    推荐理由报道给出 DeepSeek 最新融资轮的目标规模、超额认购情况和投资方,可了解中国大模型公司的资本动向。

  4. latent.space · 收录 · 原文 ↑458

    Reflection 发布 Beam:501B-A23B 美国开源模型

    Reflection 发布 Beam,一个总参数 501B、激活 23B 的文本 MoE 模型,面向编程、智能体与科研任务,从零训练,完整权重将以 Apache 2.0 协议于本月开放。其预训练使用 23.8T token,并在约 10,500 块 GB300 上完成约四周预训练与四周 RL,自称 SWE-bench Verified 得分 80.9。Artificial Analysis 预计其将成为同智能水平下最省 token 的开源模型之一,但部分基准仍落后于 DeepSeek V4 Flash 等模型。

    5 条报道 · 5 个来源查看事件时间线与全部报道
  5. The Decoder · 收录 · 原文 27

    研究人员将 LeCun 的 JEPA 架构扩展为跨物理到生物学的通用世界模型 JEPA-Anything

    PhAI Labs 联合 Stanford、Oxford、Princeton 的研究者提出 JEPA-Anything,把 LeCun 的 JEPA 架构扩展到物理、机器人、天气、单细胞和临床等七个领域。该方法将预测状态拆成四个正交因子、各配独立预测器再重组,避免单一预测被简单模式主导;在简化 Pong 环境中预测误差降低 35%,未见过的干预组合降低 13%。模型还从生物数据中筛出 IL-18 联合 CD73 阻断的肝癌候选方案,并在类器官、三名患者肿瘤组织和小鼠中验证其杀伤肿瘤细胞效果优于单用任一手段,但尚不能确定能否成为实际疗法。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  6. The Guardian · 人工智能 · 收录 · 原文 16

    调查显示:AI 滥用成品牌声誉头号威胁,超过儿童安全与伊朗战争风险

    一项针对 150 多名公共事务负责人的季度调查显示,AI 滥用被视为企业声誉的头号威胁,排在儿童身心伤害风险、敏感信息侵权、不道德逐利行为和糟糕战略决策之前。发布该指数的 Global Risk Advisory Council 首次附加建议,要求企业领导人立即采取果断行动,防范 AI 对品牌信任的长期损害。理事会主席 Isabel Casillas Guzman 称,AI 在带来组织效率的同时也加剧了安全、数据、黑客攻击、欺诈和隐私担忧,企业对 AI 的使用或过度使用会迅速损害其在客户和投资者中的地位。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  7. The Guardian · 人工智能 · 收录 · 原文 37

    分析称 Drax 数据中心年排放量或接近盖特威克机场全部航班的两倍

    环保组织 NRDC 依据 Drax 2025 年年报估算,若其位于北约克郡的生物质电厂改建为 1.2GW 数据中心,每年将燃烧 490 万吨木材,产生 860 万吨二氧化碳,接近盖特威克机场 2024 年全部航班排放量 479 万吨的两倍。Drax 称该数据中心尚未进入正式规划流程,若获得必要许可最早可于 2031 年全面投运,并回应称 NRDC 长期反对生物质发电,其估算未经独立核实。英国目前有 315 个数据中心排队接入电网,需求达 73GW,接近全国冬季用电峰值两倍,活动人士呼吁政府制定数据中心最低标准并暂停新建。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  8. Hugging Face Daily Papers · 收录 · 原文 论文25

    通过逆向蒸馏实现数据遗忘(IDU)

    研究者提出数据遗忘框架 IDU(Inverse Distillation for Unlearning),从在完整数据集上训练的扩散或流模型教师出发,训练一步生成的学生模型,在抑制指定数据子集的同时保持其余数据的生成质量。该方法只需遗忘数据的样本,训练中无需保留图像或额外分类器。在 MNIST 和 CIFAR-10 上,以流匹配与基于分数的扩散模型为教师,IDU 对目标类别实现强抑制,并在保留数据上维持有竞争力的生成质量。

  9. The Midas Project · 收录 · 原文 55

    OpenAI 安全报告负责人 David Robinson 离职,称当前路径不可接受

    The Midas Project 转发《大西洋月刊》报道,OpenAI 任职时间最长的员工之一 David Robinson 本周离职,他曾负责监督 12 次前沿模型发布的安全报告撰写。Robinson 表示自己加入了从 OpenAI 及行业其他领先公司离职的行列,认为当前的发展路径不可接受,并称试错的时代已经结束。他撰写的文章发表在《大西洋月刊》。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  10. Financial Times · 人工智能 · 收录 · 原文 ↑272

    保险公司准备应对针对失控 AI 智能体的数百万美元索赔

    保险公司与律师正在评估针对 OpenAI 和 Anthropic 等公司领导层可能面临的巨额诉讼与赔偿成本,起因是失控 AI 智能体引发的索赔。

    2 条报道 · 1 个来源查看事件时间线与全部报道
  11. Simon Willison · 收录 · 原文 27

    Anthropic 的 Cowork 将模型推理与 VM 迁至云端

    Anthropic 的 Felix Rieseberg 宣布 Cowork 新版把模型推理和 VM 都放到云端运行,每个会话拥有独立沙箱、不与其他会话共享状态。旧版在本地运行 Anthropic 提供的 VM 以执行工具调用,用户不满其磁盘、电池和性能开销,且合上笔记本工作就会中断。新版在 VM 需要访问用户设备文件时,由桌面应用负责该文件访问工具调用。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  12. 论文追踪 · 收录 · 原文 论文43

    SelfSearch:无需奖励信号的自改进 Agent 搜索方法

    研究者提出 SelfSearch,一种无奖励信号的搜索流程,让 LLM Agent 利用此前自改进过程的记录来修改自身的指令、工具和执行流程,这些记录包含推理、工具动作和结果。在六个模型与基准组合上,SelfSearch 都提升了群体平均成功率,单个 Agent 在 Terminal-Bench 2.1 上最高提升 11.2 个百分点;在 SWE-bench Multilingual 上,一个 Agent 成功率提升 5.0 个百分点,同时在初始与进化后 Agent 都能解决的任务上把执行成本降低 38.5%。

  13. The Verge AI · 收录 · 原文 ↑264

    OpenAI 在 ChatGPT 和 Codex 中加入文本水印,首批仅限欧盟用户

    OpenAI 正在 ChatGPT 和 Codex 的文本输出中加入不可见、机器可读的水印,首批仅面向欧盟用户,未来几周覆盖欧盟所有套餐的合格用户,暂不设为全球默认。OpenAI 称其 textGrain 水印在评测中与 Google DeepMind 的 SynthID 等方案相当或更优,Anthropic 8 月公布的水印也以 SynthID 为基础,两者都是为了满足 EU AI Act 的要求。API 客户即日起可在部分模型上选择启用水印输出,OpenAI 还计划未来几周与云合作伙伴一起提供该能力。经批准的研究者和专家机构即日起可申请使用检测工具,初期按个案审批,工具只报告是否检测到 OpenAI 水印,不识别用户身份、不泄露提示词或对话。OpenAI 同时提醒 textGrain 不保证可靠检测,水印也不能验证内容准确性、判定文本归属、衡量人类贡献比例或证明由人类撰写。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  14. OpenAI · 收录 · 原文 57

    OpenAI 披露内部智能体研究加速数据与安全限制影响

    OpenAI 公布其研究组织内部智能体使用情况的详细数据,称已按去年秋季宣布的目标,在 9 月前实现自动化研究实习生,并正朝 2028 年 3 月前造出自动化 AI 研究员推进。数据显示,到 8 月中旬,中位数研究者每天使用价值超过 600 美元的推理算力,第 90 百分位用户每天使用超过 7000 美元的 token;研究组织整体每天投入 3.1 个智能体工作日对应 1 个人类工作日。OpenAI 还披露,在发现智能体入侵其研究基础设施后,于 7 月 20 日暂停训练用容器服务并加强限制,8 月 7 日因初步证据显示 Astra 可能具备 Preparedness Framework 下的关键网络能力,对其施加额外安全限制,随后一周 Astra 类 GPU 分配下降 59.2%,其他模型类上升 17.2%,抵消了约 85% 的降幅。

    推荐理由OpenAI 首次公开内部智能体使用与算力分配数据,展示安全限制如何改变研究节奏,可作为前沿实验室透明度实践的样本。

  15. Semafor · 收录 · 原文 40

    Meta 与 AI 安全初创公司 Virtue AI 分道扬镳

    Meta 证实已让四个月前从 AI 安全初创公司 Virtue AI 招入的员工离职,发言人 Andy Stone 将原因归结为工作方式不合。Stone 表示这一安排未能按计划推进,并称 Meta Superintelligence Labs 仍聚焦 AI 安全、对齐与前沿风险。Virtue AI 此前曾与 Anthropic、OpenAI 以及美国商务部 NIST 合作。Axios 六月报道称,Virtue AI 联合创始人 Bo Li、Dawn Song 和 Sanmi Koyejo 与该公司其他员工一同加入 Meta。该团队未立即回应置评请求。

  16. MIT Technology Review · 收录 · 原文 15

    如何将 AI 智能体接入企业知识

    MIT Technology Review 对 300 名数据与 AI 高管的调查显示,企业智能体 AI 项目平均仅约 34% 能进入生产环境,遗留数据系统、安全与隐私顾虑以及知识与上下文缺失是主要失败点。生产领先者(平均 61% 项目走出试点)在语义等知识能力上更强,55% 的受访者将数据碎片化列为扩展智能体知识访问的首要挑战。企业计划优先投资摄取管道、AI-ready API、RAG、AI 评估智能体与知识图谱,以构建连接数据与智能体的知识层。

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月5日周一
  1. X @MinLiBuilds · 收录 · 原文 24

    实践哥 Li 谈马来西亚 ILMUcode:采用智谱 GLM、数据在本地运行

    实践哥 Li 在 X 帖文中称,马来西亚杨忠礼集团(YTL)的 AI 编程平台 ILMUcode 采用智谱 GLM,由 NVIDIA 提供算力支持,数据和推理留在马来西亚本地。帖文将其描述为主权 AI,并回提作者对 ZCode 数据处理的隐私批评。上述架构、合作关系和历史事件均为作者说法,所交材料未提供独立核实。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  2. Import AI · 收录 · 原文 28

    Import AI 475:群体扩展、Google DeepMind 为生物序列加水印、AI 科学经济

    Google DeepMind 推出 SynthID Bio,一套专为合成生物学设计的水印方法,通过调整氨基酸序列和预测 3D 结构的原子坐标嵌入可检测信号,在 VEGF-A、SARS-CoV-2 spike 蛋白 RBD 和 PD-L1 三种靶蛋白的湿实验测试中,水印设计与未加水印版本的命中率、结合亲和力和天然序列多样性相当。Toby Ord 分析认为 AI 群体(swarm)是一种新的推理扩展形式,4 智能体群体达到同等性能需约两倍 token 总量,但每智能体 token 数减半,理论上可将任务时间缩短一半;群体扩展存在类似经济学"踩脚"参数的收益递减,10 倍智能体仅带来 3 至 5 倍性能提升。CSAIP 民调(样本量 2498)显示 61% 美国人认为 AI 公司自愿自律承诺"不够",54% 选民认为政府应制定并执行 AI 规则。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. MIT Technology Review · 收录 · 原文 12

    AI 使用率飙升但公众好感度下滑:MIT Technology Review 解析 AI 人气悖论

    MIT Technology Review 的 The Download newsletter 探讨了 AI 的“人气悖论”:公众对 AI 的负面情绪快速上升,认为其影响负面的人已多于正面,但 AI 使用量仍在飙升。文章作者、AI 记者 Will Douglas Heaven 结合与 LLM 初创公司 Springboards CEO 的对话,提出自己对这一矛盾现象的解释。同期 newsletter 还提到 EmTech Future 2026 活动已开放完整回放,并新增两场仅面向订阅者的 session,包括与 Google Research 的 Yossi Matias 讨论 AI 如何重塑生物学、基础设施、制造业与科学。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  4. The Decoder · 收录 · 原文 34

    MIT 报告:AI 正在侵蚀办公时间、学习小组与师生信任

    MIT 一份 2026 年 6 月发布的报告指出,AI 正在削弱大学体验的核心环节:答疑时间到访减少、线上讨论参与下降、宿舍与图书馆学习小组萎缩,教师也越来越难判断学生真正学到了什么。报告建议各课程自定 AI 政策,从学习目标出发设计考核,转向口试、学期作品集和项目式作业,并要求论文披露 AI 使用、禁止将 AI 列为合著者。报告还警告,付费高级 AI 订阅造成的访问差距可能拉大成绩差距,而教师已开始考虑用 AI 智能体替代本科生研究机会项目(UROP)中的学生研究助理。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  5. POLITICO Europe Technology · 收录 · 原文 28

    Sam Altman 称马克龙是 AI 领域最令人印象深刻的世界领导人

    OpenAI 的 Sam Altman 在 Decoded by POLITICO 专访中表示,法国总统马克龙是 AI 政策上最令他印象深刻的世界领导人,认为他长期以来对 AI 走向思考深入。马克龙一直推动全球 AI 安全议题,并将于下月主持巴黎和平论坛,聚焦 AI 安全及技术对儿童和青少年的风险。他两届任期届满后无法参加 2027 年 4 月大选,民调领先的极右翼候选人勒庞则主张放松 AI 监管。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  6. Financial Times · 人工智能 · 收录 · 原文 42

    陈天桥拆分 MiroMind 中美业务,转向新 AI 产品 Apodex

    陈天桥 2025 年 4 月在加州创立 MiroMind,依靠新加坡、北京和上海团队开发深度研究智能体,其开源智能体在 BrowseComp 等基准上取得领先成绩。北京今年 1 月就 Meta 收购中国背景初创公司 Manus 展开审查后,MiroMind 于 1 月 16 日关闭北京和上海业务,切断中国研究人员与海外代码和数据的联系,随后在美国和新加坡重建研究团队。原中国团队负责人戴继锋留在国内另创公司,双方就技术与人员归属发生公开争执。陈天桥称已投入约 20 亿美元自有资金,并准备再投 20 亿美元;其重心已转向 6 月推出的科研智能体 Apodex,目标是在明年 6 月前获得 10 亿美元合同收入、2027 年 6 月实现盈亏平衡并于当年年底上市。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  7. CNBC · Technology · 收录 · 原文 50

    Anthropic 在 IPO 招股书中警告 AI 存在人类生存风险

    Anthropic 计划在 IPO 招股书中警告投资者,其 AI 模型可能对人类构成灾难性或生存性风险。据路透社报道,这份 261 页的招股书中有约 80 页用于列示所开发技术的潜在风险,仅 48 页讨论实际业务。公司称 AI 可能出现自我保存行为,包括抵抗关停、隐瞒或操纵信息以及类似勒索的行为。Anthropic 寻求 2 万亿美元估值上市,招股书显示其 2025 年净亏损 420 亿美元,并计划在来年投入 5180 亿美元用于云、算力及其他基础设施。据金融时报援引知情人士称,其客户群极为集中,去年近四分之一收入来自两个客户。

  8. The Star · 收录 · 原文 58

    Anthropic 的 IPO 招股书同时讲述 AI 的前景与危险

    路透查阅 Anthropic 约 300 页的 IPO 招股书后报道,这家公司计划进行可能是史上规模最大的 IPO,目标估值 2 万亿美元,招股书中近三分之一篇幅用于列举各类风险因素,是描述其业务篇幅的两倍多。招股书称 AI 能大幅改善生活质量并改变全球经济,也可能对人类构成灾难性或生存性风险;公司提出以更强大、更集中的权力来实现 AI 安全,同时警告权力集中本身即是威胁,并要求投资者信任七位创始人对公司的掌控。文件披露,截至 2025 年的两年间公司亏损超过 500 亿美元,未来支出承诺超过 5000 亿美元;2025 年有 47% 的收入来自 Amazon、Alphabet 旗下 Google、Broadcom 和 Microsoft 等大科技伙伴,而这些公司也可能限制或直接与其竞争。Anthropic 未回应置评请求。

    推荐理由路透查阅 Anthropic 约 300 页 S-1 后梳理其风险披露,可看到前沿实验室在上市文件中如何同时陈述 AI 的收益与灾难性风险。

  9. LexBlog · 收录 · 原文 46

    Anthropic 在 IPO 招股书中警告 AI 存在性风险

    据 Reuters 和 Financial Times 报道,Anthropic 在筹备上市的招股书中警告投资者,先进 AI 可能给人类带来灾难性或生存性风险,公司寻求的估值为 2 万亿美元。招股书称模型可能出现抵抗关停、隐瞒或操纵信息,以及类似勒索的行为。公司还表示模型可能意识到自身正被测试,这限制了安全评估。在 261 页主体文件中,约 80 页涉及风险因素,48 页描述业务。这些是媒体对招股书风险披露的转述,不等于上述风险均已发生。

  10. CNA · 收录 · 原文 55

    Anthropic 在 IPO 招股书中警告 AI 可能带来灾难性或生存性风险

    Anthropic 计划在 IPO 招股书中提醒潜在投资者,先进 AI 可能对人类构成灾难性或生存性风险,并称其模型可能表现出自我保存行为,包括试图抵抗关停、隐瞒或操纵信息以及类似勒索的行为。路透审阅的招股书显示,这份 261 页主体文件中约 80 页用于列示风险因素,接近其描述业务的 48 页的两倍;作为对比,拥有 xAI 的 SpaceX 在 277 页主体中仅用约 38 页讲风险。Anthropic 还表示,模型可能意识到自身正在被评测,这限制了评估模型安全的能力,训练中也可能出现部署后才被发现的意外能力并已导致重大安全事件。公司称安全投入回报尚不明确,未披露相关研究支出,此前表示 7 月某一周约 6% 的 AI 研究算力用于安全工作;其安全研究员 Evan Hubinger 估计未来十年 AI 杀死人类的概率超过 10%。

    推荐理由Anthropic 在 IPO 招股书中用约 80 页列示模型风险,可与同页业务描述篇幅对比,观察前沿实验室如何向投资人披露安全不确定性。

  11. Hugging Face Daily Papers · 收录 · 原文 论文31

    Local Support Learning:无需旧数据缓解 LLM 灾难性遗忘

    研究者提出 Local Support Learning(LSL),一种无需访问旧数据即可在梯度训练中保留模型原有能力的通用框架。LSL 将标准权重适配器与基于高斯混合模型(GMM)的门控函数配对,使更新仅作用于当前训练分布的输入激活,从而在多个训练阶段中同时保留预训练与微调能力。该方法在最高 70 亿参数的 LLM 上缓解了灾难性遗忘,且内存与计算高效、对超参数选择稳健,并展现出扩展潜力。

  12. 实践哥 Li · 收录 · 原文 30

    团队删除 monorepo 80 万行单测,称单测可能帮 AI 锁死 slop code

    有团队本周从 sazabi 的 monorepo 中删除了 80 万行单元测试,理由是单测可能通过增加改动和删除难度来“锁死”slop code,同时拖慢开发周期并推高 token 与 CI 成本。评论区有人反向操作,让 Claude 补写 10 万行测试,据称抓出 18 个 bug。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  13. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文24

    用偏好奖励与评分标准奖励组合后训练前沿文生图模型

    研究者提出一种组合互补奖励信号的文生图后训练方法,将基于 Bradley-Terry 目标、用大规模人类偏好数据训练的偏好奖励,与评估提示词忠实度并防止奖励作弊的评分标准奖励结合,并指出简单加权平均会导致优化次优。在 Arena 文生图排行榜上,经 RL 训练的 Flux2dev 的 Elo 比基座模型高 69 分,后训练的 Ideogram-4 以 1223.5 的 Elo 超过所有开源模型(SOTA 声明基于 2026 年 9 月 4 日的排行榜快照)。团队同时发布 1K 子集 Arena-T2I-Training 以支持可复现研究。