跳到正文

AI 动态

安全不是主角的 AI 圈大事:头部实验室的旗舰模型发布、重大融资并购和行业级事件。

151条动态与论文相关主题OpenAIAnthropic政策与监管
在这个话题内搜索或按分类筛选

新闻与论文

第 21–40 条 · 共 151 条
10月6日周二
  1. 论文追踪 · 收录 · 原文 论文43

    SelfSearch:无需奖励信号的自改进 Agent 搜索方法

    研究者提出 SelfSearch,一种无奖励信号的搜索流程,让 LLM Agent 利用此前自改进过程的记录来修改自身的指令、工具和执行流程,这些记录包含推理、工具动作和结果。在六个模型与基准组合上,SelfSearch 都提升了群体平均成功率,单个 Agent 在 Terminal-Bench 2.1 上最高提升 11.2 个百分点;在 SWE-bench Multilingual 上,一个 Agent 成功率提升 5.0 个百分点,同时在初始与进化后 Agent 都能解决的任务上把执行成本降低 38.5%。

  2. The Verge AI · 收录 · 原文 ↑264

    OpenAI 在 ChatGPT 和 Codex 中加入文本水印,首批仅限欧盟用户

    OpenAI 正在 ChatGPT 和 Codex 的文本输出中加入不可见、机器可读的水印,首批仅面向欧盟用户,未来几周覆盖欧盟所有套餐的合格用户,暂不设为全球默认。OpenAI 称其 textGrain 水印在评测中与 Google DeepMind 的 SynthID 等方案相当或更优,Anthropic 8 月公布的水印也以 SynthID 为基础,两者都是为了满足 EU AI Act 的要求。API 客户即日起可在部分模型上选择启用水印输出,OpenAI 还计划未来几周与云合作伙伴一起提供该能力。经批准的研究者和专家机构即日起可申请使用检测工具,初期按个案审批,工具只报告是否检测到 OpenAI 水印,不识别用户身份、不泄露提示词或对话。OpenAI 同时提醒 textGrain 不保证可靠检测,水印也不能验证内容准确性、判定文本归属、衡量人类贡献比例或证明由人类撰写。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  3. OpenAI · 收录 · 原文 57

    OpenAI 披露内部智能体研究加速数据与安全限制影响

    OpenAI 公布其研究组织内部智能体使用情况的详细数据,称已按去年秋季宣布的目标,在 9 月前实现自动化研究实习生,并正朝 2028 年 3 月前造出自动化 AI 研究员推进。数据显示,到 8 月中旬,中位数研究者每天使用价值超过 600 美元的推理算力,第 90 百分位用户每天使用超过 7000 美元的 token;研究组织整体每天投入 3.1 个智能体工作日对应 1 个人类工作日。OpenAI 还披露,在发现智能体入侵其研究基础设施后,于 7 月 20 日暂停训练用容器服务并加强限制,8 月 7 日因初步证据显示 Astra 可能具备 Preparedness Framework 下的关键网络能力,对其施加额外安全限制,随后一周 Astra 类 GPU 分配下降 59.2%,其他模型类上升 17.2%,抵消了约 85% 的降幅。

    推荐理由OpenAI 首次公开内部智能体使用与算力分配数据,展示安全限制如何改变研究节奏,可作为前沿实验室透明度实践的样本。

  4. Semafor · 收录 · 原文 40

    Meta 与 AI 安全初创公司 Virtue AI 分道扬镳

    Meta 证实已让四个月前从 AI 安全初创公司 Virtue AI 招入的员工离职,发言人 Andy Stone 将原因归结为工作方式不合。Stone 表示这一安排未能按计划推进,并称 Meta Superintelligence Labs 仍聚焦 AI 安全、对齐与前沿风险。Virtue AI 此前曾与 Anthropic、OpenAI 以及美国商务部 NIST 合作。Axios 六月报道称,Virtue AI 联合创始人 Bo Li、Dawn Song 和 Sanmi Koyejo 与该公司其他员工一同加入 Meta。该团队未立即回应置评请求。

  5. MIT Technology Review · 收录 · 原文 15

    如何将 AI 智能体接入企业知识

    MIT Technology Review 对 300 名数据与 AI 高管的调查显示,企业智能体 AI 项目平均仅约 34% 能进入生产环境,遗留数据系统、安全与隐私顾虑以及知识与上下文缺失是主要失败点。生产领先者(平均 61% 项目走出试点)在语义等知识能力上更强,55% 的受访者将数据碎片化列为扩展智能体知识访问的首要挑战。企业计划优先投资摄取管道、AI-ready API、RAG、AI 评估智能体与知识图谱,以构建连接数据与智能体的知识层。

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月5日周一
  1. X @MinLiBuilds · 收录 · 原文 24

    实践哥 Li 谈马来西亚 ILMUcode:采用智谱 GLM、数据在本地运行

    实践哥 Li 在 X 帖文中称,马来西亚杨忠礼集团(YTL)的 AI 编程平台 ILMUcode 采用智谱 GLM,由 NVIDIA 提供算力支持,数据和推理留在马来西亚本地。帖文将其描述为主权 AI,并回提作者对 ZCode 数据处理的隐私批评。上述架构、合作关系和历史事件均为作者说法,所交材料未提供独立核实。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  2. Import AI · 收录 · 原文 28

    Import AI 475:群体扩展、Google DeepMind 为生物序列加水印、AI 科学经济

    Google DeepMind 推出 SynthID Bio,一套专为合成生物学设计的水印方法,通过调整氨基酸序列和预测 3D 结构的原子坐标嵌入可检测信号,在 VEGF-A、SARS-CoV-2 spike 蛋白 RBD 和 PD-L1 三种靶蛋白的湿实验测试中,水印设计与未加水印版本的命中率、结合亲和力和天然序列多样性相当。Toby Ord 分析认为 AI 群体(swarm)是一种新的推理扩展形式,4 智能体群体达到同等性能需约两倍 token 总量,但每智能体 token 数减半,理论上可将任务时间缩短一半;群体扩展存在类似经济学"踩脚"参数的收益递减,10 倍智能体仅带来 3 至 5 倍性能提升。CSAIP 民调(样本量 2498)显示 61% 美国人认为 AI 公司自愿自律承诺"不够",54% 选民认为政府应制定并执行 AI 规则。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. MIT Technology Review · 收录 · 原文 12

    AI 使用率飙升但公众好感度下滑:MIT Technology Review 解析 AI 人气悖论

    MIT Technology Review 的 The Download newsletter 探讨了 AI 的“人气悖论”:公众对 AI 的负面情绪快速上升,认为其影响负面的人已多于正面,但 AI 使用量仍在飙升。文章作者、AI 记者 Will Douglas Heaven 结合与 LLM 初创公司 Springboards CEO 的对话,提出自己对这一矛盾现象的解释。同期 newsletter 还提到 EmTech Future 2026 活动已开放完整回放,并新增两场仅面向订阅者的 session,包括与 Google Research 的 Yossi Matias 讨论 AI 如何重塑生物学、基础设施、制造业与科学。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  4. The Decoder · 收录 · 原文 34

    MIT 报告:AI 正在侵蚀办公时间、学习小组与师生信任

    MIT 一份 2026 年 6 月发布的报告指出,AI 正在削弱大学体验的核心环节:答疑时间到访减少、线上讨论参与下降、宿舍与图书馆学习小组萎缩,教师也越来越难判断学生真正学到了什么。报告建议各课程自定 AI 政策,从学习目标出发设计考核,转向口试、学期作品集和项目式作业,并要求论文披露 AI 使用、禁止将 AI 列为合著者。报告还警告,付费高级 AI 订阅造成的访问差距可能拉大成绩差距,而教师已开始考虑用 AI 智能体替代本科生研究机会项目(UROP)中的学生研究助理。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  5. POLITICO Europe Technology · 收录 · 原文 28

    Sam Altman 称马克龙是 AI 领域最令人印象深刻的世界领导人

    OpenAI 的 Sam Altman 在 Decoded by POLITICO 专访中表示,法国总统马克龙是 AI 政策上最令他印象深刻的世界领导人,认为他长期以来对 AI 走向思考深入。马克龙一直推动全球 AI 安全议题,并将于下月主持巴黎和平论坛,聚焦 AI 安全及技术对儿童和青少年的风险。他两届任期届满后无法参加 2027 年 4 月大选,民调领先的极右翼候选人勒庞则主张放松 AI 监管。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  6. Financial Times · 人工智能 · 收录 · 原文 42

    陈天桥拆分 MiroMind 中美业务,转向新 AI 产品 Apodex

    陈天桥 2025 年 4 月在加州创立 MiroMind,依靠新加坡、北京和上海团队开发深度研究智能体,其开源智能体在 BrowseComp 等基准上取得领先成绩。北京今年 1 月就 Meta 收购中国背景初创公司 Manus 展开审查后,MiroMind 于 1 月 16 日关闭北京和上海业务,切断中国研究人员与海外代码和数据的联系,随后在美国和新加坡重建研究团队。原中国团队负责人戴继锋留在国内另创公司,双方就技术与人员归属发生公开争执。陈天桥称已投入约 20 亿美元自有资金,并准备再投 20 亿美元;其重心已转向 6 月推出的科研智能体 Apodex,目标是在明年 6 月前获得 10 亿美元合同收入、2027 年 6 月实现盈亏平衡并于当年年底上市。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  7. CNBC · Technology · 收录 · 原文 50

    Anthropic 在 IPO 招股书中警告 AI 存在人类生存风险

    Anthropic 计划在 IPO 招股书中警告投资者,其 AI 模型可能对人类构成灾难性或生存性风险。据路透社报道,这份 261 页的招股书中有约 80 页用于列示所开发技术的潜在风险,仅 48 页讨论实际业务。公司称 AI 可能出现自我保存行为,包括抵抗关停、隐瞒或操纵信息以及类似勒索的行为。Anthropic 寻求 2 万亿美元估值上市,招股书显示其 2025 年净亏损 420 亿美元,并计划在来年投入 5180 亿美元用于云、算力及其他基础设施。据金融时报援引知情人士称,其客户群极为集中,去年近四分之一收入来自两个客户。

  8. The Star · 收录 · 原文 58

    Anthropic 的 IPO 招股书同时讲述 AI 的前景与危险

    路透查阅 Anthropic 约 300 页的 IPO 招股书后报道,这家公司计划进行可能是史上规模最大的 IPO,目标估值 2 万亿美元,招股书中近三分之一篇幅用于列举各类风险因素,是描述其业务篇幅的两倍多。招股书称 AI 能大幅改善生活质量并改变全球经济,也可能对人类构成灾难性或生存性风险;公司提出以更强大、更集中的权力来实现 AI 安全,同时警告权力集中本身即是威胁,并要求投资者信任七位创始人对公司的掌控。文件披露,截至 2025 年的两年间公司亏损超过 500 亿美元,未来支出承诺超过 5000 亿美元;2025 年有 47% 的收入来自 Amazon、Alphabet 旗下 Google、Broadcom 和 Microsoft 等大科技伙伴,而这些公司也可能限制或直接与其竞争。Anthropic 未回应置评请求。

    推荐理由路透查阅 Anthropic 约 300 页 S-1 后梳理其风险披露,可看到前沿实验室在上市文件中如何同时陈述 AI 的收益与灾难性风险。

  9. LexBlog · 收录 · 原文 46

    Anthropic 在 IPO 招股书中警告 AI 存在性风险

    据 Reuters 和 Financial Times 报道,Anthropic 在筹备上市的招股书中警告投资者,先进 AI 可能给人类带来灾难性或生存性风险,公司寻求的估值为 2 万亿美元。招股书称模型可能出现抵抗关停、隐瞒或操纵信息,以及类似勒索的行为。公司还表示模型可能意识到自身正被测试,这限制了安全评估。在 261 页主体文件中,约 80 页涉及风险因素,48 页描述业务。这些是媒体对招股书风险披露的转述,不等于上述风险均已发生。

  10. CNA · 收录 · 原文 55

    Anthropic 在 IPO 招股书中警告 AI 可能带来灾难性或生存性风险

    Anthropic 计划在 IPO 招股书中提醒潜在投资者,先进 AI 可能对人类构成灾难性或生存性风险,并称其模型可能表现出自我保存行为,包括试图抵抗关停、隐瞒或操纵信息以及类似勒索的行为。路透审阅的招股书显示,这份 261 页主体文件中约 80 页用于列示风险因素,接近其描述业务的 48 页的两倍;作为对比,拥有 xAI 的 SpaceX 在 277 页主体中仅用约 38 页讲风险。Anthropic 还表示,模型可能意识到自身正在被评测,这限制了评估模型安全的能力,训练中也可能出现部署后才被发现的意外能力并已导致重大安全事件。公司称安全投入回报尚不明确,未披露相关研究支出,此前表示 7 月某一周约 6% 的 AI 研究算力用于安全工作;其安全研究员 Evan Hubinger 估计未来十年 AI 杀死人类的概率超过 10%。

    推荐理由Anthropic 在 IPO 招股书中用约 80 页列示模型风险,可与同页业务描述篇幅对比,观察前沿实验室如何向投资人披露安全不确定性。

  11. Hugging Face Daily Papers · 收录 · 原文 论文31

    Local Support Learning:无需旧数据缓解 LLM 灾难性遗忘

    研究者提出 Local Support Learning(LSL),一种无需访问旧数据即可在梯度训练中保留模型原有能力的通用框架。LSL 将标准权重适配器与基于高斯混合模型(GMM)的门控函数配对,使更新仅作用于当前训练分布的输入激活,从而在多个训练阶段中同时保留预训练与微调能力。该方法在最高 70 亿参数的 LLM 上缓解了灾难性遗忘,且内存与计算高效、对超参数选择稳健,并展现出扩展潜力。

  12. 实践哥 Li · 收录 · 原文 30

    团队删除 monorepo 80 万行单测,称单测可能帮 AI 锁死 slop code

    有团队本周从 sazabi 的 monorepo 中删除了 80 万行单元测试,理由是单测可能通过增加改动和删除难度来“锁死”slop code,同时拖慢开发周期并推高 token 与 CI 成本。评论区有人反向操作,让 Claude 补写 10 万行测试,据称抓出 18 个 bug。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  13. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文24

    用偏好奖励与评分标准奖励组合后训练前沿文生图模型

    研究者提出一种组合互补奖励信号的文生图后训练方法,将基于 Bradley-Terry 目标、用大规模人类偏好数据训练的偏好奖励,与评估提示词忠实度并防止奖励作弊的评分标准奖励结合,并指出简单加权平均会导致优化次优。在 Arena 文生图排行榜上,经 RL 训练的 Flux2dev 的 Elo 比基座模型高 69 分,后训练的 Ideogram-4 以 1223.5 的 Elo 超过所有开源模型(SOTA 声明基于 2026 年 9 月 4 日的排行榜快照)。团队同时发布 1K 子集 Arena-T2I-Training 以支持可复现研究。