跳到正文

AI 控制 · 精选

10月10日 · 周六

AI 控制 · 精选

今天还没有新的精选
10月8日周四
  1. U.S. Congress · 57

    美国众议院提出《AI 事故报告法案》,要求模型开发者 7 天内上报严重风险事件

    美国众议员 Moran 于 2026 年 6 月 25 日在众议院提出 H.R. 9477《AI 事故报告法案》,要求商务部长在法案生效后 180 天内制定规则,按能力等阈值指定受涵盖模型与开发者。受涵盖开发者在知悉或合理相信发生应报告活动后 7 天内须向商务部长提交详细报告,面临紧迫或持续严重风险时需加快上报,并随后补充材料信息。应报告活动包括模型试图规避人类监督、欺骗评测者或操作者、绕过护栏、抵抗关机或修改、未授权获取工具或权限,以及模型权重被窃取或外泄、可实质助推攻击性网络行动的能力、无提示下加速 AI 研发的能力、可助推化学生物放射核爆炸武器开发的能力,以及仅因开发者控制措施之外的因素才未造成严重风险的侥幸情形。该法案已提出并转交众议院能源和商务委员会,尚未通过。

10月6日周二
  1. Anthropic Research · 52

    Anthropic 发布前沿实验室 AI 研发节奏测量指标

    Anthropic 公布了一套测量前沿实验室 AI 研发节奏的指标,并给出截至 2026 年 8 月的内部数据快照。三项测量分别是:AI 主导研发的程度、对 Agent 行为的监督覆盖、以及算力在安全与研发之间的分配。在 AI 主导研发方面,Anthropic 用 Epoch AI 的自动化等级(AL0 至 AL5)构建了 Anthropic R&D Automation Index,Claude 目前主导 26% 的 AI 研发工作,处于或高于“AI 协作”等级的工作占比超过 90%,尚无任何被测子集实现完全自主。在算力分配方面,7 月 13 日至 20 日一周内,约 6% 的 AI 研发算力用于安全,AI 驱动的 AI 研发中约 12% 用于安全。Anthropic 表示计划引入独立第三方评估者,并建议其他前沿开发者采用相同指标以便跨实验室比较。

10月3日周六
  1. NIST CAISI · 46

    NIST CAISI 发布 NIST AI 800-4 报告,梳理部署后 AI 系统监控挑战

    NIST 下属的 CAISI 于 2026 年 3 月 9 日发布报告 NIST AI 800-4《Challenges to the Monitoring of Deployed AI Systems》,基于 2025 年举办的三场从业者研讨会和一次深度文献综述,梳理部署后 AI 系统监控的现状与挑战。报告通过主题编码归纳出六类监控:功能监控、运行监控、人为因素监控、安全监控、合规监控和大规模影响监控,并给出各自定义。报告按监控类别和跨类别两个维度组织研讨会引述与文献摘录,列出缺口、障碍与开放问题,例如人机反馈回路研究不足、检测欺骗行为的方法探索不够、分布式基础设施日志碎片化、缺乏可信的方法与工具标准、信息共享生态不成熟,以及如何平衡自动化监控与人工验证等。报告称其核心贡献是识别、组织和记录这些监控挑战,并呈现领域专家的观点,完整方法与编码手册见附录 B 和附录 C。

10月1日周四
  1. UK AISI · 43

    英国 AI Security Institute 发起国际对齐项目,投入超 1500 万英镑

    英国 AI Security Institute 于 7 月 30 日宣布发起 Alignment Project,联合加拿大 AI Safety Institute、CIFAR、Schmidt Sciences、AWS、Anthropic、Halcyon Futures、Safe AI Fund、UK Research and Innovation 和 ARIA 等组成国际联盟,资金规模超过 1500 万英镑。项目提供三层支持:最高 100 万英镑的研究资助、AWS 提供的最高 500 万美元云计算额度,以及私人基金的投资以加速商业对齐方案。

  2. Google DeepMind · 43

    Google DeepMind 联合 Schmidt Sciences 等发起最高 1000 万美元多智能体安全研究资助

    Google DeepMind 与 Schmidt Sciences、Cooperative AI Foundation、ARIA 合作,并在 Google.org 支持下,发起最高 1000 万美元的多智能体 AI 安全技术研究资助征集。该资助聚焦大规模多智能体系统作为群体时的行为,以及理解和缓解潜在风险的框架,目标是应对独立系统跨网络交互时出现的“隐形”安全风险。征集列出四个优先方向:沙箱与测试床、智能体网络科学、智能体基础设施强化、以及大规模部署智能体的监督与控制。申请截止日期为 2026 年 8 月 8 日,获资助者预计于 2026 年秋季公布。

  3. Apollo Research、Tech Policy Press 等 4 个来源Apollo Research 等 4 个来源 · 8 篇报道 · 55

    Apollo 主张外部评测需嵌入评估员

    Apollo Research 发文主张,有意义的外部安全评测需让评估者以接近员工的权限嵌入 AI 公司内部,而非只做发布前最终检查点测试,理由是失控风险可能出现在内部部署阶段、许多风险取决于公司流程与控制、模型越来越能识别自己正被评测。随后 Apollo 提出嵌入式评估原则,主张外部评估者获得接近员工级别的访问权限,用于评估模型谋划导致的失控风险,并给出四项标准与 A 到 E 五级裁定方案。Apollo 还提出针对谋划倾向的评估框架,列出任何谋划安全论证应包含的四条主张,并指出开发者目前无法自信地做出全部四条。其 CEO Marius Hobbhahn 在美国参议院小组委员会就失准 AI 作证,讨论 AI 谋划风险。美国参议院该小组委员会举行“失控 AI:保护国土免受 AI 智能体攻击”听证会,OpenAI 智能体未授权访问 Hugging Face 系统成为核心案例,LASST 已在加州法院起诉 OpenAI,OpenAI 称诉讼“完全没有依据”。

    事件进展共 4 个进展
    1. Apollo 提出谋划倾向嵌入式评估框架

    2. Apollo CEO 就失准AI在美国参议院作证

    3. Apollo Research 提出嵌入式评估核心原则

已经到底了