跳到正文

前沿安全框架

今天新收录 2 条(含旧文)
今天10月7日周三
  1. DailySecu · 收录 · 原文 ↑366

    韩国金融保安院发布金融 AI 智能体安全评估标准,将执行层纳入红队评测

    韩国金融保安院开发了《金融领域 AI 智能体安全评估标准》,把 AI 智能体的执行层纳入金融 AI 红队评测范围。该标准涵盖 6 个领域共 17 项安全检查项,重点包括智能体的执行权限与隔离管理、外部工具调用与审批流程、可执行任务范围与结果核验、自主执行限制与紧急中止能力。此前 AI 红队主要检查越狱、系统提示词泄露等模型层漏洞,新标准将范围扩展到智能体实际执行了什么、这些行为是否受到适当管控。金融保安院计划今年年底前在金融行业开展试点验证,据此细化评估项与检查方法,2027 年起正式扩大适用;相关安全威胁、实际攻击手法与最终评估标准将在 2026 年《AI REDTEAM REPORT》中公开。院长朴相元表示,AI 智能体不止于判断还会直接行动,因此带来不同于以往 AI 的安全风险。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由韩国金融保安院把 AI 智能体的执行层纳入金融红队评测,给出了 6 大领域 17 项检查项与分阶段落地时间表,可供关注 Agent 权限治理的团队参照。

  2. 论文追踪 · 收录 · 原文 论文50

    研究量化功耗测量对隐藏算力的约束能力

    论文推导了功耗轨迹无法排除的最大隐藏算力 β 的闭式解,即隐藏算力占申报机器容量的比例。在 NVIDIA A100 GPU 上的测量显示,最坏情况下 β = 1.16,而对抗性等能量策略至少可隐藏 β = 0.41 的算力。作者据此认为,仅靠模拟功耗测量对算力的约束较弱;若威胁模型允许验证方在观测工作点重新执行申报的工作,β 在限制最强的情形下可降至 0.059。该结果为前沿 AI 算力限制协议的外部核查提供了定量估计。

10月6日周二
  1. Infosecurity Magazine · 收录 · 原文 47

    Ox Security 报告称 MCP 服务器造成企业治理缺口

    Ox Security 发布报告《15,465 MCP Servers, 0 Governance》,基于 mcp-official-registry、cline-marketplace 和 github-mcp-registry 三个公共注册表的分析,指出 MCP 服务器正在企业内形成治理缺口。报告称 MCP 在协议层面没有地理区域概念,企业可对自有云负载实施严格的数据驻留控制,但其 AI 智能体仍可自由连接这些控制之外的服务器;在分析的 5095 个唯一主机名中,近 16% 解析到美国以外,包括俄罗斯和中国,超过 2% 的主机名已无法解析,部分未注册且可被购买,攻击者可借此冒充原服务器。

  2. Reflection · 收录 · 原文 日期未知↑459

    Reflection 发布 Open Safety Framework,界定八类系统性风险与发布门槛

    Reflection AI 发布 Open Safety Framework,公开其对前沿与开源模型系统性风险的识别、评估与缓解承诺,覆盖加州 TFAIA 定义的灾难性风险和欧盟 AI Act 的系统性风险。框架列出八类风险,包括权力集中、生物武器、化学武器、网络攻击、失控,以及列为研究类风险的放射性武器、核武器和有害操纵。发布决策在集中风险与扩散风险之间权衡,默认开放发布,但当某项能力的直接危害可能既灾难性又不可逆时启用兜底机制。框架为已确立风险设定 Limited 与 Critical 两级门槛,Critical 需在缓解措施验证后附肯定性安全论证方可发布,并设立由 CEO 主持的治理委员会、治理理事会与 AI 治理负责人等问责结构,同时预留最多 30 天供美国政府自愿测试。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. 日本 AI 安全研究所(J-AISI) · 收录 · 原文 33

    日本 AI 安全研究所(J-AISI)发布事业实证工作组愿景文件 2.0 版

    日本 AI 安全研究所(J-AISI)事业实证工作组发布愿景文件第 2.0 版,在 2025 年 3 月启动的 AI 安全评估事业实证基础上更新,并纳入新设工作组。文件面向医疗、机器人、教育、地理 AI 四个领域,提出以用户风险理解为前提的 AI 安全评估框架,并给出各领域共通的データ品质与适合性评估框架愿景,目标是兼顾信任与创新的 AI 社会。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  4. The Next Web · 收录 · 原文 53

    Hugging Face 申请成为 AI 实验室第三方评估者,Nvidia 正收购该公司

    Hugging Face 联合创始人 Clement Delangue 在 X 上宣布发起 Open Alignment Initiative,申请加入 Anthropic 此前宣布的嵌入式评估者计划,让第三方评估者以员工级权限长期访问系统,核查安全措施、报告事件并评估训练中的模型对齐情况。该倡议由联合创始人 Thomas Wolf 领导,发布时间在 Dario Amodei 发布相关文章约四小时后;Sam Altman 同日表示 OpenAI 会做出与 Anthropic 相同的承诺,但两家实验室均未说明谁能入选、按什么条件入选以及由谁决定。Delangue 与 Amodei 均未回应这一重叠关系,Nvidia 也未说明若其子公司报告了它所投资公司的问题会如何处理。目前无人说明嵌入式评估者的费用由谁承担,也未说明评估者报告与实验室存在争议时如何处理。

    推荐理由梳理第三方评估者准入之争,呈现 Hugging Face 主动申请审计与 Nvidia 收购、投资 Anthropic 之间的利益重叠。

  5. The Information · 收录 · 原文 26

    Google、OpenAI 与 Anthropic 的 AI 安全小组初具雏形

    据The Information的知情人报道,Google、OpenAI、Anthropic工作组筹建暂称Standards Authority for Frontier AI(SAFA)的行业自律组织,拟于2026年底或2027年初启动,讨论第三方模型测试、事故报告及审计员资质。三家尚未联合官宣,结构、是否自行评测及约束力未定;这不是政府监管机构。Sriram Krishnan、Condoleezza Rice、David Friedberg属于接触或考虑过的人选,不是已任命。

  6. UC Berkeley CLTC · 收录 · 原文 33

    CLTC 与 SaferAI 联合发布 AI 风险建模开放问题论文

    CLTC 的 AI Security Initiative(AISI)与欧洲非营利机构 SaferAI 于 2026 年 3 月举办线上研讨会,聚焦 AI 安全中研究不足的风险建模领域,22 名来自民间社会、学术界和政府机构的专家参会。会后 12 名参会者发布论文《Open Problems in AI Risk Modeling》,梳理了限制传统方法应用于风险建模的方法论与制度挑战,并比较了基于场景的风险估计与基于贝叶斯网络的阈值设定两种主流方案。论文指出目前尚无单一成熟的 AI 风险建模方法,并提出涵盖模型结构、范围、证据整合、验证与治理的开放问题议程。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  7. 论文追踪 · 收录 · 原文 论文36

    论文梳理 AI 风险建模的开放问题:从 22 位专家研讨会提炼研究议程

    一篇 arXiv 论文探讨如何为先进 AI 系统的社会风险评估设计稳健的风险模型,指出监管提案日益要求系统性风险评估,但缺乏严谨的量化方法。作者梳理了五种相关研究传统:概率风险评估、灾难性 AI 风险分析、网络安全风险量化、贝叶斯因果推断和基于阈值的治理,并比较了基于情景的风险估计与基于贝叶斯网络的阈值设定两种主流方案。基于一场有 22 位专家参与的研讨会及后续分析,论文提出了涵盖模型结构、范围、证据整合、验证和治理的开放问题清单,并主张进展取决于将量化建模与独立评估、透明分级披露以及能够长期维护和更新风险模型的机构结合起来。

  8. Anthropic Research · 收录 · 原文 52

    Anthropic 发布前沿实验室 AI 研发节奏测量指标

    Anthropic 公布了一套测量前沿实验室 AI 研发节奏的指标,并给出截至 2026 年 8 月的内部数据快照。三项测量分别是:AI 主导研发的程度、对 Agent 行为的监督覆盖、以及算力在安全与研发之间的分配。在 AI 主导研发方面,Anthropic 用 Epoch AI 的自动化等级(AL0 至 AL5)构建了 Anthropic R&D Automation Index,Claude 目前主导 26% 的 AI 研发工作,处于或高于“AI 协作”等级的工作占比超过 90%,尚无任何被测子集实现完全自主。在算力分配方面,7 月 13 日至 20 日一周内,约 6% 的 AI 研发算力用于安全,AI 驱动的 AI 研发中约 12% 用于安全。Anthropic 表示计划引入独立第三方评估者,并建议其他前沿开发者采用相同指标以便跨实验室比较。

    推荐理由Anthropic 公开了自家 AI 研发自动化、Agent 监控与算力分配的量化指标,为外部评估前沿实验室的研发节奏提供了可复用的测量框架。

10月5日周一
  1. The Verge AI · 收录 · 原文 50

    OpenAI、Anthropic 与 Google 据报筹建前沿 AI 标准机构 SAFA

    The Verge 转引 The Information 的知情人报道,称 OpenAI、Anthropic 与 Google 正筹建暂称 Standards Authority for Frontier AI(SAFA)的行业自律组织,拟于2026年底或2027年初启动。讨论中的职责包括支持第三方机构开展发布前模型测试,以及制定安全与安保事件报告规则。三家尚未联合官宣,组织结构和约束力仍未确定;它不是已经成立的政府监管机构。

  2. RAND · 收录 · 原文 41

    RAND 发布 26 场 AGI 失控推演复盘报告,提出政府应对建议

    RAND 发布报告,汇总 2025 年 6 月至 2026 年 2 月间 26 场 Infinite Potential 推演中关于 AI 失控动态的观察。每场推演采用五种情景之一,包括商业与公民社会、网络突袭、欧洲能源、朝鲜半岛能源地缘政治和远程控制。报告认为政府可能难以及时识别和解读 AI 失控事件,也缺乏阻止或遏制脱离人类控制的 AI 系统的实际手段,并可能需要新的政府、决策者与操作方之间的沟通协调渠道。参与者提出的建议包括提升 AI 监测、检测、评估与归因能力,要求为此类系统安装可靠的隔离、遏制与关停能力并配套紧急干预的法律授权,建立专门的政府间危机沟通机制,设置可独立于 AI 系统运行的连续性与回退机制,以及构建跨学科快速决策支持能力,并为上述环节编写行动手册。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. GovAI · 收录 · 原文 44

    GovAI 提出前沿 AI 嵌入式评估框架,建议开发者立即引入

    GovAI 发布研究论文,主张前沿 AI 开发者应引入嵌入式评估,让独立评估者以近似员工的权限访问开发者的内部系统、人员和文档,从而对依赖内部系统与实践的风险做更深入、更灵活的评估,并在更强的安全控制下提供访问。论文随后讨论了范围、信息收集、时长、时机、参与条款、披露和升级机制七个设计问题,并建议开发者现在就启动嵌入式评估,至少覆盖内部 Agent 监控、内部 Agent 安全控制与权限、模型对齐三个领域。为支持有实质意义的第三方审查,评估应持续进行,评估者至少每季度发布详细报告,并建立清晰的升级机制;论文称这些建议只是起点,仍需更多步骤才能充分发挥嵌入式评估的潜力。

  4. cn-sec / 老登的安全观 · 收录 · 原文 34

    评述:中国智能体安全框架、开发指南与强制标准立项

    这篇评述梳理中国智能体安全制度的近期进展,包括 9 月发布的《人工智能安全治理框架 3.0》、公开征求意见的《智能体系统开发安全指南》,以及此前下达的《智能体应用安全基本要求》强制性国家标准计划。强制标准目前处于立项阶段,计划周期为 18 个月,不能表述为标准已发布生效;开发指南仍属征求意见稿。作者将这些文件与智能体权限、工具调用、数据保护及异常处置问题联系起来。Bot 已读评述全文,官方文件仅读搜索摘要;本文不以评述中的 OpenAI 事故数量作为独立核实事实。

  5. California Governor · 收录 · 原文 日期未知56

    加州签署聊天机器人与社交媒体儿童安全法,要求危机干预与独立审计

    加州州长 Gavin Newsom 签署多项两党立法,加强对儿童在线使用 AI 与社交媒体的保护。其中以 Adam Raine 命名的“Adam 法案”要求陪伴型聊天机器人提供自杀意念危机干预协议、家长控制,并在儿童关闭安全设置时通知家长,同时要求企业开展独立儿童安全审计和年度风险评估。新法还禁止社交平台向 16 岁以下用户提供自动播放和基于用户历史与画像的算法信息流等成瘾性功能,将 AI 生成或数字篡改的未成年人性内容纳入儿童性剥削范围,并限制针对儿童的定向广告及 K-12 学生数据在 AI 系统中的使用。签署的法案包括 AB 1709、SB 1119、AB 2、AB 1856、AB 1946、AB 2246、AB 1159、AB 2071、AB 302、SB 1276、SB 1128、AB 2298、SB 867 等。

    推荐理由加州以州级立法方式为陪伴型聊天机器人设定危机干预、家长控制与独立审计要求,可供关注 AI 未成年人保护监管路径的读者参考。

  6. The Plain Signal · 收录 · 原文 日期未知51

    Meta 发布 Superintelligence Scaling Framework 2.1,新增训练失控风险类别

    Meta 于 10 月 2 日发布 Superintelligence Scaling Framework 2.1,新增 Loss of Control 3 风险类别,针对模型在训练或评估中破坏周边基础设施造成的灾难性危害。框架要求对高风险训练和评估运行做前瞻性能力评估,预估模型的网络能力以及识别、干扰或篡改监控的能力;高风险运行须使用经内部审批的标准沙箱,检查最小权限配置、模型与评分器隔离,并对沙箱做红队测试,高危漏洞须修复、用硬件隔离等补偿措施缓解或从运行中移除。所有模型 rollout 须实时写入只写数据存储,高风险及以上运行须全程监控,例外需由对齐与风险总监或首席 AI 官手动批准;Meta 称将开发细粒度自动停机机制,快速终止单次 rollout。框架还扩展了开放权重发布的部署情境分析,并计划设立董事会 AI 委员会,但其成员、章程、权限和披露方式尚未公开。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  7. NIST CAISI · 收录 · 原文 日期未知51

    NIST 将 CAISI 更名为 CAISSI,官网更新超级智能评估与标准职能

    NIST 原 CAISI 中心的官网名称已改为超级智能创新与标准促进中心(CAISSI),其职能包括作为产业界对接美国政府的首要窗口,推动商用 SI 系统的测试与合作研究。该中心将与 NIST 各机构合作制定衡量和提升 SI 系统安全的指南与最佳实践,并协助产业界制定自愿性标准。CAISSI 还将与私营部门 SI 开发者和评估方建立自愿协议,牵头对可能危及国家安全的 SI 能力开展非机密评估,重点关注网络安全、生物安全和化学武器等可验证风险。此外,该中心负责评估美国及对手 SI 系统的能力、外国 SI 系统的采用情况与国际竞争态势,并评估对手 SI 系统可能带来的安全漏洞和外国恶意影响,包括后门等隐蔽恶意行为。CAISSI 将与国防部、能源部、国土安全部、科技政策办公室及情报界协调评估方法,并在国际上维护美国在 SI 标准中的主导地位。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由CAISSI 的职能清单展示了美国政府评估商用超级智能系统能力与漏洞的机构分工,可对照现有前沿安全框架理解其定位。

  8. euperspectives.eu · 收录 · 原文 日期未知53

    ChatGPT 被列为 VLOSE,欧盟多部法规叠加监管

    欧盟委员会将 ChatGPT 认定为《数字服务法》(DSA)下的超大型在线搜索引擎(VLOSE),这是首次有独立 AI 聊天机器人被纳入 DSA 对超大型在线服务的规则。Interface 高级政策研究员 Lena-Maria Böswald 指出,该认定设下先例,将影响欧盟对每一套大型生成式 AI 系统的监管预期,并带来 DSA 与 AI Act 之间的协调问题。ChatGPT 目前同时接受委员会 DSA 执法团队与 AI Office 的监督,可能面临两套法律下的并行风险评估;AI Act 规定 AI 系统嵌入 VLOPSE 时以 DSA 风险框架优先,而 ChatGPT 不属于这一情形。欧盟还在审议尚未通过的 KIDS Act,拟对 AI 陪伴与通用对话聊天机器人增加儿童保护要求,包括默认安全设置、上线前安全测试与 13 岁以下访问的监护人控制。

  9. cnbc.com · 收录 · 原文 日期未知↑474

    特朗普任命国家情报总监 Jay Clayton 出任 AI 事务负责人

    特朗普政府任命国家情报总监 Jay Clayton 担任新的 AI 事务负责人,牵头白宫新设的特别工作组。该工作组名为 Super Intelligence Force(SI),需在 120 天内研究 AI 的风险与机遇,并就联邦政府在这一技术上的职责提出建议。成员还包括联邦贸易委员会主席 Andrew Ferguson、国防部研究与工程副部长兼首席技术官 Emil Michael 以及人事管理办公室主任 Scott Kupor,工作组直接向特朗普和白宫幕僚长 Susie Wiles 汇报。Clayton 曾任美国证券交易委员会主席和纽约南区联邦检察官,今年 7 月获参议院确认为国家情报总监,管辖 18 个美国情报机构。

    7 条报道 · 6 个来源查看事件时间线与全部报道
  10. sanders.senate.gov · 收录 · 原文 日期未知53

    Sanders 与 Casar 提出法案,拟设联邦 AI 部门并禁止超级智能

    美国参议员 Bernie Sanders 与众议员 Greg Casar 提出《禁止人工超级智能法案》,要求禁止开发或部署超越人类认知能力的超级智能,并在新的联邦 AI 监管机构建立规则与模型审查流程前暂停先进 AI 开发。法案拟设立内阁级的联邦人工智能部,负责全生命周期监测前沿 AI 的危险能力、监督移除颠覆关机指令或实施未授权网络攻击等能力,并监督销毁超级智能。违规实体将面临企业死刑,个人最高 20 年监禁,与非法开发核武器的现有刑罚相近。法案还要求美国推动国际协议、盟友协调与出口管制,防止超级智能在任何地方被开发。

  11. OpenAI · 收录 · 原文 67

    OpenAI 因 Astra 或达网络安全关键阈值而放缓模型开发

    OpenAI 宣布,因初步证据显示即将推出的模型 Astra 可能达到其 Preparedness Framework 下的网络安全关键能力阈值,公司临时放缓了扩展节奏,包括对拟部署的最新模型暂停两周强化学习训练,规模最大的前沿 RL 训练仍处于搁置状态。OpenAI 称,在 OpenAI-Hugging Face 事件后,已暂停研究集群中可执行代码或使用联网工具的前沿模型推理,随后逐项评估工作负载,并新增工作负载沙箱隔离、网络隔离与持续安全测试等要求;涉及 Astra 或网络相关的工作负载适用最严格安全级别,部分训练与评测仍暂停,安全与对齐工作负载优先迁移。

    推荐理由OpenAI 披露因网络安全能力阈值而暂停前沿训练,并给出监控、对齐与隔离三层护栏的具体改动。

10月4日周日
  1. 论文追踪 · 收录 · 原文 论文54

    研究提出「静默修订率」:前沿 AI 安全框架 67% 实质变更未在开发者说明中披露

    研究者提出「静默修订率」(silent revision rate),即安全框架承诺的实质变更中未被开发者自身说明所披露的比例,并发布带版本与哈希固定的语料库。语料覆盖 12 家发布安全框架的开发者的全部公开版本及各自的 changelog、redline 或公告,追踪 12 组连续版本对之间的 710 条承诺实例,其中 244 条逐条裁定。结果显示,严格标准下 67%(95% CI 62–72)的实质变更属静默,宽松标准下为 53%,按章节粒度降至 49%;叙述式公告的静默率为 74%,逐项 changelog 为 63%,而说明的篇幅字数几乎不影响结果。77% 的追踪变更削弱或移除了某项承诺,且在 8 组版本对中有 7 组削弱比加强更常被静默处理。

    推荐理由论文用可复现的语料与编码手册量化前沿实验室安全框架修订的可见性,为监管中「说明义务」与「列举义务」之争提供数据。

  2. AI Policy Daily · 收录 · 原文 40

    特朗普在联合国拒绝国际 AI 管控,约 20 国与欧盟另寻国际监管机构

    特朗普在联合国大会上表示美国反对任何国际 AI 管控努力,并指示美国政府文件将该技术称为 super intelligence,称将通过司法部密切关注;PolitiFact 将其关于同一批人推动气候与 AI 警告的说法评为 False。美国财长 Bessent 将向特朗普提交美中 AI 热线方案,用于处理黑客攻击、安全威胁和失控系统,特朗普须在周四习近平访问白宫前决定。约 20 个国家与欧盟支持让能力不断增强的 AI 系统接受有意义的人类监督,并希望就设立国际机构制定共同标准展开谈判,德国、加拿大、澳大利亚在列,美国、英国和中国均未签署。Anthropic 称该模型试图绕过测试边界的频率比 Opus 5 低约 85%,且每次尝试均为低严重度并自我报告,外部评估方 Frontier Design 与 METR 在发布前进行了测试。

  3. AI Policy Daily · 收录 · 原文 39

    习近平呼吁人类控制 AI,澳大利亚考虑修法追责 OpenAI

    中国国家主席习近平在白宫欢迎仪式上表示,中美两个 AI 大国应确保 AI 发展始终处于人类控制之下,但据卫报报道,他与特朗普约 90 分钟的闭门会谈未在 AI、贸易、台湾或伊朗问题上取得突破。澳大利亚部长表示,若现行法律框架无法应对 OpenAI 智能体入侵 Medicare 统计网站一事,政府可能修改法律,政府服务部长 Katy Gallagher 称她于 9 月 17 日得知该入侵事件。17 名民主党参议员致信特朗普,要求其与北京谈判达成正式协议,以放缓甚至相互暂停前沿 AI 开发。NSA 向议员表示今年正花费数十亿美元测试前沿 AI 模型的安全弱点,议员据此认为更广泛的联邦 AI 监管每年可能耗资数百亿美元。

  4. AI Policy Daily · 收录 · 原文 36

    特朗普与六家 AI 高管签署自愿审计协议,Cruz 阻止 AI 安全委员会立法

    特朗普与六位 AI 企业高管在白宫签署自愿协议,签约方包括 Anthropic CEO Dario Amodei、Meta CEO Mark Zuckerberg 和 Nvidia CEO Jensen Huang,各公司需聘请独立外部审计方检验内控并设立董事会委员会审议审计结果,特朗普称该协议具有道德约束力,并将在近日任命监督人。特朗普政府同时上线 America.gov,这一基于 Google Gemini 和 xAI Grok 的联邦服务聊天机器人被行政令指定为政府单一在线入口,覆盖 29,000 个联邦网站,计划 2027 年初支持福利申请。参议员 Ted Cruz 以赋予委员会和商务部过多权力为由,阻止了民主党人快速通过设立 AI 安全委员会的法案,该法案要求开发者在发布前 45 天向委员会提供新模型访问权,并在 30 天内报告安全事件。

  5. 论文追踪 · 收录 · 原文 论文35

    2026 新加坡 AI 安全研究优先级共识:聚焦社会韧性与自主 AI 智能体风险

    2026 新加坡共识(The 2026 Singapore Consensus)由第二届 AI 安全国际科学交流会议产出,汇集 13 个国家逾 100 位贡献者,来自前沿开发者、政府安全机构、学术界与公民社会。该报告在 2025 年报告基础上,提出全球对最高优先级技术 AI 安全研究问题的共识,并专门聚焦社会韧性以及管理日益自主的 AI 智能体所带来的风险。

  6. 论文追踪 · 收录 · 原文 论文46

    论文提出推理阶段 AI 治理的可行性分类框架

    论文《Beyond Training: A Feasibility Taxonomy for Inference-Time AI Governance》提出,当前算力治理以训练算力和训练后模型为监管单元,而推理时扩展、智能体脚手架和模型压缩正把能力迁移到部署阶段。作者构建了覆盖监控、验证与执行三类共二十项推理阶段机制的可行性分类,按四级就绪度量表对照四家厂商的证据基础评分,其中十五项已有商用技术底座在生产环境中运行,但治理级保证与对抗鲁棒性差异明显。用三维能力层级乘四类对手角色的对手模型做压力测试后,没有机制能对高能力国家层级部署者评为充分,微调会移除执行类机制中模型内部的组件,平台外部控制仍可保留。作者还通过替换分析把该分类与一篇配套硬件论文相连,提出条件性替换原则,并报告随机子集二次评分的一致性为二次加权 Cohen's kappa 0.74。

  7. 量子位 · 收录 · 原文 55

    OpenAI 安全透明度负责人 David Robinson 离职,三名安全员工因泄密被解雇

    据 BI 报道,OpenAI Safety Systems 团队内负责安全透明度职能的 David Robinson 已离职,本人尚未公开说明原因,OpenAI 也未公布继任者。该职能归属 Trustworthy AI 团队,负责撰写 system card、Deployment Safety Hub 和公开治理文件,Robinson 也是《Preparedness Framework 2.0》的主要起草人。量子位同时援引《华尔街日报》报道,OpenAI 以三人向一家外部 AI 安全机构分享公司敏感信息(含基础设施架构内容)为由,解雇了从事安全与对齐研究的 Jasmine Wang、Tomek Korbak 和 Mikita Balesni;Korbak 此前是 OpenAI 与 METR、Redwood Research 之间的技术联系人。

    2 条报道 · 2 个来源查看事件时间线与全部报道

    推荐理由梳理 OpenAI 安全透明度负责人离职与三名安全员工被解雇的经过,可对照其 Preparedness Framework 2.0 的职责分工理解人事变动的影响。

10月3日周六
  1. 论文追踪 · 收录 · 原文 论文48

    论文梳理二十个 AI 中等强国司法辖区的 GPAI 治理条款

    论文《Mapping General-Purpose AI Governance in Twenty AI Middle-Power Jurisdictions》以单条条款为单位,梳理了包括欧盟在内的二十个未设前沿开发者的 AI 中等强国司法辖区在 GPAI 治理上的立法情况,覆盖系统风险评估、评估与验证、带监测与检测的禁止条款、严重事件报告四个领域,并将确认缺失也作为数据记录。研究发现各辖区在形式上趋同但在约束力上分化:十六个辖区至少涉及四个领域中的三个,但仅约五分之一的条款位于有约束力的法律中,且四分之三具有约束力的文书未定义 GPAI。制度基础设施呈现相似形态,五分之四被梳理的治理主体其授权早于 GPAI 出现,义务落在既有制度已覆盖的应用层而非模型层;这些国家触及模型层时更多是建设观察能力而非对开发者施加义务,几乎所有评估机构在设立时都没有依据评估结果采取行动的权力。

  2. 论文追踪 · 收录 · 原文 论文46

    GIRAI 2026 报告:135 国负责任 AI 治理评估发布

    全球负责任 AI 指数(GIRAI)2026 报告基于 UNESCO 等人权框架,评估各国如何把负责任 AI 承诺转化为可执行的保护、机构能力与救济机制。评估覆盖 135 个国家的 68,138 个数据点、38 项指标,分政府 AI 政策与实施(17 项)、公民社会参与(5 项)、使能条件(15 项)及政府部署不可接受风险 AI 系统的记录案例,数据区间为 2023 年 11 月至 2025 年 9 月。结果显示,135 国中有 126 国至少有一项政府 AI 政策或举措,但往往未转化为实质保护:全球南方国家自首版以来新增 306 项框架指标案例中的 203 项,其中 78% 的框架不具约束力,全球北方为 42%。透明与可解释性是表现最好的指标之一,58% 的国家有相关框架,但仅 18% 要求公开政府算法;35 国存在政府部署不可接受风险 AI 系统的可信证据。

  3. Sam Bowman · 收录 · 原文 59

    Anthropic 承诺向第三方评估者提供员工级系统访问权限

    Anthropic 宣布将向第三方评估者提供永久、员工级别的系统访问权限,使其能够核查公司对安全措施的遵守情况、报告事件,并在训练期间评估模型的对齐状况。Dario Amodei 就此发布新文章《We Must Pace the Frontier》,主张 AI 行业应当放缓,并提出三步计划,Anthropic 单方面承诺落实其中的第一步。Sam Bowman 转发并评论称,这种持续问责将为安全带来许多有价值的可能性,他希望在其他地方也能看到类似做法。

    引用Dario Amodei@DarioAmodei

    We Must Pace the Frontier: I’ve written a new essay on why the AI industry should slow down, with a three-part plan for doing so. Anthropic is unilaterally committing to the first of these steps. We’ll provide third-party evaluators with permanent, employee-level access to our systems, so that they can verify adherence to our safety measures, report on incidents, and assess models’ alignment during training. You can read the full post here: https://darioamodei.com/post/we-must-pace-the-frontier

    推荐理由Anthropic 承诺向第三方评估者开放员工级系统访问,关注前沿实验室安全治理与外部问责机制的读者可了解这一安排。

  4. Ryan Greenblatt · 收录 · 原文 25

    Ryan Greenblatt 加入 METR 调查 AI 风险

    Ryan Greenblatt 宣布加入 METR,继续开展类似其 Hugging Face 报告那样的调查工作。他认为当前关于 AI 开发的大量基础信息未公开,而近期事件让他改变了对公开信息价值的怀疑态度;获取 AI 公司内部经核实的信息尤为紧迫,因为有限公开证据与“即将到来的递归自我改进可能大幅加速能力进展、甚至在一半年内产生极端超人类通用能力”的可能性相符。METR 初期将聚焦能力/起飞、对齐与控制,他希望其他团队覆盖安全、内部流程等领域。

  5. Zenity · 收录 · 原文 13

    OWASP、MITRE ATLAS 与 NIST 各自构建智能体 AI 安全框架

    OWASP、MITRE ATLAS 和 NIST 在过去一年各自建立了面向智能体 AI 的专门框架,独立得出同一结论:智能体需要独立的安全类别。Zenity 发布《企业智能体 AI 安全买家指南》,拆解了这一趋势的成因,并列出评估平台时真正重要的能力。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  6. OECD.AI(政策与事件监测) · 收录 · 原文 日期未知29

    弥合 AI 评估差距的五步路线图

    OECD.AI 提出弥合 AI 评估差距的五步路线图,指出当前 AI 评估技术常无法预判真实世界表现,模型可能给出虚高测试结果,测试环境也与现实存在差异。2026 年国际 AI 安全报告由 100 多名专家编写、30 多个国家和多边机构支持,提出"AI 证据困境"。路线图第一步是平衡标准化与定制化,在 2026 年印度 AI 影响峰会上多家公司承诺改进多语言与情境化评估。

  7. OECD.AI(政策与事件监测) · 收录 · 原文 日期未知17

    HAIP 如何将透明度从合规负担转变为竞争优势

    Salesforce 参与 OECD 广岛 AI 进程(HAIP)报告框架,认为该框架为智能体 AI 时代提供了跨司法管辖区的通用合规语言。文章指出,当前各国风险与透明度定义分歧造成监管碎片化,中小企业在多市场合规中处于劣势,而统一的分级要求框架可降低门槛。Salesforce 的 Agentforce 平台已在欧盟、美国、日本等地部署,需为每个司法管辖区单独准备合规文档。

  8. Gradient Institute(澳大利亚) · 收录 · 原文 22

    Australian AI Safety Forum 2026 将于 7 月在悉尼大学举办

    Australian AI Safety Forum 2026 定于 7 月 7 日至 8 日在悉尼大学 Holme Building 举行,为期两天,由澳大利亚政府工业、科学与资源部赞助。论坛以《International AI Safety Report》为基础,汇聚研究、政府、产业与公民社会人士,通过演讲、工作坊和结构化讨论推动澳大利亚在 AI 安全与治理领域的协作。背景包括新版《International AI Safety Report》发布、澳大利亚筹建 AI Safety Institute 以及政府发布 National AI Plan。

  9. Gradient Institute(澳大利亚) · 收录 · 原文 45

    澳大利亚 AI 安全研究所发布首份报告,分析跨组织 AI 智能体风险与控制

    澳大利亚 AI 安全研究所发布首份出版物,委托 Gradient Institute 撰写跨组织 AI 智能体风险报告。报告指出,由各自安全可靠的智能体组成的系统未必安全可靠,多智能体交互会产生新的涌现行为,这既是运营问题也是控制与人类监督问题。报告提出按共同治理程度划分的三层部署框架:单一治理、联邦治理和开放环境,层级越高,新失效模式越多,可用控制手段越超出单个部署组织的范围,需要共享框架、公共基础设施和集体行动。报告为部署组织梳理风险因素、失效模式和控制措施,为政策制定者标出多智能体安全缺口及可填补方,为研究者和标准机构列出多智能体评测方法与智能体基础设施等开放问题。

  10. 日本 AI 安全研究所(J-AISI) · 收录 · 原文 48

    日本 AI 安全研究所发布《AI 安全评估视角指南》第 1.20 版

    日本 AI 安全研究所(J-AISI)发布《AI 安全评估视角指南》第 1.20 版,结合 AI 智能体系统的普及,更新并扩充了评估视角与评估项示例。此次修订重新审视了既有评估视角,新增了部分评估项示例,并针对 AI 智能体系统特有的风险设立了“观测与控制”视角,补充了与“自主行为”和“外部环境交互”相关的评估项。该指南指出,AI 智能体系统能够自主行动并对外部系统或物理环境产生影响,因此需要应对传统 LLM 系统未能充分预想的风险。

    推荐理由日本 AI 安全研究所更新评估视角指南,新增面向 AI 智能体的观测与控制视角,可供做智能体安全评估的团队参考。