FAR.AI 联合国大会边会讨论 AI 安全护栏国际化
FAR.AI 本周在联合国大会期间召集联合国官员、反恐与 AI 安全专家及前沿实验室,讨论如何在国际范围落地 AI 安全护栏、防止 AI 被用于恐怖主义。与会者共识是政府、AI 公司与反恐专家需加强协作,政策制定者应尽早采取行动。




实验室的前沿安全框架、负责任扩展政策与准备框架的发布和修订。
FAR.AI 本周在联合国大会期间召集联合国官员、反恐与 AI 安全专家及前沿实验室,讨论如何在国际范围落地 AI 安全护栏、防止 AI 被用于恐怖主义。与会者共识是政府、AI 公司与反恐专家需加强协作,政策制定者应尽早采取行动。




OWASP、MITRE ATLAS 和 NIST 在过去一年各自建立了面向智能体 AI 的专门框架,独立得出同一结论:智能体需要独立的安全类别。Zenity 发布《企业智能体 AI 安全买家指南》,拆解了这一趋势的成因,并列出评估平台时真正重要的能力。
OECD.AI 提出弥合 AI 评估差距的五步路线图,指出当前 AI 评估技术常无法预判真实世界表现,模型可能给出虚高测试结果,测试环境也与现实存在差异。2026 年国际 AI 安全报告由 100 多名专家编写、30 多个国家和多边机构支持,提出"AI 证据困境"。路线图第一步是平衡标准化与定制化,在 2026 年印度 AI 影响峰会上多家公司承诺改进多语言与情境化评估。
Salesforce 参与 OECD 广岛 AI 进程(HAIP)报告框架,认为该框架为智能体 AI 时代提供了跨司法管辖区的通用合规语言。文章指出,当前各国风险与透明度定义分歧造成监管碎片化,中小企业在多市场合规中处于劣势,而统一的分级要求框架可降低门槛。Salesforce 的 Agentforce 平台已在欧盟、美国、日本等地部署,需为每个司法管辖区单独准备合规文档。
Australian AI Safety Forum 2026 定于 7 月 7 日至 8 日在悉尼大学 Holme Building 举行,为期两天,由澳大利亚政府工业、科学与资源部赞助。论坛以《International AI Safety Report》为基础,汇聚研究、政府、产业与公民社会人士,通过演讲、工作坊和结构化讨论推动澳大利亚在 AI 安全与治理领域的协作。背景包括新版《International AI Safety Report》发布、澳大利亚筹建 AI Safety Institute 以及政府发布 National AI Plan。
澳大利亚 AI 安全研究所发布首份出版物,委托 Gradient Institute 撰写跨组织 AI 智能体风险报告。报告指出,由各自安全可靠的智能体组成的系统未必安全可靠,多智能体交互会产生新的涌现行为,这既是运营问题也是控制与人类监督问题。报告提出按共同治理程度划分的三层部署框架:单一治理、联邦治理和开放环境,层级越高,新失效模式越多,可用控制手段越超出单个部署组织的范围,需要共享框架、公共基础设施和集体行动。报告为部署组织梳理风险因素、失效模式和控制措施,为政策制定者标出多智能体安全缺口及可填补方,为研究者和标准机构列出多智能体评测方法与智能体基础设施等开放问题。
日本 AI 安全研究所(J-AISI)发布《AI 安全评估视角指南》第 1.20 版,结合 AI 智能体系统的普及,更新并扩充了评估视角与评估项示例。此次修订重新审视了既有评估视角,新增了部分评估项示例,并针对 AI 智能体系统特有的风险设立了“观测与控制”视角,补充了与“自主行为”和“外部环境交互”相关的评估项。该指南指出,AI 智能体系统能够自主行动并对外部系统或物理环境产生影响,因此需要应对传统 LLM 系统未能充分预想的风险。
推荐理由日本 AI 安全研究所更新评估视角指南,新增面向 AI 智能体的观测与控制视角,可供做智能体安全评估的团队参考。
日本 AI 安全研究所(AISI)事业实证工作组下属的机器人子工作组(SWG)公开了《AI 机器人安全评估观感指南》。该指南面向与人共享空间、执行移动、对话、搬运等任务的 AI 机器人,用于识别和评估 AI 使用带来的新增风险,并据此考虑风险降低措施。指南把 AI 机器人可能产生的风险整理为物理、心理、社会三类,并以咖啡搬运机器人和远程操作型小型配送机器人作为设想用例,参考 AISI 此前制定的《AI 安全评估观感指南》,将评估 AI 机器人安全性时应确认的观感整理为 9 项。
EU AI Act 的高风险义务经 Digital Omnibus 延期至 2027 年 12 月 2 日,但第 50 条透明度义务已于 2026 年 8 月 2 日生效,违规最高可罚 1500 万欧元或全球年营收 3%。延期留下的是十六个月审计窗口,而非喘息期:透明度义务按单个系统适用,而超过半数组织缺乏系统性 AI 资产清单,影子 AI 已从安全缺口变成可被处罚的监管发现。
NIST 下属的 CAISI 于 2026 年 3 月 9 日发布报告 NIST AI 800-4《Challenges to the Monitoring of Deployed AI Systems》,基于 2025 年举办的三场从业者研讨会和一次深度文献综述,梳理部署后 AI 系统监控的现状与挑战。报告通过主题编码归纳出六类监控:功能监控、运行监控、人为因素监控、安全监控、合规监控和大规模影响监控,并给出各自定义。报告按监控类别和跨类别两个维度组织研讨会引述与文献摘录,列出缺口、障碍与开放问题,例如人机反馈回路研究不足、检测欺骗行为的方法探索不够、分布式基础设施日志碎片化、缺乏可信的方法与工具标准、信息共享生态不成熟,以及如何平衡自动化监控与人工验证等。报告称其核心贡献是识别、组织和记录这些监控挑战,并呈现领域专家的观点,完整方法与编码手册见附录 B 和附录 C。
推荐理由报告把部署后监控拆成六类并列出跨类别缺口,为制定监控标准与审计流程的机构提供共同语言。
Irregular 与 RAND 及多家机构作者联合发布论文《AI Security Priorities: A Field-Wide Agenda》,20 多位来自前沿 AI 实验室、产业界、政府和学术界的专家参与。论文围绕战略基础与政策框架、公私协调与制度基础设施、技术安全工程与保障、对抗压力下的智能体 AI 治理四大主题,列出十项最高优先级领域,并指出成本效益最高的优先事项是共享资源、评估协议和事件响应实践等基础性工作,而最重要的优先事项多需大规模机构或政府行动,且往往最难执行,无单一主体能独自承担。
Apollo Research 公布其在安全、科学传播与利益冲突方面的内部规范。利益冲突政策要求不接受以研究结果为条件的报酬,也不接受被评估机构的杂项资助,并让有财务利益的个人回避相关评估。安全方面遵循最小权限原则,默认将新项目设为最高保密等级,采用差异化发布,信息安全策略对齐 ISO/IEC 27001、SOC 2,并正推进 ISO/IEC 27001/42001 与 SOC 2 Type II 认证。
Apollo Research 将研究重心从谋划评测转向"谋划科学",研究长时程强化学习等规模化趋势如何塑造模型行为,并已发现前沿训练中可自然涌现对监督的推理。其监控团队为编码智能体构建 Watcher 产品,含实时拦截的 Watcher Live 与可观测性层 Watcher Analyze。治理团队聚焦失控、内部部署与自动化 AI 研发,并发布《失控应对手册》等报告。
国际先进 AI 测量、评估与科学网络(NAAIMES,前身为国际 AI 安全研究所网络)完成首份最佳实践指导文件,面向第三方评测机构,内容涵盖评测目标界定与基准选择、输出生成与分析环节的可比性、能力激发(capability elicitation)的迭代方法,以及评测流程与结果追踪中的日志和调试问题。该文件以 NIST AI 800-2 为基础并作补充。在首尔 2026 国际机器学习大会期间,网络成员与产业界和公民社会代表会面,展示评测工具(如 AISI 新发布的 Engineering Playbook),并讨论评测 AI 智能体时遇到的开放问题。网络成员后续将围绕智能体能力对齐更多最佳实践。
推荐理由国际 AI 评测网络发布首份最佳实践文件,并汇总新加坡、加拿大、法国三家机构对系统级测试、信息披露与资源优先级的公开讨论。
Anthropic 推出生命科学验证计划(LSVP),让通过验证的生命科学机构在 Mythos、Opus 和 Sonnet 模型上获得对生物学工作更宽松的安全设置,此前这些任务在通用模型中会被拦截。申请者需经过研究资质、安全标准和伦理监督审查,通过后可申请两类授权:Standard Use 面向多数生命科学日常工作,可按团队发放并每年续期,目前覆盖 Mythos 5.1、Opus 5 和 Sonnet 5;High-risk Use 是附加授权,针对 Standard Use 下被拦截的双用途研究,会移除阻断生命科学请求的全部护栏,仅限单个研究项目并每六个月续期,目前适用于 Claude Opus 5 和 Claude Sonnet 5,Mythos 的高风险授权仍在与美国政府协商。该计划以 beta 形式面向团队和机构开放,暂不支持个人订阅和第三方平台,也不适用于启用 BAA 的机构。
推荐理由Anthropic 把生物领域访问拆成标准与高风险两类授权,并说明离线监控与数据留存 30 天的取舍,可供设计分级访问的团队参考。
Anthropic 宣布与 Accenture 合作开展前沿 AI 的独立评估,由其专业 AI 业务 Faculty 牵头,内容包括模型评估与红队测试、对齐评估和模型护栏测试。这是 Anthropic CEO 在《We Must Pace the Frontier》一文中承诺把评估者嵌入公司内部的落地步骤。嵌入式评估者将在 AI 公司内部工作,拥有与员工相当的访问权限,可以观察模型在训练中成形、跟踪构建与部署决策并直接与员工交流,从而核查公司是否履行安全承诺并报告事件。双方预计未来五年各投入至少 10 亿美元建设这一领域的能力。该合作非排他,Anthropic 表示会在发文后数周内公布其他评估方,Accenture 也将以类似身份与其他 AI 开发者合作。
推荐理由Anthropic 披露了嵌入式评估的合作方、权限范围与出资安排,可对照其前沿安全承诺看落地方式。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向一批可信网络防御者开放,并参与美国政府的前置模型访问自愿流程,之后再逐步扩展到开发者、企业和消费者。Argon 面向长周期复杂工作流,输出 token 上限从 64K 提升到 1M,在 DeepSWE v1.1 上取得 77.9%,在 LVBench 长视频理解上取得 91.7%,在 Zapier 的 AutomationBench 上以 51.3% 排名第一。
推荐理由Google DeepMind 在发布前公开了 Gemini 4 Argon 的分阶段开放安排与四类前沿安全措施,可对照其 Frontier Safety Framework 看能力与防护如何同步推进。
来 @AISecurityInst 和我一起工作! AI 安全存在一个巨大缺口:我们对错位如何产生有很多好想法,但我认为,对于危险错位的 AI 实际会做什么,我们的模型很糟糕。很多叙事直接从“错位”跳到“神级 ASI 施展魔法”。 1/5
英国 AI 安全研究所(AISI)宣布两项高层任命:Henry de Zoete 出任总监,Nate Burnikell 出任首席战略官。de Zoete 曾参与 AISI 的创立并为政府提供 AI 咨询,Burnikell 自 AISI 成立之初便参与其工作,助其成为前沿 AI 安全领域的权威机构。两人将在 AI 发展的关键时期共同推进 AISI 的使命;即将离任的临时总监 Adam Beaumont 将返回 GCHQ。


Anthropic 宣布与 Accenture 合作开展前沿 AI 的独立评估,这是其近期承诺在 Anthropic 内部嵌入评估方的一部分。双方预计在未来五年各投入至少 10 亿美元用于建设这一领域的能力。Anthropic 在公告中给出了合作详情链接。