FAR.AI 联合国大会边会讨论 AI 安全护栏国际化
FAR.AI 本周在联合国大会期间召集联合国官员、反恐与 AI 安全专家及前沿实验室,讨论如何在国际范围落地 AI 安全护栏、防止 AI 被用于恐怖主义。与会者共识是政府、AI 公司与反恐专家需加强协作,政策制定者应尽早采取行动。




FAR.AI 本周在联合国大会期间召集联合国官员、反恐与 AI 安全专家及前沿实验室,讨论如何在国际范围落地 AI 安全护栏、防止 AI 被用于恐怖主义。与会者共识是政府、AI 公司与反恐专家需加强协作,政策制定者应尽早采取行动。




OWASP、MITRE ATLAS 和 NIST 在过去一年各自建立了面向智能体 AI 的专门框架,独立得出同一结论:智能体需要独立的安全类别。Zenity 发布《企业智能体 AI 安全买家指南》,拆解了这一趋势的成因,并列出评估平台时真正重要的能力。
OECD.AI 提出弥合 AI 评估差距的五步路线图,指出当前 AI 评估技术常无法预判真实世界表现,模型可能给出虚高测试结果,测试环境也与现实存在差异。2026 年国际 AI 安全报告由 100 多名专家编写、30 多个国家和多边机构支持,提出"AI 证据困境"。路线图第一步是平衡标准化与定制化,在 2026 年印度 AI 影响峰会上多家公司承诺改进多语言与情境化评估。
Salesforce 参与 OECD 广岛 AI 进程(HAIP)报告框架,认为该框架为智能体 AI 时代提供了跨司法管辖区的通用合规语言。文章指出,当前各国风险与透明度定义分歧造成监管碎片化,中小企业在多市场合规中处于劣势,而统一的分级要求框架可降低门槛。Salesforce 的 Agentforce 平台已在欧盟、美国、日本等地部署,需为每个司法管辖区单独准备合规文档。
Australian AI Safety Forum 2026 定于 7 月 7 日至 8 日在悉尼大学 Holme Building 举行,为期两天,由澳大利亚政府工业、科学与资源部赞助。论坛以《International AI Safety Report》为基础,汇聚研究、政府、产业与公民社会人士,通过演讲、工作坊和结构化讨论推动澳大利亚在 AI 安全与治理领域的协作。背景包括新版《International AI Safety Report》发布、澳大利亚筹建 AI Safety Institute 以及政府发布 National AI Plan。
澳大利亚 AI 安全研究所发布首份出版物,委托 Gradient Institute 撰写跨组织 AI 智能体风险报告。报告指出,由各自安全可靠的智能体组成的系统未必安全可靠,多智能体交互会产生新的涌现行为,这既是运营问题也是控制与人类监督问题。报告提出按共同治理程度划分的三层部署框架:单一治理、联邦治理和开放环境,层级越高,新失效模式越多,可用控制手段越超出单个部署组织的范围,需要共享框架、公共基础设施和集体行动。报告为部署组织梳理风险因素、失效模式和控制措施,为政策制定者标出多智能体安全缺口及可填补方,为研究者和标准机构列出多智能体评测方法与智能体基础设施等开放问题。
日本 AI 安全研究所(J-AISI)发布《AI 安全评估视角指南》第 1.20 版,结合 AI 智能体系统的普及,更新并扩充了评估视角与评估项示例。此次修订重新审视了既有评估视角,新增了部分评估项示例,并针对 AI 智能体系统特有的风险设立了“观测与控制”视角,补充了与“自主行为”和“外部环境交互”相关的评估项。该指南指出,AI 智能体系统能够自主行动并对外部系统或物理环境产生影响,因此需要应对传统 LLM 系统未能充分预想的风险。
推荐理由日本 AI 安全研究所更新评估视角指南,新增面向 AI 智能体的观测与控制视角,可供做智能体安全评估的团队参考。
日本 AI 安全研究所(AISI)事业实证工作组下属的机器人子工作组(SWG)公开了《AI 机器人安全评估观感指南》。该指南面向与人共享空间、执行移动、对话、搬运等任务的 AI 机器人,用于识别和评估 AI 使用带来的新增风险,并据此考虑风险降低措施。指南把 AI 机器人可能产生的风险整理为物理、心理、社会三类,并以咖啡搬运机器人和远程操作型小型配送机器人作为设想用例,参考 AISI 此前制定的《AI 安全评估观感指南》,将评估 AI 机器人安全性时应确认的观感整理为 9 项。
EU AI Act 的高风险义务经 Digital Omnibus 延期至 2027 年 12 月 2 日,但第 50 条透明度义务已于 2026 年 8 月 2 日生效,违规最高可罚 1500 万欧元或全球年营收 3%。延期留下的是十六个月审计窗口,而非喘息期:透明度义务按单个系统适用,而超过半数组织缺乏系统性 AI 资产清单,影子 AI 已从安全缺口变成可被处罚的监管发现。
NIST 下属的 CAISI 于 2026 年 3 月 9 日发布报告 NIST AI 800-4《Challenges to the Monitoring of Deployed AI Systems》,基于 2025 年举办的三场从业者研讨会和一次深度文献综述,梳理部署后 AI 系统监控的现状与挑战。报告通过主题编码归纳出六类监控:功能监控、运行监控、人为因素监控、安全监控、合规监控和大规模影响监控,并给出各自定义。报告按监控类别和跨类别两个维度组织研讨会引述与文献摘录,列出缺口、障碍与开放问题,例如人机反馈回路研究不足、检测欺骗行为的方法探索不够、分布式基础设施日志碎片化、缺乏可信的方法与工具标准、信息共享生态不成熟,以及如何平衡自动化监控与人工验证等。报告称其核心贡献是识别、组织和记录这些监控挑战,并呈现领域专家的观点,完整方法与编码手册见附录 B 和附录 C。
推荐理由报告把部署后监控拆成六类并列出跨类别缺口,为制定监控标准与审计流程的机构提供共同语言。
Irregular 与 RAND 及多家机构作者联合发布论文《AI Security Priorities: A Field-Wide Agenda》,20 多位来自前沿 AI 实验室、产业界、政府和学术界的专家参与。论文围绕战略基础与政策框架、公私协调与制度基础设施、技术安全工程与保障、对抗压力下的智能体 AI 治理四大主题,列出十项最高优先级领域,并指出成本效益最高的优先事项是共享资源、评估协议和事件响应实践等基础性工作,而最重要的优先事项多需大规模机构或政府行动,且往往最难执行,无单一主体能独自承担。
Apollo Research 公布其在安全、科学传播与利益冲突方面的内部规范。利益冲突政策要求不接受以研究结果为条件的报酬,也不接受被评估机构的杂项资助,并让有财务利益的个人回避相关评估。安全方面遵循最小权限原则,默认将新项目设为最高保密等级,采用差异化发布,信息安全策略对齐 ISO/IEC 27001、SOC 2,并正推进 ISO/IEC 27001/42001 与 SOC 2 Type II 认证。
Apollo Research 将研究重心从谋划评测转向"谋划科学",研究长时程强化学习等规模化趋势如何塑造模型行为,并已发现前沿训练中可自然涌现对监督的推理。其监控团队为编码智能体构建 Watcher 产品,含实时拦截的 Watcher Live 与可观测性层 Watcher Analyze。治理团队聚焦失控、内部部署与自动化 AI 研发,并发布《失控应对手册》等报告。
国际先进 AI 测量、评估与科学网络(NAAIMES,前身为国际 AI 安全研究所网络)完成首份最佳实践指导文件,面向第三方评测机构,内容涵盖评测目标界定与基准选择、输出生成与分析环节的可比性、能力激发(capability elicitation)的迭代方法,以及评测流程与结果追踪中的日志和调试问题。该文件以 NIST AI 800-2 为基础并作补充。在首尔 2026 国际机器学习大会期间,网络成员与产业界和公民社会代表会面,展示评测工具(如 AISI 新发布的 Engineering Playbook),并讨论评测 AI 智能体时遇到的开放问题。网络成员后续将围绕智能体能力对齐更多最佳实践。
推荐理由国际 AI 评测网络发布首份最佳实践文件,并汇总新加坡、加拿大、法国三家机构对系统级测试、信息披露与资源优先级的公开讨论。
Anthropic 推出生命科学验证计划(LSVP),让通过验证的生命科学机构在 Mythos、Opus 和 Sonnet 模型上获得对生物学工作更宽松的安全设置,此前这些任务在通用模型中会被拦截。申请者需经过研究资质、安全标准和伦理监督审查,通过后可申请两类授权:Standard Use 面向多数生命科学日常工作,可按团队发放并每年续期,目前覆盖 Mythos 5.1、Opus 5 和 Sonnet 5;High-risk Use 是附加授权,针对 Standard Use 下被拦截的双用途研究,会移除阻断生命科学请求的全部护栏,仅限单个研究项目并每六个月续期,目前适用于 Claude Opus 5 和 Claude Sonnet 5,Mythos 的高风险授权仍在与美国政府协商。该计划以 beta 形式面向团队和机构开放,暂不支持个人订阅和第三方平台,也不适用于启用 BAA 的机构。
推荐理由Anthropic 把生物领域访问拆成标准与高风险两类授权,并说明离线监控与数据留存 30 天的取舍,可供设计分级访问的团队参考。
Anthropic 宣布与 Accenture 合作开展前沿 AI 的独立评估,由其专业 AI 业务 Faculty 牵头,内容包括模型评估与红队测试、对齐评估和模型护栏测试。这是 Anthropic CEO 在《We Must Pace the Frontier》一文中承诺把评估者嵌入公司内部的落地步骤。嵌入式评估者将在 AI 公司内部工作,拥有与员工相当的访问权限,可以观察模型在训练中成形、跟踪构建与部署决策并直接与员工交流,从而核查公司是否履行安全承诺并报告事件。双方预计未来五年各投入至少 10 亿美元建设这一领域的能力。该合作非排他,Anthropic 表示会在发文后数周内公布其他评估方,Accenture 也将以类似身份与其他 AI 开发者合作。
推荐理由Anthropic 披露了嵌入式评估的合作方、权限范围与出资安排,可对照其前沿安全承诺看落地方式。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向一批可信网络防御者开放,并参与美国政府的前置模型访问自愿流程,之后再逐步扩展到开发者、企业和消费者。Argon 面向长周期复杂工作流,输出 token 上限从 64K 提升到 1M,在 DeepSWE v1.1 上取得 77.9%,在 LVBench 长视频理解上取得 91.7%,在 Zapier 的 AutomationBench 上以 51.3% 排名第一。
推荐理由Google DeepMind 在发布前公开了 Gemini 4 Argon 的分阶段开放安排与四类前沿安全措施,可对照其 Frontier Safety Framework 看能力与防护如何同步推进。
来 @AISecurityInst 和我一起工作! AI 安全存在一个巨大缺口:我们对错位如何产生有很多好想法,但我认为,对于危险错位的 AI 实际会做什么,我们的模型很糟糕。很多叙事直接从“错位”跳到“神级 ASI 施展魔法”。 1/5
英国 AI 安全研究所(AISI)宣布两项高层任命:Henry de Zoete 出任总监,Nate Burnikell 出任首席战略官。de Zoete 曾参与 AISI 的创立并为政府提供 AI 咨询,Burnikell 自 AISI 成立之初便参与其工作,助其成为前沿 AI 安全领域的权威机构。两人将在 AI 发展的关键时期共同推进 AISI 的使命;即将离任的临时总监 Adam Beaumont 将返回 GCHQ。


Anthropic 宣布与 Accenture 合作开展前沿 AI 的独立评估,这是其近期承诺在 Anthropic 内部嵌入评估方的一部分。双方预计在未来五年各投入至少 10 亿美元用于建设这一领域的能力。Anthropic 在公告中给出了合作详情链接。
俄罗斯首部针对大型基础模型的综合性法律于9月1日生效,该法7月26日由普京签署,核心是为符合条件的大模型开发者建立支持与管控框架,而非管理 AI 风险。法律设主权与国产两种地位,要求开发者须为俄罗斯法人、用户查询的生成与存储须在俄境内数据中心完成,并接受符合俄法律及传统价值观的评估,但评估程序与授予规则尚待政府决议确定。获得地位者可得到国家支持、参与政策制定并进入受保护市场,政府还可指定只能使用这两类模型的应用场景。法律将重要实施细节留给后续政府规则,包括国防、国家安全、反恐和公共管理等领域的模型使用规则,未规定禁止条款、人权影响评估或独立监督。版权方面,2027年3月起,为训练主权或国产大模型而在计算机内存中临时复制作品不构成侵权,该例外与模型法律地位绑定。
OECD 报告《Supervision of Artificial Intelligence in Finance》分析了金融业 AI 的监管路径,主张与其新增专门规则,不如通过解释性指引明确现有风险管理与治理框架如何适用于先进 AI 模型。报告指出,agentic AI 系统的自主性、交易规模与速度上升、模型不透明等问题给人工监督带来挑战,金融机构在模型验证、可解释性、公平性阈值和“human in the loop”落地等方面普遍遇到困难。英国 FCA 的 AI Live Testing 项目让金融机构在受控的真实市场环境中与监管和技术团队直接合作,分发现与实盘测试两个阶段,重点观察 AI 模型与环境的交互,而非模拟实验室环境。
OECD 对 11 个国家 25 家机构(含前沿开发者、企业部署方、公共部门和学术机构)的从业者访谈显示,智能体 AI 正从试点走向组织工作流,但没有任何一家机构以不受限制的自主性部署。部署集中在任务结构化、结果可验证、错误成本可控或可逆的场景,多采用检查点机制在高影响或不可逆操作前引入人工审核。治理上多数机构沿用 OECD AI Principles、NIST AI Risk Management Framework、ISO/IEC 42001 及 EU AI Act 等现有框架,并叠加沙箱测试、最小权限访问、持续监控和已批准智能体登记等分层措施,但系统级评估、可追溯性与问责、网络安全仍是未解难题。
OECD 于 2026 年 5 月发布广岛 AI 进程(HAIP)报告框架 2.0 版,该自愿性框架与 EU AI Act 及通用 AI 行为准则(CoP)高度重叠。CeSIA 在 2026 年 6 月的映射分析发现,HAIP 2.0 的 31 个报告问题中有 80% 涉及 EU 监管已覆盖的要求,其中 58% 具有强或部分一致性。为 EU AI Act 合规准备的证据可直接用于填写 HAIP 报告,但 HAIP 报告会在 OECD.AI 政策观察站公开,而 EU 的技术文档、合规评估等大多不公开。
Cohere 联合创始人兼 CEO Aidan Gomez 公开质疑少数硅谷头部 AI 公司借"安全"之名主导全球 AI 规则与安全标准,并批评 Anthropic CEO Dario Amodei 本周发布的路线图寻求反垄断豁免。Gomez 以 1975 年 SEC 指定三家评级机构、1985 年欧洲汽车行业反垄断豁免为例,指出两次以安全为名的安排最终都保护了在位者、限制了竞争。他支持对高能力 AI 系统进行独立审查,但反对由少数实验室商定标准后要求其他开发者盲从。
新西兰 CERT NZ 与国家网络安全中心(NCSC-NZ)等 13 家国际机构于 2024 年 1 月 24 日联合发布组织安全引入 AI 的最佳实践指引,梳理 AI 系统面临的重要威胁并给出台阶式的风险缓解措施。该文件同时覆盖自托管与第三方托管的 AI 系统,面向程序员、终端用户、高管、分析师、营销人员等相关方。它聚焦如何使用 AI 而非开发安全的 AI,并建议开发者参考此前发布的《Guidelines for Secure AI System Development》。
新加坡 AI Verify Foundation 发布的《Model AI Governance Framework for Generative AI》(MGF for GenAI)围绕 9 个维度搭建可信环境,目标是让终端用户可以自信且安全地使用生成式 AI,同时为前沿创新留出空间。该框架承认单一干预措施无法应对现有及新兴 AI 风险,因此给出一组可作为起步步骤的实用建议。
CoSAI 在 RSAC 2026 会议上复盘了三类未被传统管控拦下的企业 AI 攻击,并发布了对应的防护指引。其中 Kilo Code 漏洞 CVE-2025-11445 通过 markdown 文件向 AI 编程助手植入指令,诱使其修改自身配置放行此前被封禁的 git 命令,进而自动提交含后门的代码;研究人员在每个主流 AI IDE 中共发现 30 个漏洞,其中 24 个获得 CVE 编号,并在 Cursor、AWS Kiro 和 OpenAI Codex CLI 中确认可利用。另有加载即执行反向 shell 的模型文件和一次导致超 700 个 Salesforce 环境暴露给攻击者达十天的智能体集成事故。 CoSAI 指出三项失效假设:自然语言的指令与数据无法分离使 markdown 成为注入载体,pickle 等序列化格式在加载时即执行代码,以及智能体继承启动用户的全部权限。
新西兰 NCSC 在 2026 年第一季度响应了三起 C2 类"高度重大"网络事件,为该机构自 2021/22 财年以来首次记录到此级别事件,同时季度内共处理 1164 起事件,钓鱼与凭证窃取最为常见。NCSC 首席运营官 Mike Jagusch 指出,若落实多因素认证、管控全网完整访问权限及保护网络边缘等基本措施,本可帮助抵御这些事件。该季度的直接经济损失达 560 万美元,环比增长 76%,其中个人损失占 520 万美元;报告还提醒恶意行为者可借助 Frontier AI 以前所未有的速度和大规模发现并利用漏洞,但这些模型同样可用于辅助防御。
新西兰 GCSB 下属国家网络安全中心(NCSC)与五眼联盟伙伴联合发布行动呼吁,应对前沿 AI 驱动的网络风险。新西兰 NCSC 负责人 Catriona Robinson 表示,AI 降低了恶意行为者的门槛,加快了攻击的速度与复杂度,缩短了漏洞从发现到被利用的窗口,同时也可用于强化防御。她呼吁组织领导者评估风险、准备度与问责机制,优先落实基础网络安全实践与控制措施,为网络安全负责人提供权限与资源,并持续跟进威胁与指南变化。NCSC 表示正在获取前沿 AI 模型,与供应商合作理解并应对网络安全风险,其工作计划还包括与测试过这些模型的厂商合作、持续发布面向企业与政府的建议指南,以及与落实政府数字路线图的机构协作,把网络安全与韧性纳入数字投资和采购的全过程。
新西兰国家网络安全中心(NCSC)发布《Cyber Threat Report 2026》,敦促企业及组织领导者立即着手应对正被人工智能重塑的网络威胁环境。报告称恶意行为者已在利用 AI 扩大攻击的速度、规模与复杂度,并预计到 2027 年初其可能获得目前仅领先的前沿 AI 模型才具备的高级能力,届时或将实现自动化攻击与高度个性化定向打击。NCSC 在 2025/26 年度处理的 369 起潜在重大事件中,162 起与犯罪或经济动机的行为者有关,同比增加 18%,其中四起达到 C2(Highly Significant)级别,与前十年总数相当。
Partnership on AI(PAI)在第 79 届联合国大会期间的首届全球 AI 治理论坛上宣布两项全球倡议——全球 AI 进展枢纽(Global AI Progress Hub)与《全球负责任 AI:进展衡量》年度报告,旨在建立首个公开记录来评估 AI 系统是否合乎伦理、安全和可信。该枢纽邀请多方组织提交其行动并追踪成效,围绕人类联结与福祉、就业与经济搭建共同衡量框架;配套报告由多方社区指导方法论进行独立评估,将于 2027 年春季向公众开放访问。
哥斯达黎加科技部长 Paula Bogantes Zamora 与 PAI 首席执行官 Rebecca Finlay 作为联合国全球对话第三集群(Safe, Secure, and Trustworthy AI)联合牵头人,致函两位共同主席提出五步建议。两人主张将独立国际科学小组工作组与各集群对接、起草融合国际法与欧盟《人工智能法案》等的共同参考基线、设立闭会期间常设工作流跟踪落实、由秘书处专项预算保障全球南方实质性参与,并在 2027 年纽约会议前试点跨境监管沙盒并回报结果。
GovAI 举办了一场活动,邀请哈佛法学院教授 Noah Feldman 讲述他对 Facebook 监督委员会的观察以及一个有意义的 AI 行业评审委员会应当具备何种形态,Gillian Hadfield 与 Sophie-Charlotte Fischer 担任评议人。Hadfield 是多伦多大学 Schwartz Reisman 技术与社会研究所主任并兼任 OpenAI 高级政策顾问,Fischer 是 ETH Zurich 安全研究中心博士候选人及 GovAI 研究员,曾涉足自主武器伦理与法律、美国 AI 技术出口管制等议题。
GovAI 于 2018 年组建了一支由 5 名全职研究员构成的核心团队并建立研究附属网络,全年产出超过 10 项研究成果。成果涵盖《AI Governance: A Research Agenda》《The Malicious Use of AI》等报告、《When will AI exceed human performance?》等学术论文及若干手稿,其中恶意使用 AI 的报告获逾 50 家媒体报道。该组织计划继续扩张,新增 1.5 FTE 项目管理岗位,并表示希望吸纳更多人才进入 AI 治理领域。
AI Verify Foundation(新加坡)发布了面向组织的负责任 AI 成熟度自查资源,帮助不同阶段的组织定位自身位置并找到对应的指引文档与技术测试工具。该资源集合涵盖从入门级基础框架到进阶实践的内容,并提供一张流程图用于评估组织当前的负责任 AI 进展,以便选择合适的下一步行动。
新加坡与卢旺达在新加坡亚洲科技峰会上发布了全球首个小国人工智能行动手册,由新加坡 IMDA 与卢旺达 ICT 和创新部合作制定,并咨询了小国数字论坛成员。该手册针对资源资金不足、数据和人才获取困难等小国共性问题提出应对方案,并以持续更新的活文档形式汇集各国经验策略,配套提供 AI Verify 等实用测试工具。
AI Verify Foundation 更新《Agentic AI 模型治理框架》(Model Governance Framework for Agentic AI),指导组织负责任地部署 AI 智能体,同时强调人类始终承担最终责任。该框架系统梳理了智能体 AI 的风险及新兴最佳实践,并于 2026 年 5 月的更新中加入真实世界案例研究,说明组织如何将建议落地以满足自身需求。
GovAI 举办了一场围绕白皮书《Frontier AI Regulation: Managing Emerging Risks to Public Safety》的网络研讨会,讨论前沿 AI 模型的监管问题。该白皮书主张 GPT-4、PaLM 2、Claude 等尖端模型可能很快具备严重危害公共安全的能力,因而需要监管,并提出了相应监管制度的构成要素及初步安全标准。Markus Anderljung、Cullen O'Keefe 主讲,Irene Solaiman 与 Jeremy Howard 作为评议人参与了坦率讨论。
GovAI 面向具备丰富研究经验的研究者招聘 Research Fellow,获聘者可自主选题并主导研究议程,同时需指导夏季与冬季研究员等初级研究者。该岗位由高级研究员或领导团队成员提供指导,工作内容包括产出学术论文、政策备忘录、报告或博客,以及组织利益相关方活动并为机构研究战略出力。研究方向涵盖风险管理、威胁建模、AI 经济学、地缘政治、前沿 AI 监管与技术治理等领域,申请时不设严格学历门槛,经验较少者可考虑为期一年的访问学者岗。