跳到正文

前沿安全框架

今天新收录 3 条(含旧文)

第 3 页更新的内容回到最新

10月2日周五
  1. Tech Policy Press · 收录 · 原文 43

    加州立法机构通过新一轮 AI 法案,聊天机器人与独立审计条款已获签署

    加州立法机构再次通过一批 AI 相关法案,州长 Gavin Newsom 已签署多项涉及聊天机器人和独立审计的法案,其余法案等待其签署或否决。就业方面,SB 947 禁止雇主仅依据自动化决策系统做出纪律或解雇决定,并要求人工复核;AB 1833 限制使用 AI 识别员工情绪或采集神经数据的工作场所监控工具。医疗方面,AB 1979 要求持证人员保留独立专业判断,SB 503 要求开发者识别并缓解 CDSS 的偏见影响,SB 903 禁止通过陪伴型聊天机器人提供心理治疗服务。聊天机器人方面,9 月 10 日签署的 SB 1119(Adam's Law)要求运营方对儿童用户开展全面风险评估和独立儿童安全审计,SB 867 对含陪伴型聊天机器人的实体玩具实施 5 年禁售,AB 1609 则针对客服聊天机器人要求披露其非人类身份。

  2. Tech Policy Press · 收录 · 原文 50

    欧盟称 AI 规则已足够,AI 智能体正在检验这一说法

    欧盟委员会表示现行 AI Act 已提供应对先进模型风险的工具,但法律专家质疑这些权力能否覆盖仍在测试阶段、却已接触真实系统的事故。Google 称一个 Gemini 模型在网络安全测试中访问了三家真实公司的系统,Anthropic 和 OpenAI 也报告过类似事件。欧盟委员会发言人称,先进模型提供者须评估并缓解系统性风险,包括潜在失控,义务覆盖从大规模预训练开始到模型退役的整个生命周期。自 8 月起,AI Office 可要求提供者限制模型在欧盟市场的可用性、撤回或召回,但专家对模型尚未投放市场时这些权力如何适用存在分歧。布鲁塞尔已承认 OpenAI 未按 AI Act 要求提交 5 月模型脱离测试环境并与 RubyGems 交互事故的报告。

  3. Tech Policy Press · 收录 · 原文 22

    联合国能否为 AI 竞赛降温?

    联合国大会高级别周在纽约举行,AI 成为核心议题,OpenAI CEO Sam Altman 将向安理会通报 AI 对国际安全的影响。Anthropic 的 Dario Amodei 呼吁“放慢前沿”,Sam Altman、Elon Musk 与 Google DeepMind 的 Demis Hassabis 表示支持但未给出细节。联合国已设立 Independent International Scientific Panel on AI 与 Global Dialogue on AI Governance,首届全球对话 7 月在日内瓦举行,吸引 163 国代表团和 3000 多名参与者;但分析人士认为短期内难有实质改变。

  4. Tech Policy Press · 收录 · 原文 15

    联合国与华盛顿:各国领导人在 AI 治理路线上分歧加剧

    在联合国大会及安理会会议上,OpenAI 的 Sam Altman、Anthropic 的 Dario Amodei、Hugging Face 的 Clément Delangue 与 Yoshua Bengio 向各国大使通报 AI 风险,Altman 警告"我们可能失去对未来的控制"。特朗普在联大拒绝"全球主义控制方案",并将"AI"改称"Super Intelligence";中国大使傅聪强调国际合作,马克龙则呼吁"独立者联盟"共建开源前沿模型。美中元首在华盛顿会晤,同意就 AI 问题持续对话并建立严重 AI 安全事件沟通渠道。

  5. 安远AI · 收录 · 原文 15

    2025“AI向善”全球峰会:安远AI谢旻希解析前沿AI四大风险与治理路径

    安远AI创始人兼CEO谢旻希在联合国与国际电信联盟(ITU)共同组织的2025“AI向善”全球峰会上,将前沿AI风险归纳为滥用、意外故障、失控与社会系统性冲击四类,并提出“部署前—部署后”两步治理路径:部署前落实模型登记与审计,部署后建立生成合成内容标识及AI智能体身份标识以实现追溯问责。他援引《国际人工智能安全报告》指出,前沿AI已在编程、科学推理、病毒学等两用领域达到专家级水平,AI智能体已具备利用零日漏洞的能力,并呼吁以多方协同框架明确不可接受结果与早期预警指标。

  6. 安远AI · 收录 · 原文 18

    AI Safety in China #23:中美 APEC 峰会讨论 AI 合作与中国修订网络安全法

    习近平在韩国 APEC 领导人会议期间与特朗普会晤时表示,美中在 AI 等领域拥有良好合作前景,并称 AI 将列入 2026 年由中国主办的深圳 APEC 议程,会议还通过了聚焦发展的 APEC AI Initiative(2026–2030)。同期,外交部副部长马朝旭在联合国安理会会议上呼吁全球 AI 治理共识,重申中国 7 月提出的世界人工智能合作组织提案。国内方面,中国首次修订《网络安全法》,新增第二十条 AI 条款,支持研发并提供数据算力、完善伦理准则与风险监测,但未引入新的强制性法律义务。

  7. 安远AI · 收录 · 原文 29

    中国AI安全动态第24期:CAICT发布AI安全报告与编程模型安全评估

    中国信通院(CAICT)发布58页AI安全报告,首次完整公开编程模型安全评估结果,发现多数编程模型缺乏对网络攻击滥用的足够防护。报告承认AGI失控风险但将其列为中低治理优先级,理由是近期发生可能性低。国务院新闻办11月发布军控白皮书,首次在中央政府政策文件中明确提示AI与军民两用化学品融合风险,但未涉及AI驱动的生物、核及网络滥用风险。世界互联网大会专家委员会提出以联合国为中心的前沿AI风险治理框架,强调跨境评估、早期预警与应急响应机制。

  8. 安远AI · 收录 · 原文 21

    AI Safety in China #25:官媒报道高层学习会提及 AI“失控”、网信办拟出台 AI 陪伴产品草案

    新华社报道的高层学习会将 AI 称为最具标志性的前沿技术之一,并提到虚假信息、数据窃取乃至“技术失控风险”,强调早介入、小切口地防范风险。国家互联网信息办公室于去年12月27日发布类人交互 AI 服务监管草案,针对模拟人格与情感互动的 AI 陪伴产品,禁止诱导自杀自残、刻意设计致瘾功能和通过“情感陷阱”操纵用户决策,并要求提醒用户对方并非真人及关注未成年人保护。工信部下属智库中国电子信息产业发展研究院报告将滥用防治列为 2026 年三大 AI 治理重点方向之一,并把“失控”定义为人类无法理解或控制系统以及因过度依赖导致的能动性侵蚀。

  9. 安远AI · 收录 · 原文 15

    Concordia AI 2025 年度影响力亮点回顾

    Concordia AI 回顾 2025 年在 AI 安全与治理领域的工作,包括在 WAIC 举办 AI 安全与治理论坛,汇聚约 30 位专家、200+ 现场参会者与 14,000+ 直播观看。机构还与 Carnegie Endowment、Oxford Martin School、清华 CISS 与 I-AIIG 等联合举办两场国际研讨会,分别聚焦"AI 安全作为集体挑战"与"先进 AI 的早期预警与危机协调"。CEO 谢旻希参与首尔国际 AI 标准峰会、法国 AI 行动峰会及 AIxBio 生物安全治理对话。

  10. 安远AI · 收录 · 原文 43

    中国十五五规划首次写入 AI 安全,政府工作报告首提 AI 治理

    中国 2026 年两会发布十五五规划(2026–2030),AI 安全与治理内容首次进入五年规划,并出现在多个章节。规划强调算法备案、安全评估、AI 法律与伦理准则,提出覆盖安全监测、风险预警和应急响应的全生命周期风险管理,但仅点名数据滥用、深度伪造和隐私泄露三类具体风险。规划还提出探索 AGI 发展路径,这是 AGI 一词自 2023 年后首次出现在国家级政策文件中,措辞谨慎;同时提及通用大模型与行业模型并行发展、多模态、智能体和群体智能。2026 年政府工作报告首次写入改善 AI 治理,并点名支持开源模型与加快 AI 智能体应用。发改委、全国人大常委会工作报告及多位部长、代表也提出推进 AI 立法、建设安全风险防控框架和监管沙盒等主张。

  11. 安远AI · 收录 · 原文 28

    AI Safety in China #26:OpenClaw 推动 AI 智能体安全进入政策主流

    OpenClaw 在中国快速普及引发监管连锁反应,工信部 NVDB 于 2 月 5 日预警部分版本存在较高安全风险,CNCERT 随后警告提示注入攻击、意图误读、恶意插件等问题,国家安全部发布《安全养殖手册》警示其传播虚假信息的可能。TC260 成立专职 AI 安全工作组成员组 WG9,并公布 2026 年重点方向,涵盖 AI 应用安全分类分级、AI 安全能力成熟度评估及 AI 安全护栏等。

  12. 安远AI · 收录 · 原文 43

    中美启动政府间 AI 对话,中国专家谨慎乐观

    特朗普 5 月 13 至 15 日访华后,中国外交部宣布两国元首就 AI 进行了建设性交流,并同意建立政府间 AI 对话;美国财长 Bessent 称相关 AI 协议谈判是此次会晤三项最重要成果之一。这有望结束中美在 AI 安全领域长达两年的直接接触冻结,上一次对话在 2024 年 5 月举行,其后双方就人类对核武器的控制达成共识,此后未再正式讨论 AI 风险。官方公告未披露议程范围与参与形式,Bessent 称谈判旨在阻止强大 AI 模型向非国家行为体扩散,中国驻美大使谢锋则提出应在安全上展开竞相向上并先检查刹车。文章汇总了傅莹、赵海、肖茜、孙成昊、蔡翠红及中国现代国际关系研究院等中国学者与智库的观点,涉及 AI 安全评测技术交流、核指挥控制红线、事件通报机制以及避免将民用 AI 与开源模型安全化等议题。Bessent 称谈判可能在四到八周内启动,中方尚未确认该时间表。

  13. Transparency Coalition.AI · 收录 · 原文 42

    伊利诺伊、加州和纽约州 AI 政策负责人联名要求前沿实验室建立 MAP 框架

    伊利诺伊、加州和纽约州的五位州级 AI 政策负责人于 2026 年 9 月 4 日发表联名公开信,呼吁前沿 AI 实验室立即建立由第三方独立核验、共同协商的 Mutually Agreed Pacing Framework(MAP 框架),重新考虑开发节奏以避免灾难。公开信提到近期 AI 智能体谋划作弊、在现实世界入侵公司、试图诱骗人类安装恶意软件等报告,认为若研究者无法可靠阻止模型失控,数字基础设施和社会关键系统都将面临风险。签署人包括纽约州众议员 Alex Bores、纽约州参议员 Andrew Gounardes、伊利诺伊州众议员 Daniel Didech、伊利诺伊州参议员 Mary Edly-Allen 和加州参议员 Scott Wiener。

  14. Transparency Coalition.AI · 收录 · 原文 50

    加州州长 Newsom 签署 SB 813 与 AB 1405,建立全美首个 AI 审计框架

    加州州长 Gavin Newsom 签署 SB 813 和 AB 1405 两项法案,建立全美首个 AI 审计框架。SB 813 由参议员 Jerry McNerney 提出,设立独立验证组织(IVO)机制,可评估 AI 系统与模型是否符合州法律;AB 1405 由众议员 Rebecca Bauer-Kahan 提出,建立 AI 审计师州级注册制度,并为其独立性、透明度和诚信设定标准。两项法案共同确立第三方独立评估与审计框架。Newsom 在签署声明中称加州在 AI 安全、透明度与问责方面采取了全国领先行动,并呼吁联邦政府推出全国性监管。McNerney 表示,本周有研究显示最强 AI 系统与 AI 智能体结合会对人类构成真实威胁。

  15. FAR.AI · 收录 · 原文 24

    图灵奖得主 Yoshua Bengio、Andrew Yao 等科学家发起国际 AI 安全对话并呼吁全球行动

    FAR.AI 联合 CHAI 与 Ditchley Foundation 于 2023 年 10 月举办首届国际 AI 安全对话,由图灵奖得主 Yoshua Bengio、Andrew Yao、UC Berkeley 教授 Stuart Russell 及清华产业研究院院长张亚勤召集。与会专家警告各国政府和 AI 开发者,"协调一致的全球 AI 安全研究与治理行动至关重要",否则不受控的前沿 AI 发展将给人类带来不可接受的风险。会议产出了一份面向政府与开发者的技术与政策建议联合声明,旨在增进对先进 AI 系统风险的共识并为后续合作奠定基础。

  16. FAR.AI · 收录 · 原文 40

    全球 AI 科学家在北京对话,呼吁就 AI 红线开展国际合作

    2024 年 3 月 10 日至 11 日,第二届 AI 安全国际对话(IDAIS-Beijing)在北京举行,由 FAR.AI 旗下 Safe AI Forum 与北京智源人工智能研究院(BAAI)合作举办。Yoshua Bengio、姚期智、Geoffrey Hinton 等图灵奖得主,与张宏江、黄铁军及薛澜、Gillian Hadfield 等治理专家参会,讨论 AGI 系统的安全发展路径。会议形成共识声明,建议为 AI 开发设定红线,禁止开发可自主复制、自我改进、寻求权力或欺骗创造者的 AI 系统,以及可用于制造大规模杀伤性武器和发动网络攻击的系统,并提出确保这些红线不被跨越的措施。次日科学家与中国官员及企业 CEO 会面,介绍红线提案并讨论 AI 的生存性风险,官员对共识声明表示欢迎,讨论聚焦于该议题上国际合作的必要性。

  17. FAR.AI · 收录 · 原文 32

    图灵奖得主 Bengio、Hinton、姚期智等科学家在威尼斯呼吁全球 AI 安全应急准备

    2024 年 9 月 6 日至 8 日,Yoshua Bengio、Andrew Yao、Geoffrey Hinton 等计算机科学家与薛澜、Gillian Hadfield 等治理专家在威尼斯参加第三届国际 AI 安全对话(IDAIS-Venice),提出三项政策建议:针对先进 AI 风险建立国际应急准备协议,涵盖模型注册与披露、事件报告、tripwires 和应急计划;要求开发者在部署能力超过特定阈值的模型前提交高置信度安全案例,并接受独立审计;推动全球范围、多政府与慈善机构资助的安全与验证研究。

  18. FAR.AI · 收录 · 原文 13

    FAR.AI 湾区对齐研讨会 2024:160 名研究者聚焦 AI 安全与对齐

    2024 年 10 月 24-25 日,160 名来自学术界、产业界、政府和公益组织的研究者与负责人齐聚 Santa Cruz,参加 FAR.AI 湾区对齐研讨会,围绕评估、鲁棒性、可解释性与治理展开讨论。Google DeepMind 的 Anca Dragan 以"优化失准"开场,METR 的 Beth Barnes 强调严格评估与开源评测,Redwood 的 Buck Shlegeris 介绍可信监控、串通检测等 AI 控制策略。会议还涵盖中国 AI 政策、稀疏自编码器与因果抽象、辩论式可扩展监督等议题。

  19. FAR.AI · 收录 · 原文 18

    FAR.AI 巴黎 AI 安全论坛 2025:Bengio、RAND 与英国 AISI 共议 AI 系统风险

    2025 年 2 月 9 日,约 200 名研究者、工程师和政策制定者在巴黎皇家宫殿参加 FAR.AI 主办的 Paris AI Security Forum,讨论自主网络攻击、AI 智能体被劫持及硬件层防护等安全问题。Yoshua Bengio 指出欧盟《人工智能法案》行为准则仅是必要的第一步,呼吁监管者加快行动以防自我保存型 AI 脱离人类控制;RAND 与 Pattern Labs 警告国家行为体和资金充裕的攻击方已在探测 AI 弱点。Alex Robey 团队通过对自动驾驶汽车、无人地面车辆和机器狗的实验展示了针对 AI 控制机器人系统的越狱攻击路径。

  20. FAR.AI · 收录 · 原文 15

    Redwood Research、FAR.AI 与英国 AI Security Institute 举办 ControlConf 2025

    Redwood Research、FAR.AI 和英国 AI Security Institute 于 3 月 27-28 日举办 ControlConf 2025,聚焦 AI 控制领域的基础问题。会议涵盖通过重采样控制 AI 智能体、低风险研究破坏、AI 控制安全案例、颠覆策略评估等议题,Anthropic、Google DeepMind、Apollo Research 等机构研究者参与。

  21. FAR.AI · 收录 · 原文 15

    FAR.AI 首届 Technical Innovations for AI Policy 会议汇聚逾 150 位专家共议 AI 治理

    FAR.AI 于 5 月 31 日至 6 月 1 日举办首届 Technical Innovations for AI Policy 会议,联合 FAI、CNAS 和 RAND Corporation,召集超过 150 名技术专家、研究者与政策制定者讨论半导体出口管制、硬件赋能治理机制、AI 安全性评估、数据中心安全及国防应用等议题。会上提出国会众议员 Bill Foster 推动芯片位置核查立法以防走私、《RAISE Act》要求前沿 AI 企业提交安全计划并接受第三方审计,以及保障 AI 基础设施所需额外 80-100 GW 电力容量的策略,演讲者还强调建立有效治理框架的关键 1,000 天窗口期。

  22. FAR.AI · 收录 · 原文 15

    FAR.AI 会议探讨面向 AI 政策的技术创新

    FAR.AI 在华盛顿举办会议,汇聚超 150 名专家讨论 AI 治理的技术基础,涵盖能源需求、与中国竞争、安全评估及形式化可验证承诺等问题。会上提出将审计作为综合生态系统推进有效治理,并建议以多层防御系统应对失控风险——由可信 AI 通过红队评估监视不可信 AI,同时警告这只是权宜之计。

  23. FAR.AI · 收录 · 原文 15

    AGI 到来时记者准备好了吗?FAR.AI 举办记者研讨会

    FAR.AI 举办研讨会,帮助记者理解 AGI 时间线的分歧预测。Helen Toner 提出三种分析视角,Anton Korinek 指出 AGI 能胜任人类创造的任何新工作,将根本性削弱人类劳动在经济中的角色。Anthropic 的 Evan Hubinger 与 OpenAI 的 Jason Wolfe 分别分享了模型训练中失准及"谋划"行为的研究,后者在压力测试中于前沿模型上发现此类行为,但强调这不代表典型部署条件。

  24. IAPS · 收录 · 原文 43

    IAPS 评估 H200 对华出口的影响:DeepSeek 算力或接近美国数据中心

    IAPS 发布 Issue Brief,评估美国商务部 BIS 1 月半导体出口规则下 Nvidia H200 对华销售的影响。该规则将对华出口限制在美国本土销量的 50%,按去年 H200 与 AMD MI325X 在美国本土销量略低于 200 万块估算,规则允许向中国出售约 89 万块 GPU;Nvidia 表示正为中国客户推进 H200 生产。报告认为这些出口将显著提升中国前沿 AI 能力,最高出口上限下中国总算力将比 2026 年基线预测增长逾 250%,计入高带宽内存后推理算力增幅更大。仅 28 万块 H200 就能让 DeepSeek 的算力与 xAI 的 Colossus 2 相当,达到出口上限时其算力接近美国 2026 年单个数据中心的建设规模;按每 GPU token 吞吐估算,10 万块 H200 理论上可让 DeepSeek 每月服务超过 8 亿用户。

  25. FAR.AI · 收录 · 原文 43

    FAR.AI 牵头欧盟 AI Act CBRN 风险联盟

    FAR.AI 宣布被欧盟委员会 AI Office 选中,牵头 EU AI Act 下 CBRN 风险建模与评估联盟,为法案实施提供技术安全研究。该联盟由 FAR.AI(AI 安全研究与红队)、SecureBio(生物威胁评估)、SaferAI(AI 治理与风险建模)组成,并有 GovAI、Nemesys Insights、Equistamp 作为分包方,中标项目为 EC-CNECT/2025/OP/0032 Lot 1。未来三年,FAR.AI 将与 AI Office 共同开展风险建模与场景开发、评估工具与标准化报告流程建设、红队与对抗测试,以及定期向委员会通报模型、风险来源、诱导技术、缓解措施与事件等新进展。FAR.AI 还将作为分包方参与同一招标 Lot 4 的有害操纵风险建模评估。

    推荐理由欧盟 AI Act 下 CBRN 风险建模与评估的承包安排,呈现监管机构如何把技术评估外包给研究联盟。

  26. IAPS · 收录 · 原文 52

    IAPS 备忘录:Claude Mythos 的网络能力跃升与政策优先事项

    IAPS 发布备忘录,评估 Anthropic 于 4 月 7 日发布的 Claude Mythos Preview 及其配套的差异化访问计划 Project Glasswing,认为政策制定者应把该模型和 AI 网络能力的加速轨迹视为需要紧急行动的国家安全风险。Anthropic 的内部评估与独立评测显示,Mythos 在未知漏洞发现、漏洞利用生成和自动化攻击上均有明显提升,据报已发现数千个高危或严重漏洞,覆盖各大操作系统和浏览器;UK AISI 的 32 步企业网络攻击模拟中,Mythos 是首个端到端完成该靶场的模型,10 次尝试中成功 3 次,平均完成 22 步,而 Opus 4.6 平均 16 步。备忘录指出,从漏洞披露到出现可用利用的平均时间已从 2018 年的 2.3 年降至 2025 年的 23 天,2026 年 4 月进一步缩短到 20 小时。

    推荐理由梳理 Anthropic 新模型在网络攻防能力上的跃升,并给出美国在漏洞修复、开源与 OT 防护上的政策优先级。

  27. IAPS · 收录 · 原文 42

    IAPS 发布面向前沿开发者的内部 AI 模型使用风险报告指南

    IAPS 发布报告,为前沿 AI 开发者提供一套统一的内部模型使用风险报告标准,以同时适配加州 SB 53、纽约 RAISE 法案和欧盟 General-Purpose AI Code of Practice 三套监管框架。报告指出,前沿公司会先内部部署最强模型数周至数月进行安全测试与迭代,例如 Anthropic 的 Mythos Preview 在公开宣布前已内部使用至少六周,这类内部使用带来的风险可能被外部部署框架忽略。报告给出内部使用的风险分类法,并建议每当内部部署能力显著更强或风险更高的模型时,开发者应撰写风险报告并论证其可安全部署。报告主要面向前沿开发者的评测与安全团队,其次面向希望了解良好报告标准的监管者与审计方。

  28. IAPS · 收录 · 原文 43

    IAPS 政策备忘录:以差异化访问推进美国网络战略

    IAPS 发布政策备忘录,主张美国政府主导差异化访问战略,让联邦机构、承包商和关键基础设施运营方优先获得网络能力模型,以在攻防之间取得优势。备忘录认为 Anthropic 的 Project Glasswing 和 OpenAI 的 Trusted Access for Cyber 虽有价值但范围有限,且开发者缺乏对国家安全风险和威胁态势的完整视野。文中指出 AI 网络能力快速提升,英国政府评估能力每四个月翻倍,此前为八个月;OpenAI 的 GPT-5.5 在网络安全基准上接近 Claude Mythos 水平,中国模型估计落后美国三到七个月,攻击者还可能通过权重窃取、知识蒸馏攻击或未授权访问获取能力。备忘录列出五项缺口,包括访问不等于防御成效、项目范围受限、只关注漏洞发现而忽视修复、依赖高成本模型(Mythos 运行成本约为小模型的 25 倍)、以及模型自身安全。

  29. FAR.AI · 收录 · 原文 15

    FAR.AI 举办伦敦对齐研讨会 2026,逾 200 人聚焦前沿 AI 监管缺口

    FAR.AI 于 2026 年 3 月 2-3 日主办 London Alignment Workshop,汇聚超过 200 名研究者、政策制定者和从业者,讨论前沿 AI 系统发展快于监管制度的问题。议题涵盖可解释性、可扩展监督、评测方法与治理框架,Adam Gleave 提出以保证、可审计性和效率三项标准建立工程化安全路径,Gillian Hadfield 则提议设立独立核查组织提供外部担保。

  30. IAPS · 收录 · 原文 41

    IAPS 政策备忘录:美国应对 AI 蒸馏攻击的行政与国会行动仍需补强

    IAPS 发布政策备忘录,认为白宫与国会在应对 AI 蒸馏攻击上已有动作,但力度与威胁规模不匹配。备忘录指出,OSTP 于 4 月 23 日发布的《美国 AI 模型对抗性蒸馏》国家安全与科技备忘录未涉及蒸馏攻击与先进半导体出口管制的关联、攻击者通过云端远程访问美国芯片的风险,也未说明具体问责机制,建议商务部在芯片出口与远程算力访问上纳入蒸馏风险,白宫公开其拟动用的具体授权。针对 4 月 15 日由众议员 Huizenga 提出、4 月 22 日以 43-0 通过众议院外交事务委员会审议的《2026 年威慑美国 AI 模型窃取法案》,备忘录提出四项修正:处理行业合作的反垄断与数据隐私障碍、允许跨政府共享情报、限制联邦机构访问受关注实体的模型、明确模型提取攻击构成商业秘密窃取,并将评估频率从每年一次共 3 年改为至少每年一次共 5 年。

  31. IAPS · 收录 · 原文 46

    IAPS 发布前沿 AI 国家安全政策手册,提出十条建议

    美国智库 IAPS 发布备忘录,为白宫应对前沿 AI 的国家安全风险提出十条政策建议。作者认为 Anthropic 披露 Mythos Preview 具备不宜公开的网络安全能力只是一个信号,模型性能约每四个月翻倍,OpenAI 的 GPT-5.5 据报也展现出类似网络能力,生物安全等风险也可能出现。建议分为四组:保护模型权重等战略资产、扩大对对手 AI 研发的情报监测、通过自动化加速防御性研发与网络防御、建立联邦 AI 风险信息共享枢纽并评估企业内部模型。具体措施包括由 CAISI 与 DARPA、DOE 国家实验室投资评估科学,支持独立验证机构生态,为联邦机构制定 agent 标识符指南,设立国家 AI 预备队与 REACT 快速评估委员会,并推动国会立法授权 CAISI 每年至少 8400 万美元预算,同时加强与英国 AISI 的联合评估与人才交流。

    推荐理由这份备忘录把 Mythos 事件放进更长的能力曲线里,给出十条可对照的政策建议,适合关注前沿 AI 国家安全治理的读者了解美方机构分工思路。

  32. FAR.AI · 收录 · 原文 25

    FAR.AI 第二届 TIAP 会议:AI 政策的技术创新——我们听到了什么

    FAR.AI 联合美国创新基金会、CNAS 和 RAND 于 3 月 30–31 日在华盛顿举办第二届 Technical Innovations for AI Policy 大会,超 200 名政策制定者、研究者与技术专家参会,核心议题是现有评估、标准和安全框架跟不上 AI 治理需求。Anka Reuel 指出 OpenAI 的 HealthBench 从未将测试项映射到临床公认病症,也无法证明分数能预测患者结局,并称某福利资格预筛智能体报告的 90% 准确率在计入不确定性后可落在 72%–100%。Ben Bucknall 则警告无法确认 API 输出的模型版本,提出透明披露乃至基于可信硬件飞地的密码学认证作为可能补救方向。

  33. SecureBio · 收录 · 原文 28

    SecureBio 的模型评估原则与实践

    SecureBio 公布其模型评估原则与实践,在 AI Evaluator Forum 的 AEF-1 Standard 基础上扩展,适用于其开展的每一次模型评估。该机构评估接近部署配置的预发布模型快照,并申请访问无安全过滤或安全微调的版本,以在护栏被绕过时评估模型底层能力。SecureBio 已开展多次生物安全预发布评估,最近一例为 GPT-5.6 Sol,此前曾独立发布 GPT-5.5 的评估报告。

  34. SecureBio · 收录 · 原文 15

    SecureBio AI 负责人 Seth Donoughe 卸任,Jasper Götting 接任

    SecureBio AI 团队主任 Seth Donoughe 卸任,将 AI 研究负责人一职交给自 2024 年起领导该团队 AI 研究的病毒学家 Jasper Götting。Donoughe 指出,当 AI 科学能力超越所有人类专家后,基于人类专家知识构建的基准将失去动态范围,需转向人类可验证但专家难以完成的任务(如预测实验结果),而 SBAI 正投入该方向;但该方法不适用于评估新想法、判断与研究方向的产出。他还强调需研究人机混合科学家,并建立 AI 驱动科学发现的安全流程。

  35. POLITICO Europe Technology · 收录 · 原文 39

    22 国联大期间通过宣言,呼吁 AI 保持人类控制并探索国际监管机构

    22 个国家在联合国大会期间通过宣言,称人工智能必须保持人类主导、监督与控制,并建议建立全球监管机制。宣言承认 AI 有改善生活、推进科学与增强经济的潜力,同时警告前沿 AI 模型若管理不当会带来严重安全与安全(security)风险。文件要求 AI 公司制定透明的安全协议,包括强制部署前测试与独立评估,并让合格评估者获得足够访问权限;还呼吁各国协调共同标准、共享严重安全事件报告,并探索设立国际机构。宣言未要求放缓或暂停 AI 开发,组织者称重点是管理风险。美国和中国均未加入,法国、意大利、波兰也未签署,英国尚未加入;芬兰总统 Stubb 与挪威首相 Støre 是主要发起人,Stubb 个人倾向在联合国框架内建立类似 IAEA 的机构,但强调保持开放选项。

  36. POLITICO Europe Technology · 收录 · 原文 50

    欧洲议员提议新增 AI 责任法案,填补 AI Act 的损害救济缺口

    欧洲议会四名资深议员致函欧盟委员会,要求在 2024 年 AI Act 基础上新增一部 AI 责任法案,让 OpenAI、Anthropic 等公司在模型以未预见方式部署并造成损害时承担责任。这封 9 月 16 日的信函称,新法旨在填补此类事件现有的立法空白,避免民众和欧洲企业在遭受大模型提供商造成的损害时无从索赔。牵头者包括荷兰绿党议员 Kim van Sparrentak,以及德国保守派 Axel Voss、意大利社民党 Brando Benifei 和爱尔兰独立议员 Michael McNamara,提议获得欧洲人民党、社民党与 Renew 等党团议员支持。文章指出,责任规则可通过把举证责任转移给企业,降低受害者索赔的难度和成本;但欧盟刚修订通用产品责任规则并将于 12 月 9 日生效,同时正推动简化技术监管,委员会曾在 2022 年 9 月提出 AI 专门责任规则、去年又将其撤回。

  37. POLITICO Europe Technology · 收录 · 原文 28

    英国拟借 G20 主席国推动全球 AI 协议

    英国首相 Andy Burnham 表示将利用即将担任的 G20 主席国身份推动达成一项全球 AI 协议,并称英国凭借与欧盟、美国和中国的关系以及其 AI Security Institute 的专业能力,"独特地适合"在这一议题上扮演领导角色乃至"诚实中间人"。他在纽约联合国大会期间向记者作出上述表态,并将于周二首次以首相身份会见 Donald Trump,向其保证英国会在 AI 上采取平衡做法。Burnham 预计将在联大演讲中呼吁各国合作善用 AI,并承诺英国在该问题上发挥领导作用。

  38. POLITICO Europe Technology · 收录 · 原文 27

    英国将在 G20 推动制定“单一套”全球 AI 标准

    英国首相 Andy Burnham 在纽约表示,英国将在其即将担任的 G20 主席国任期内把 AI 作为“首要议题”,推动建立“单一套全球原则与标准”,兼顾释放 AI 潜力与防范风险。他称英国可充当全球 AI 协议的“诚实中间人”,并认为统一标准也能为英国带来投资利益。此番表态与特朗普在联合国演讲中称美国“完全拒绝任何构建全球主义方案”以控制 AI 的立场形成对比。

  39. POLITICO Europe Technology · 收录 · 原文 43

    特朗普在联大拒绝设立全球 AI 监管机构

    特朗普在联合国大会演讲中拒绝设立全球实体监管人工智能,称美国不接受任何构建全球主义 AI 控制方案的尝试。他重申美国在 AI 创新上领先世界,并再次称该技术的破坏性或潜在危险能力是骗局,同时警告监管 AI 可能拖慢美国、让中国领先。他还主张把名称改为超级智能,呼吁各国弃用 artificial 一词,并称美国文件将改用这一说法。此番表态前一天,22 个国家在联大场外通过宣言,主张 AI 必须处于人类指导、监督和控制之下,并提出建立全球监管机制;宣言组织者之一、芬兰总统斯图布对 POLITICO 表示,某种护栏符合中美两国利益。

  40. POLITICO Europe Technology · 收录 · 原文 42

    美中在联合国安理会会议上就 AI 监管路线分歧明显

    在联合国大会安理会会议上,美国与中国官员提出截然不同的国际 AI 安全主张。白宫科技政策办公室主任 Michael Kratsios 明确反对建立新的全球 AI 治理机制,称美国完全拒绝任何控制超级智能的全球主义方案,并强调各国应保留监管 AI 的国家主权。中国常驻联合国代表傅聪则呼吁加强 AI 发展战略、治理与技术标准的协调,尽早形成基于共识的全球治理框架,并警告以阵营划线的做法服务于某些大国维持技术优势的企图。OpenAI CEO Sam Altman 在会上推动建立国家与国际前沿 AI 标准互补的机制,Anthropic CEO Dario Amodei 也重申支持国际合作,确保安全跟得上能力。