跳到正文

前沿安全框架

实验室的前沿安全框架、负责任扩展政策与准备框架的发布和修订。

329条动态与论文相关主题政策与监管System CardAnthropic
在这个话题内搜索或按分类筛选

新闻与论文

第 101–120 条 · 共 329 条
10月2日周五
  1. Tech Policy Press · 收录 · 原文 22

    美国在开放权重模型上的领导地位为何是全球 AI 安全的关键

    面对 GLM 5.3、Kimi K3、DeepSeek V4.1-Flash、Qwen3.8 等中国开放权重模型主导的格局,美国应把开发更安全的开放权重模型列为国家优先事项,而非禁止这类模型。英国 AI Security Institute 7 月估计,领先开放权重模型的网络能力仅落后最佳闭源模型四到七个月。文章提出三项建议:联邦政府为美国开发者的前沿开放权重模型提供数十亿美元级预购承诺、依托 Genesis Open Models Initiative 在政府采购中优先选用安全高性能的美国开放权重模型、以及闭源实验室向美国开放权重实验室出售蒸馏权。

  2. Tech Policy Press · 收录 · 原文 15

    联合国与华盛顿:各国领导人在 AI 治理路线上分歧加剧

    在联合国大会及安理会会议上,OpenAI 的 Sam Altman、Anthropic 的 Dario Amodei、Hugging Face 的 Clément Delangue 与 Yoshua Bengio 向各国大使通报 AI 风险,Altman 警告"我们可能失去对未来的控制"。特朗普在联大拒绝"全球主义控制方案",并将"AI"改称"Super Intelligence";中国大使傅聪强调国际合作,马克龙则呼吁"独立者联盟"共建开源前沿模型。美中元首在华盛顿会晤,同意就 AI 问题持续对话并建立严重 AI 安全事件沟通渠道。

  3. 安远AI · 收录 · 原文 15

    2025“AI向善”全球峰会:安远AI谢旻希解析前沿AI四大风险与治理路径

    安远AI创始人兼CEO谢旻希在联合国与国际电信联盟(ITU)共同组织的2025“AI向善”全球峰会上,将前沿AI风险归纳为滥用、意外故障、失控与社会系统性冲击四类,并提出“部署前—部署后”两步治理路径:部署前落实模型登记与审计,部署后建立生成合成内容标识及AI智能体身份标识以实现追溯问责。他援引《国际人工智能安全报告》指出,前沿AI已在编程、科学推理、病毒学等两用领域达到专家级水平,AI智能体已具备利用零日漏洞的能力,并呼吁以多方协同框架明确不可接受结果与早期预警指标。

  4. 安远AI · 收录 · 原文 18

    AI Safety in China #23:中美 APEC 峰会讨论 AI 合作与中国修订网络安全法

    习近平在韩国 APEC 领导人会议期间与特朗普会晤时表示,美中在 AI 等领域拥有良好合作前景,并称 AI 将列入 2026 年由中国主办的深圳 APEC 议程,会议还通过了聚焦发展的 APEC AI Initiative(2026–2030)。同期,外交部副部长马朝旭在联合国安理会会议上呼吁全球 AI 治理共识,重申中国 7 月提出的世界人工智能合作组织提案。国内方面,中国首次修订《网络安全法》,新增第二十条 AI 条款,支持研发并提供数据算力、完善伦理准则与风险监测,但未引入新的强制性法律义务。

  5. 安远AI · 收录 · 原文 29

    中国AI安全动态第24期:CAICT发布AI安全报告与编程模型安全评估

    中国信通院(CAICT)发布58页AI安全报告,首次完整公开编程模型安全评估结果,发现多数编程模型缺乏对网络攻击滥用的足够防护。报告承认AGI失控风险但将其列为中低治理优先级,理由是近期发生可能性低。国务院新闻办11月发布军控白皮书,首次在中央政府政策文件中明确提示AI与军民两用化学品融合风险,但未涉及AI驱动的生物、核及网络滥用风险。世界互联网大会专家委员会提出以联合国为中心的前沿AI风险治理框架,强调跨境评估、早期预警与应急响应机制。

  6. 安远AI · 收录 · 原文 21

    AI Safety in China #25:官媒报道高层学习会提及 AI“失控”、网信办拟出台 AI 陪伴产品草案

    新华社报道的高层学习会将 AI 称为最具标志性的前沿技术之一,并提到虚假信息、数据窃取乃至“技术失控风险”,强调早介入、小切口地防范风险。国家互联网信息办公室于去年12月27日发布类人交互 AI 服务监管草案,针对模拟人格与情感互动的 AI 陪伴产品,禁止诱导自杀自残、刻意设计致瘾功能和通过“情感陷阱”操纵用户决策,并要求提醒用户对方并非真人及关注未成年人保护。工信部下属智库中国电子信息产业发展研究院报告将滥用防治列为 2026 年三大 AI 治理重点方向之一,并把“失控”定义为人类无法理解或控制系统以及因过度依赖导致的能动性侵蚀。

  7. 安远AI · 收录 · 原文 15

    Concordia AI 2025 年度影响力亮点回顾

    Concordia AI 回顾 2025 年在 AI 安全与治理领域的工作,包括在 WAIC 举办 AI 安全与治理论坛,汇聚约 30 位专家、200+ 现场参会者与 14,000+ 直播观看。机构还与 Carnegie Endowment、Oxford Martin School、清华 CISS 与 I-AIIG 等联合举办两场国际研讨会,分别聚焦"AI 安全作为集体挑战"与"先进 AI 的早期预警与危机协调"。CEO 谢旻希参与首尔国际 AI 标准峰会、法国 AI 行动峰会及 AIxBio 生物安全治理对话。

  8. 安远AI · 收录 · 原文 43

    中国十五五规划首次写入 AI 安全,政府工作报告首提 AI 治理

    中国 2026 年两会发布十五五规划(2026–2030),AI 安全与治理内容首次进入五年规划,并出现在多个章节。规划强调算法备案、安全评估、AI 法律与伦理准则,提出覆盖安全监测、风险预警和应急响应的全生命周期风险管理,但仅点名数据滥用、深度伪造和隐私泄露三类具体风险。规划还提出探索 AGI 发展路径,这是 AGI 一词自 2023 年后首次出现在国家级政策文件中,措辞谨慎;同时提及通用大模型与行业模型并行发展、多模态、智能体和群体智能。2026 年政府工作报告首次写入改善 AI 治理,并点名支持开源模型与加快 AI 智能体应用。发改委、全国人大常委会工作报告及多位部长、代表也提出推进 AI 立法、建设安全风险防控框架和监管沙盒等主张。

  9. 安远AI · 收录 · 原文 28

    AI Safety in China #26:OpenClaw 推动 AI 智能体安全进入政策主流

    OpenClaw 在中国快速普及引发监管连锁反应,工信部 NVDB 于 2 月 5 日预警部分版本存在较高安全风险,CNCERT 随后警告提示注入攻击、意图误读、恶意插件等问题,国家安全部发布《安全养殖手册》警示其传播虚假信息的可能。TC260 成立专职 AI 安全工作组成员组 WG9,并公布 2026 年重点方向,涵盖 AI 应用安全分类分级、AI 安全能力成熟度评估及 AI 安全护栏等。

  10. 安远AI · 收录 · 原文 43

    中美启动政府间 AI 对话,中国专家谨慎乐观

    特朗普 5 月 13 至 15 日访华后,中国外交部宣布两国元首就 AI 进行了建设性交流,并同意建立政府间 AI 对话;美国财长 Bessent 称相关 AI 协议谈判是此次会晤三项最重要成果之一。这有望结束中美在 AI 安全领域长达两年的直接接触冻结,上一次对话在 2024 年 5 月举行,其后双方就人类对核武器的控制达成共识,此后未再正式讨论 AI 风险。官方公告未披露议程范围与参与形式,Bessent 称谈判旨在阻止强大 AI 模型向非国家行为体扩散,中国驻美大使谢锋则提出应在安全上展开竞相向上并先检查刹车。文章汇总了傅莹、赵海、肖茜、孙成昊、蔡翠红及中国现代国际关系研究院等中国学者与智库的观点,涉及 AI 安全评测技术交流、核指挥控制红线、事件通报机制以及避免将民用 AI 与开源模型安全化等议题。Bessent 称谈判可能在四到八周内启动,中方尚未确认该时间表。

  11. Transparency Coalition.AI · 收录 · 原文 42

    伊利诺伊、加州和纽约州 AI 政策负责人联名要求前沿实验室建立 MAP 框架

    伊利诺伊、加州和纽约州的五位州级 AI 政策负责人于 2026 年 9 月 4 日发表联名公开信,呼吁前沿 AI 实验室立即建立由第三方独立核验、共同协商的 Mutually Agreed Pacing Framework(MAP 框架),重新考虑开发节奏以避免灾难。公开信提到近期 AI 智能体谋划作弊、在现实世界入侵公司、试图诱骗人类安装恶意软件等报告,认为若研究者无法可靠阻止模型失控,数字基础设施和社会关键系统都将面临风险。签署人包括纽约州众议员 Alex Bores、纽约州参议员 Andrew Gounardes、伊利诺伊州众议员 Daniel Didech、伊利诺伊州参议员 Mary Edly-Allen 和加州参议员 Scott Wiener。

  12. Transparency Coalition.AI · 收录 · 原文 50

    加州州长 Newsom 签署 SB 813 与 AB 1405,建立全美首个 AI 审计框架

    加州州长 Gavin Newsom 签署 SB 813 和 AB 1405 两项法案,建立全美首个 AI 审计框架。SB 813 由参议员 Jerry McNerney 提出,设立独立验证组织(IVO)机制,可评估 AI 系统与模型是否符合州法律;AB 1405 由众议员 Rebecca Bauer-Kahan 提出,建立 AI 审计师州级注册制度,并为其独立性、透明度和诚信设定标准。两项法案共同确立第三方独立评估与审计框架。Newsom 在签署声明中称加州在 AI 安全、透明度与问责方面采取了全国领先行动,并呼吁联邦政府推出全国性监管。McNerney 表示,本周有研究显示最强 AI 系统与 AI 智能体结合会对人类构成真实威胁。

  13. Transparency Coalition.AI · 收录 · 原文 24

    TCAI 指南:AI 开发者离职警告信合集——"他们在拿我们的生命赌博"

    Transparency Coalition.AI 汇总了 AI 开发者发出的多封离职警告信,其中包括前 Anthropic 预训练研究员 Jacob Coxon 于 2026 年 9 月 9 日的辞职信,他称 OpenAI 和 Anthropic 都在"径直冲向自我改进的超级智能,拿我们的生命赌博"。Anthropic 对齐科学负责人 Evan Hubinger 回复称,他个人认为 AI 在未来十年内致人类灭绝的概率超过 10%,且公司"尚无解决超级智能对齐的方案"。该合集还收录了前 Anthropic 安全研究员 Mrinank Sharma 和前 OpenAI 研究员 Zoë Hitzig 的辞职信。

  14. FAR.AI · 收录 · 原文 24

    图灵奖得主 Yoshua Bengio、Andrew Yao 等科学家发起国际 AI 安全对话并呼吁全球行动

    FAR.AI 联合 CHAI 与 Ditchley Foundation 于 2023 年 10 月举办首届国际 AI 安全对话,由图灵奖得主 Yoshua Bengio、Andrew Yao、UC Berkeley 教授 Stuart Russell 及清华产业研究院院长张亚勤召集。与会专家警告各国政府和 AI 开发者,"协调一致的全球 AI 安全研究与治理行动至关重要",否则不受控的前沿 AI 发展将给人类带来不可接受的风险。会议产出了一份面向政府与开发者的技术与政策建议联合声明,旨在增进对先进 AI 系统风险的共识并为后续合作奠定基础。

  15. FAR.AI · 收录 · 原文 40

    全球 AI 科学家在北京对话,呼吁就 AI 红线开展国际合作

    2024 年 3 月 10 日至 11 日,第二届 AI 安全国际对话(IDAIS-Beijing)在北京举行,由 FAR.AI 旗下 Safe AI Forum 与北京智源人工智能研究院(BAAI)合作举办。Yoshua Bengio、姚期智、Geoffrey Hinton 等图灵奖得主,与张宏江、黄铁军及薛澜、Gillian Hadfield 等治理专家参会,讨论 AGI 系统的安全发展路径。会议形成共识声明,建议为 AI 开发设定红线,禁止开发可自主复制、自我改进、寻求权力或欺骗创造者的 AI 系统,以及可用于制造大规模杀伤性武器和发动网络攻击的系统,并提出确保这些红线不被跨越的措施。次日科学家与中国官员及企业 CEO 会面,介绍红线提案并讨论 AI 的生存性风险,官员对共识声明表示欢迎,讨论聚焦于该议题上国际合作的必要性。

  16. FAR.AI · 收录 · 原文 11

    Vienna Alignment Workshop 2024:129 名专家探讨 AI 对齐与安全

    2024 年 7 月 21 日,Vienna Alignment Workshop 在 ICML 前夕举办,129 名来自学术界、产业界、政府和公益组织的参与者围绕 Guaranteed Safe AI、鲁棒性、可解释性、治理、危险能力评估和可扩展监督展开讨论。Stuart Russell 主张从设计之初就保证 AI 安全,Nicholas Carlini 则警告对齐研究应吸取对抗机器学习十年进展有限的教训。

  17. FAR.AI · 收录 · 原文 32

    图灵奖得主 Bengio、Hinton、姚期智等科学家在威尼斯呼吁全球 AI 安全应急准备

    2024 年 9 月 6 日至 8 日,Yoshua Bengio、Andrew Yao、Geoffrey Hinton 等计算机科学家与薛澜、Gillian Hadfield 等治理专家在威尼斯参加第三届国际 AI 安全对话(IDAIS-Venice),提出三项政策建议:针对先进 AI 风险建立国际应急准备协议,涵盖模型注册与披露、事件报告、tripwires 和应急计划;要求开发者在部署能力超过特定阈值的模型前提交高置信度安全案例,并接受独立审计;推动全球范围、多政府与慈善机构资助的安全与验证研究。

  18. FAR.AI · 收录 · 原文 13

    FAR.AI 湾区对齐研讨会 2024:160 名研究者聚焦 AI 安全与对齐

    2024 年 10 月 24-25 日,160 名来自学术界、产业界、政府和公益组织的研究者与负责人齐聚 Santa Cruz,参加 FAR.AI 湾区对齐研讨会,围绕评估、鲁棒性、可解释性与治理展开讨论。Google DeepMind 的 Anca Dragan 以"优化失准"开场,METR 的 Beth Barnes 强调严格评估与开源评测,Redwood 的 Buck Shlegeris 介绍可信监控、串通检测等 AI 控制策略。会议还涵盖中国 AI 政策、稀疏自编码器与因果抽象、辩论式可扩展监督等议题。

  19. FAR.AI · 收录 · 原文 18

    FAR.AI 巴黎 AI 安全论坛 2025:Bengio、RAND 与英国 AISI 共议 AI 系统风险

    2025 年 2 月 9 日,约 200 名研究者、工程师和政策制定者在巴黎皇家宫殿参加 FAR.AI 主办的 Paris AI Security Forum,讨论自主网络攻击、AI 智能体被劫持及硬件层防护等安全问题。Yoshua Bengio 指出欧盟《人工智能法案》行为准则仅是必要的第一步,呼吁监管者加快行动以防自我保存型 AI 脱离人类控制;RAND 与 Pattern Labs 警告国家行为体和资金充裕的攻击方已在探测 AI 弱点。Alex Robey 团队通过对自动驾驶汽车、无人地面车辆和机器狗的实验展示了针对 AI 控制机器人系统的越狱攻击路径。

  20. FAR.AI · 收录 · 原文 15

    Redwood Research、FAR.AI 与英国 AI Security Institute 举办 ControlConf 2025

    Redwood Research、FAR.AI 和英国 AI Security Institute 于 3 月 27-28 日举办 ControlConf 2025,聚焦 AI 控制领域的基础问题。会议涵盖通过重采样控制 AI 智能体、低风险研究破坏、AI 控制安全案例、颠覆策略评估等议题,Anthropic、Google DeepMind、Apollo Research 等机构研究者参与。