跳到正文

前沿安全框架

实验室的前沿安全框架、负责任扩展政策与准备框架的发布和修订。

329条动态与论文相关主题政策与监管System CardAnthropic
在这个话题内搜索或按分类筛选

新闻与论文

第 141–160 条 · 共 329 条
10月2日周五
  1. POLITICO Europe Technology · 收录 · 原文 27

    英国将在 G20 推动制定“单一套”全球 AI 标准

    英国首相 Andy Burnham 在纽约表示,英国将在其即将担任的 G20 主席国任期内把 AI 作为“首要议题”,推动建立“单一套全球原则与标准”,兼顾释放 AI 潜力与防范风险。他称英国可充当全球 AI 协议的“诚实中间人”,并认为统一标准也能为英国带来投资利益。此番表态与特朗普在联合国演讲中称美国“完全拒绝任何构建全球主义方案”以控制 AI 的立场形成对比。

  2. POLITICO Europe Technology · 收录 · 原文 43

    特朗普在联大拒绝设立全球 AI 监管机构

    特朗普在联合国大会演讲中拒绝设立全球实体监管人工智能,称美国不接受任何构建全球主义 AI 控制方案的尝试。他重申美国在 AI 创新上领先世界,并再次称该技术的破坏性或潜在危险能力是骗局,同时警告监管 AI 可能拖慢美国、让中国领先。他还主张把名称改为超级智能,呼吁各国弃用 artificial 一词,并称美国文件将改用这一说法。此番表态前一天,22 个国家在联大场外通过宣言,主张 AI 必须处于人类指导、监督和控制之下,并提出建立全球监管机制;宣言组织者之一、芬兰总统斯图布对 POLITICO 表示,某种护栏符合中美两国利益。

  3. POLITICO Europe Technology · 收录 · 原文 22

    POLITICO 民调:美加欧多国成年人跨党派支持暂停 AI 开发

    POLITICO 委托独立民调机构 Public First 在美、加、英、法、西、德六国调查发现,约半数成年人认为当前 AI 已足够好,支持暂停进一步开发以降低风险,英国比例最高为 51%,德国最低为 45%,仅 30% 至 40% 支持继续开发以获取"显著收益"。多国过半数受访者认为 AI 至少有"中等"风险"毁灭人类",美国、法国、英国和加拿大这一比例接近三分之二。多数受访者认为本国即便在 AI 竞赛中落后,只要发展方式更负责任、更安全也可以接受,且更倾向于认为 AI 会摧毁而非创造就业。

  4. POLITICO Europe Technology · 收录 · 原文 42

    美中在联合国安理会会议上就 AI 监管路线分歧明显

    在联合国大会安理会会议上,美国与中国官员提出截然不同的国际 AI 安全主张。白宫科技政策办公室主任 Michael Kratsios 明确反对建立新的全球 AI 治理机制,称美国完全拒绝任何控制超级智能的全球主义方案,并强调各国应保留监管 AI 的国家主权。中国常驻联合国代表傅聪则呼吁加强 AI 发展战略、治理与技术标准的协调,尽早形成基于共识的全球治理框架,并警告以阵营划线的做法服务于某些大国维持技术优势的企图。OpenAI CEO Sam Altman 在会上推动建立国家与国际前沿 AI 标准互补的机制,Anthropic CEO Dario Amodei 也重申支持国际合作,确保安全跟得上能力。

  5. POLITICO Europe Technology · 收录 · 原文 35

    全球AI安全治理努力可能不得不在美国缺席下推进

    联合国大会期间,多国领导人及OpenAI CEO Sam Altman、Anthropic CEO Dario Amodei呼吁建立AI全球治理框架,Anthropic主张制定模型测试的"共同全球标准"。由芬兰和挪威牵头、22国通过的AI安全宣言未获美国和中国签署,特朗普在联大演讲中明确拒绝任何AI"全球主义控制方案"。前美国官员指出,美国不参与将限制相关努力的有效性,而中美领导人本周会晤仅将顺带讨论AI。

  6. POLITICO Europe Technology · 收录 · 原文 56

    白宫要求 OpenAI 和 Anthropic 在美方审查前不向英国测试机构开放新模型

    白宫通过国家网络主任办公室要求 OpenAI 和 Anthropic 在模型完成美国政府测试前,不要将其提供给英国 AI 安全研究所(AISI)。一名美国高级官员称,此举是因为两家是美国公司,且这是美国对所有新前沿模型的一贯政策。Anthropic 目前似已遵从,其 Claude Mythos 5.1 未提供给英国 AISI,公告称该模型仅面向一组美国机构,并表示正与美方协调尽快扩大国内外合作伙伴的访问范围。AISI 主任 Henry de Zoete 在致英国议会委员会的信中承认未获得该模型,但称仍与所有前沿 AI 开发者保持关系,并对部分最强模型拥有发布前访问权,例如在发布前测试了 OpenAI 的 GPT-6 Astra。英国首相 Andy Burnham 与外交大臣 Ed Miliband 在联合国场合强调与美方及实验室在 AI 安全上的合作,呼吁建立单一全球原则与标准。

    推荐理由白宫要求美国实验室先经本国审查再向英国 AISI 开放模型,呈现前沿模型测试准入的跨大西洋分歧。

  7. Tech Policy Press · 收录 · 原文 29

    非西方国家在联合国大会上如何谈 AI 治理

    在联合国大会高级别周上,土耳其、韩国、日本、南非、尼日利亚、巴基斯坦、阿根廷等国呼吁在 AI 规则制定中获得更大话语权。巴基斯坦支持为前沿 AI 发展"定速",但警告"定速不能成为新的守门形式";尼日利亚反对风险优先路线,阿根廷主张不进行预防性监管。芬兰和挪威 9 月 21 日发起前沿 AI 模型控制呼吁,要求部署前测试与独立评估,挪威政府称 22 位领导人支持。

  8. Thinking Machines · 收录 · 原文 43

    Thinking Machines 提出开源权重模型的安全发布路径

    Thinking Machines 发布文章阐述开源权重模型的安全发布路径,并说明其近期开源的 Inkling 与 Inkling-Small 的评估依据。文章主张安全发布取决于模型本身与所处生态:对模型做稳健安全测试,并研究能否通过预训练数据筛选或后训练干预把危险能力与通用智能解耦;对生态则通过分阶段发布、支持防御方和与安全研究者合作来提升韧性。Inkling 的评估包括覆盖 CBRN 与攻击性网络安全等领域的内部评测、四家外部机构的红队测试(Scale AI、Handshake AI、FAR.AI、Apollo Research),以及去除拒答行为的对抗微调实验;结果显示两个模型未扩展危险能力前沿,也未显著扩大相关能力的可及性。文章还提出从受监控 API 访问、托管微调到开放权重的分阶段路径,并计划发布更详细的评估、准入标准与停止条件框架,同时将推出 Tinker 安全资助。

    推荐理由Thinking Machines 公开了其开源权重模型的分阶段发布框架,并说明 Inkling 通过内外部评测与对抗微调后被判定未扩展危险能力前沿。

  9. 安远AI · 收录 · 原文 43

    Concordia AI 发布《中国 AI 安全现状(2026)》报告及配套交互网站

    Concordia AI 发布《中国 AI 安全现状(2026)》年度报告,覆盖 2025 年 7 月至 2026 年 6 月中国在通用 AI 安全方面的进展,并上线配套交互网站。报告分国内治理、国际治理、技术安全研究、专家观点与产业治理五个领域。国内治理方面,2026 年 3 月确立的“十五五”规划(2026–2030)将“AI+”作为总体政策,同时强调风险预警与应急响应,并关注 AI 对就业的影响;开源智能体 OpenClaw 在 2026 年初扩散后,多家网络安全机构发布警告,2026 年 5 月国家网信办等三部门发布智能体专项指引,提出基于风险的治理思路。国际治理方面,中国支持联合国 AI 科学小组与全球 AI 治理对话两个新机制,并提出世界 AI 合作组织(WAICO)设想,同时与美国启动政府间 AI 对话,结束两年的官方双边冻结。

  10. 安远AI · 收录 · 原文 36

    习近平首次出席 2026 世界人工智能大会,Concordia AI 将主办前沿与智能体安全论坛

    2026 世界人工智能大会(WAIC)于 7 月 17 日至 20 日在上海举行,习近平首次亲临开幕式并发表讲话,这是该会议政治规格的新里程碑。WAIC 自 2018 年起每年举办,2018 年习近平致贺信、副总理刘鹤出席讲话,2019 至 2023 年现场最高级别出席者为上海市委书记,2024 和 2025 年由总理李强致开幕辞。本届 WAIC 设有 140 多个专题论坛,其中包含多场 AI 安全与治理论坛。Concordia AI 将于 7 月 19 日 8:45 至 12:30(UTC+8)在上海世博桐森酒店 3 楼 1、2 号功能厅主办前沿与智能体安全论坛,并在官方 WAIC App 直播;去年该论坛现场参会超 200 人、直播观看超 14000 次。

  11. 安远AI · 收录 · 原文 52

    2026 WAIC 上的中国 AI 安全动向:习近平讲话、主席声明与 WAICO 成立

    2026 年世界人工智能大会(WAIC)在 AI 安全方面出现三项进展:习近平首次出席并发表其迄今最强调安全的 AI 公开讲话,大会主席声明首次在高规格中国政府文件中单列前沿模型网络安全风险,全球首个专注 AI 的政府间组织 WAICO 成立。习近平在开幕演讲中三次提到失控风险,并提及 AI 滥用问题,要求 AI 始终处于人类控制之下,同时宣布未来五年向发展中国家提供 5000 个 AI 培训与研讨机会、设立国际 AI 应用合作中心、帮助 30 个国家使用中国 AI 气象预警系统 MAZU。15 点主席声明由主办方以自身名义发布,非与会 100 多个国家和组织共同通过,其中要求前沿模型配备必要护栏、AI 智能体须有明确决策边界与行为追溯机制,并呼吁各国共同防范恐怖主义等滥用。

  12. 安远AI · 收录 · 原文 32

    2026 WAIC 上海前沿与智能体 AI 安全论坛要点总结

    2026 年 7 月 19 日,Concordia AI 在上海世界人工智能大会(WAIC)举办前沿与智能体 AI 安全论坛,约 30 位专家参会、现场约 300 名观众,直播观看量超 30 万。图灵奖得主 Yoshua Bengio 在主题演讲中指出 AI 在推理、编程、科学与自主智能体能力上快速进步,而安全措施未能同步,并强调开放权重模型在撤回部署、移除护栏与风险评估上的独特挑战。论坛围绕前沿 AI 风险监测、智能体 AI 全生命周期安全治理与全球治理视角三大主题展开。

  13. 安远AI · 收录 · 原文 52

    Concordia AI 发布 2026 Q2 前沿 AI 风险监测报告:多项风险指数一年内上升数倍

    Concordia AI 在 2026 年 7 月 19 日的 WAIC 上发布前沿 AI 风险监测平台 v2.0,包含风险指数 v2.0、2026 Q2 风险监测报告和前沿 AI 风险基准数据库。报告覆盖 13 家公司 2025 Q3 至 2026 Q2 发布的 47 个前沿模型,包括 GPT-5.5、Claude Opus 4.8、Grok 4.3、DeepSeek V4 Pro、Qwen 3.7 Max、豆包 Seed 2.1 Pro、混元 3.0 Preview、文心 5.1、MiniMax M3、Kimi K2.6、GLM 5.2 和 MiMo V2.5 Pro。风险指数 v2.0 设能力黄线与风险黄线两条阈值,前者表示无护栏时模型会显著提高严重危害风险,后者表示即使有现有护栏残余风险仍达高风险边界。

  14. 安远AI · 收录 · 原文 43

    中国网信办官员警示 AI 失控与生物风险,Z.AI 首次因安全推迟 GLM-5.3 权重发布

    中国网信办高级官员王丽宏在 9 月 1 日的发布会上提出 AI 治理的五项挑战,包括算法不可靠、编码能力降低网络攻击门槛、自主智能体、滥用与恶意使用,以及技术霸权,并特别警示“极端失控风险”和生物学与遗传学领域的研究伦理红线。简报认为这是网信办官员首次如此突出地把生物与遗传学列为 AI 风险领域,此前该风险多出现在标准文件中。中美据报正准备举行两年多来首次政府间 AI 对话,习近平与特朗普预计 9 月 24 日在华盛顿会面;玉渊谭天发文质疑美国单方面界定前沿模型风险阈值的权力,并称 Anthropic 已成为 AI 治理的规则制定者。TC260 预计在 9 月 14 至 20 日的国家网络安全宣传周发布更新版 AI 安全治理框架。

  15. 安远AI · 收录 · 原文 52

    TC260 发布 AI 安全治理框架 3.0,风险条目从 30 项增至 54 项

    中国主要 AI 标准制定机构 TC260 发布《AI 安全治理框架》3.0,风险条目从上一版的 30 项增至 54 项,开篇即指出 AI 已从“回答问题”转向“执行任务”。新增内容覆盖智能体运行风险,包括提示注入、工具投毒、身份伪造、记忆污染、凭证窃取和长周期任务中的目标劫持,并提出分阶段放权、高风险任务人工签核、工具与插件安全审计、运行时护栏等措施。框架还首次纳入具身智能风险、自主网络攻击、模型拒绝关机、欺骗评估者、故意藏拙等智能体失准行为,并将网络安全风险单列一节。在开源与闭源模型上给出更平衡的评估,同时新增个人信息保护、文化与社会风险、环境保护等类别,并呼吁在金融、教育、广电、医疗等领域探索监管沙盒。该框架不具约束力,但由 CAC 指导起草,被视为后续标准制定的蓝图。

  16. MIRI · 收录 · 原文 27

    MIRI 技术治理团队 2026 ICML 论文汇总:六篇 AI 治理研究

    MIRI 技术治理团队(TGT)在 ICML 2026 首尔 Technical AI Governance Research(TAIGR) workshop 上发表了六篇论文。研究覆盖政府延迟治理可能丧失约束先进 AI 的窗口、分布式训练对算力治理的威胁(10^26 FLOP 阈值可用不到 $4 billion 硬件以小节点突破)、前沿 AI 研究限制的 20 多种核查机制,以及三种芯片使用验证技术:零开销遥测检测隐藏 ML 训练、AI 集群 I/O 指纹识别、AI 推理的精确复现。

  17. MIRI · 收录 · 原文 20

    中国释放 AI 治理积极信号:从习近平到 CnAISDA 的表态汇编

    MIRI 汇总中国政府及多位高层人士历年表态,指出中方至少在 2017 年起持续释放参与全球 AI 治理的意愿。Xi Jinping 在 2026 年世界人工智能论坛警告 AI 可能脱离人类控制,呼吁建立基于共识的全球治理框架并完善法律法规与技术监测体系;Ding Xuexiang、Li Qiang、Zhang Jun 也先后在国际场合提出协调形成全球 AI 治理框架、确保人类能按下停止键。中国自身 AI 安全机构 CnAISDA 于 2025 年 6 月成立,Yao 等人公开警示超级智能带来的生存风险。

  18. MIRI · 收录 · 原文 43

    MIRI 表态支持 2026 年禁止人工超级智能法案

    MIRI 发文支持《2026 年禁止人工超级智能法案》,认为这是其二十多年来所见首份有机会阻止超级智能灭绝威胁的立法,并逐条评述其可取与不足之处。法案要求模型出现可自动化 AI 研发、规避人类关停等前兆特征时暂停训练,并设置训练算力阈值,超过阈值需取得许可;MIRI 认可阈值可随算法与数据效率提升而调整,但建议调整频率高于每年一次。MIRI 还赞赏法案呼吁国际解决方案,并主张美国的政策应是阻止全球范围内开发人工超级智能。不足之处包括法案未对 AI 芯片进行追踪与监控,也未对某些研究设限;MIRI 认为生物武器设计能力提升等前兆与 ASI 并非直接相关,或需另一套规则,长期可考虑在 ASI 禁令生效后设置例外。

  19. Transparency Coalition.AI · 收录 · 原文 43

    伊利诺伊、加州、俄勒冈三州州长以行政令加速推进 AI 安全措施

    伊利诺伊州州长 JB Pritzker、加州州长 Gavin Newsom 和俄勒冈州州长 Tina Kotek 在一周内先后签署行政令,推进对前沿 AI 模型的监管。伊利诺伊的行政令设立 Illinois Artificial Intelligence Cabinet,为州政府应对 AI 事件、保护公共资产与基础设施提供建议,并建立在 2026 年 Illinois AI Safety Measures Act 要求的独立第三方安全审计之上。俄勒冈的行政令 EO 26-26 要求州首席信息官在 90 天内提交实施方案,评估对前沿 AI 模型设置 kill switch 要求的可行性。报道称这些行动回应了近期涉及 OpenAI 和 Anthropic 前沿模型的 AI 事件。

  20. Transparency Coalition.AI · 收录 · 原文 19

    美国加州、伊利诺伊州和俄勒冈州州长签署行政令监管不受约束的 AI 模型

    针对近期 OpenAI 和 Anthropic 前沿模型的 AI 事故引发的担忧,伊利诺伊州州长 JB Pritzker、加利福尼亚州州长 Gavin Newsom 和俄勒冈州州长 Tina Kotek 于上周分别采取行政行动加强 AI 监管。其中 Pritzker 签发行政令成立伊利诺伊人工智能内阁,Kotek 则指示该州首席信息官制定第三方 AI 安全审查标准并评估前沿 AI 模型"终止开关"要求的可行性。Newsom 还签署了 AB 1792,要求学校将约会虐待、数字暴力及 AI 深度伪造相关内容纳入健康教育课程。