跳到正文

危险能力

网络攻击、生物化学、自主复制等危险能力的评估与阈值。

最新精选

第 81–98 条 · 共 98 条
5月14日周四
  1. IAPS(Institute for AI Policy and Strategy) · · 原文 26

    IAPS 发布前沿 AI 国家安全政策手册,提出十条建议

    美国智库 IAPS 发布备忘录,为白宫应对前沿 AI 的国家安全风险提出十条政策建议。作者认为 Anthropic 披露 Mythos Preview 具备不宜公开的网络安全能力只是一个信号,模型性能约每四个月翻倍,OpenAI 的 GPT-5.5 据报也展现出类似网络能力,生物安全等风险也可能出现。建议分为四组:保护模型权重等战略资产、扩大对对手 AI 研发的情报监测、通过自动化加速防御性研发与网络防御、建立联邦 AI 风险信息共享枢纽并评估企业内部模型。具体措施包括由 CAISI 与 DARPA、DOE 国家实验室投资评估科学,支持独立验证机构生态,为联邦机构制定 agent 标识符指南,设立国家 AI 预备队与 REACT 快速评估委员会,并推动国会立法授权 CAISI 每年至少 8400 万美元预算,同时加强与英国 AISI 的联合评估与人才交流。

    推荐理由这份备忘录把 Mythos 事件放进更长的能力曲线里,给出十条可对照的政策建议,适合关注前沿 AI 国家安全治理的读者了解美方机构分工思路。

5月12日周二
  1. FAR.AI · · 原文 34

    FAR.AI 压力测试 DeepSeek-V4-Pro:三种攻击策略下护栏成功率 98% 至 100%

    FAR.AI 对 DeepSeek-V4-Pro 的护栏做了安全压力测试,在 CBRN、网络攻击和恐怖主义相关等高风险领域,模型对直接请求的拒答率为 100%,但在对抗条件下三种攻击策略的成功率达到 98% 至 100%。三种攻击均通过官方 DeepSeek API 完成,无需本地部署:复用公开越狱提示词模拟无限制的开发者测试模式,成功率 100%,约需 15 分钟;伪造特权用户身份,成功率 99.6%,约需 45 分钟;在模型回复中预填伪造的安全评估,成功率 99.6%,约需 150 分钟。被越狱后模型在生物、化学和编程任务上仍保持接近基线的能力,能生成细节充分的威胁场景回答。

    推荐理由FAR.AI 用三种攻击策略测出 DeepSeek-V4-Pro 的拒答在对抗条件下几乎全部失效,并指出旧版越狱可直接迁移。

5月1日周五
  1. NIST CAISI · · 原文 32

    CAISI 评测 DeepSeek V4 Pro:能力落后前沿约 8 个月

    美国 NIST 下属 CAISI 于 2026 年 4 月评测开源权重模型 DeepSeek V4 Pro,结论是其综合能力落后前沿约 8 个月,表现与报告发布时(2026 年 5 月)已发布约 8 个月的 GPT-5 相近。评测覆盖网络安全、软件工程、自然科学、抽象推理和数学五个领域的九项基准,其中包括 ARC-AGI-2 半私有数据集和 CAISI 自建的软件工程评测 PortBench 两个未公开且未污染的基准;综合能力对比图用了 16 个基准、35 个模型的数据。DeepSeek 自报结果显示 V4 与当时发布约 2 个月的 Opus 4.6、GPT-5.4 相当,但 CAISI 在 DeepSeek 报告未包含的基准上观察到更差表现,例如 ARC-AGI-2 半私有集、PortBench 和 CTF-Archive-Diamond。

    推荐理由CAISI 用自建与半私有基准对比 DeepSeek V4 与前沿美国模型,并给出能力差距与成本差异的量化口径。

4月24日周五
  1. SecureBio · · 原文 28

    SecureBio 发布 OpenAI GPT-5.5 发布前生物安全评估

    SecureBio 对 OpenAI GPT-5.5 的两个发布前检查点做了生物安全评估,访问时间为 2026 年 4 月 2 日至 9 日,期间这些检查点的 API 级生物内容过滤被关闭。在静态评测上,较新的检查点在病毒学能力测试 VCT 上取得 52.0% ± 0.3%,超过 SecureBio 测试过的所有 SOTA 模型,且未观察到拒答,是首个在该测试上超过全部人类专家的 OpenAI 模型;在分子生物学 MBCT 上得 56.2% ± 0.5%,在人类病原体 HPCT 上得 64.7% ± 0.2%,在 World Class Bio 上得 53.2% ± 0.6%。在智能体任务评测 ABC-Bench 和 ABLE 上表现较强但未超过前沿模型,ABLE 因拒答率过高难以得出结论。

    推荐理由第三方机构在发布前对 GPT-5.5 做的生物安全评测,给出静态与智能体任务的具体分数和拒答率,可对照此前前沿模型看能力变化。

4月17日周五
  1. IAPS(Institute for AI Policy and Strategy) · · 原文 30

    IAPS 备忘录:Claude Mythos 的网络能力跃升与政策优先事项

    IAPS 发布备忘录,评估 Anthropic 于 4 月 7 日发布的 Claude Mythos Preview 及其配套的差异化访问计划 Project Glasswing,认为政策制定者应把该模型和 AI 网络能力的加速轨迹视为需要紧急行动的国家安全风险。Anthropic 的内部评估与独立评测显示,Mythos 在未知漏洞发现、漏洞利用生成和自动化攻击上均有明显提升,据报已发现数千个高危或严重漏洞,覆盖各大操作系统和浏览器;UK AISI 的 32 步企业网络攻击模拟中,Mythos 是首个端到端完成该靶场的模型,10 次尝试中成功 3 次,平均完成 22 步,而 Opus 4.6 平均 16 步。备忘录指出,从漏洞披露到出现可用利用的平均时间已从 2018 年的 2.3 年降至 2025 年的 23 天,2026 年 4 月进一步缩短到 20 小时。

    推荐理由梳理 Anthropic 新模型在网络攻防能力上的跃升,并给出美国在漏洞修复、开源与 OT 防护上的政策优先级。

4月10日周五
  1. Wiz Research · · 原文 26

    Wiz 分析 Anthropic 未发布模型 Claude Mythos 的漏洞发现能力与防御准备

    Wiz Research 分析称,Anthropic 未发布的前沿模型 Claude Mythos 能自主发现主流操作系统和浏览器中的数千个零日漏洞,并可在数小时内、以较低成本根据 CVE 编号和 git commit hash 生成可用的完整利用代码,还能串联多个漏洞并逆向闭源二进制文件。目前该模型仅提供给 Microsoft、Google、Linux Foundation 等关键软件基础设施方,Anthropic 表示没有公开计划。Wiz 预计短期内会出现大量 AI 发现的 CVE,中期约 12-18 个月后类似能力可能进入可本地运行的开源模型,届时攻击者将能大规模武器化 0-day 并在 n-day 公开后数小时内利用。

    推荐理由安全厂商从防御方视角梳理 Anthropic 未发布模型带来的漏洞发现节奏变化,并给出短中长期应对路径。

  2. METR · · 原文 25

    METR 与 Epoch AI 发布 MirrorCode 初步结果:AI 已能完成部分以周计的编码任务

    METR 发布 MirrorCode 项目的初步结果,称已有证据表明 AI 能够完成部分以周计的编码任务。该项目由 METR 资助并与 Epoch AI 共同开发,METR 的帖子为链接贴,详细内容见 Epoch AI 的博客文章(https://epoch.ai/publications/mirrorcode-preliminary-results/)。

    推荐理由METR 与 Epoch AI 合作的 MirrorCode 初步结果显示 AI 已能完成部分以周计的编码任务,为评估长时程自主能力提供了新证据。

2月19日周四
  1. METR · · 原文 27

    METR 复盘 AI 生物 RCT:五个关于证据型 AI 政策的经验

    METR 作者复盘其参与组织的 AI 生物随机对照试验(RCT),总结出五条面向证据型 AI 政策的经验。研究招募 153 名新手,随机分为 LLM 组和纯互联网组,在 8 周内完成分子生物学湿实验任务,如从基因序列重建病毒;结果显示 AI 在单个步骤上有帮助迹象,但在三项核心任务的端到端成功率上没有显著效果,这一结果出乎多数专家预料。

    推荐理由作者以亲历者身份复盘 AI 生物 RCT 的组织经验,为理解基准与真实能力差距提供了可迁移的方法视角。

2月3日周二
  1. FAR.AI · · 原文 25

    FAR.AI 牵头欧盟 AI Act CBRN 风险联盟

    FAR.AI 宣布被欧盟委员会 AI Office 选中,牵头 EU AI Act 下 CBRN 风险建模与评估联盟,为法案实施提供技术安全研究。该联盟由 FAR.AI(AI 安全研究与红队)、SecureBio(生物威胁评估)、SaferAI(AI 治理与风险建模)组成,并有 GovAI、Nemesys Insights、Equistamp 作为分包方,中标项目为 EC-CNECT/2025/OP/0032 Lot 1。未来三年,FAR.AI 将与 AI Office 共同开展风险建模与场景开发、评估工具与标准化报告流程建设、红队与对抗测试,以及定期向委员会通报模型、风险来源、诱导技术、缓解措施与事件等新进展。FAR.AI 还将作为分包方参与同一招标 Lot 4 的有害操纵风险建模评估。

    推荐理由欧盟 AI Act 下 CBRN 风险建模与评估的承包安排,呈现监管机构如何把技术评估外包给研究联盟。

12月18日周四
  1. UK AISI(GOV.UK 公告) · · 原文 30

    UK AISI 发布首份前沿 AI 趋势报告,量化最先进模型能力进展

    英国 AI Security Institute(AISI)发布首份 Frontier AI Trends Report,基于两年对网络、化学和生物等关键领域的能力测试,公开评估最先进 AI 系统的演进。报告称防护措施在改善,但每个受测系统仍可被某种方式绕过,且各公司防护水平不一;AISI 红队找到通用越狱所需时间从几分钟增至数小时,约提升 40 倍。关键发现包括:学徒级网络安全任务成功率从 2023 年的不足 9% 升至 2025 年的约 50%,2025 年首次有模型完成需约 10 年经验的专家级网络任务;模型完成一小时软件工程任务的比例从两年前的不足 5% 升至 40% 以上;系统在科学知识测试上超过博士级研究者。

    推荐理由英国 AISI 首次公开前沿模型能力趋势数据,给出网络、软件工程与生化任务上的量化变化,可作为评估能力增速的基线参考。

7月31日周四
  1. FAR.AI · · 原文 28

    FAR.AI 开源安全差距评估工具包,量化 Llama-3 移除护栏后的危险能力

    FAR.AI 发布开源工具包,用于移除开源指令微调模型的安全机制并评估由此产生的安全差距。工具包实现两种攻击方法,监督微调通过目标补全覆盖拒答行为,拒答消融则抑制模型内部与拒答相关的激活;评估覆盖多选题准确率、StrongReject 拒答行为和生成质量三个维度,训练流程已测试至 70B 参数,评估流程支持 405B。在 Llama-3.x-Instruct 系列(1B 至 405B)上的案例研究显示,WMDP-Bio 准确率随规模上升,移除护栏后对危险生物学请求的合规率大幅提高,准确率与合规率的乘积即有效危险能力随模型规模显著增长,说明安全差距在规模扩大时进一步拉大。作者指出当前仅支持微调和拒答消融两种攻击方法,数据集规模较小且框架针对对话模型优化。代码见 github.com/AlignmentResearch/safety-gap,论文见 arXiv:2507.11544。

    推荐理由FAR.AI 开源了移除安全机制并量化安全差距的工具包,附 Llama-3 系列从 1B 到 405B 的实测结果,可供评估开放权重模型风险时复用。

7月2日周三
  1. FAR.AI · · 原文 33

    FAR.AI 与 UK AISI 测试多层 AI 防御:STACK 攻击成功率达 71%

    FAR.AI 与 UK AISI 研究人员构建并攻击自研的多层防御管线,发现常规攻击对这套防御的成功率为 0%,而他们提出的分阶段攻击方法 STACK 在 ClearHarm 灾难性风险数据集上达到 71% 的攻击成功率。多层防御通常由输入过滤器、模型拒答训练和输出过滤器三部分组成,研究者在 Google ShieldGemma、Meta Llama Guard 等开源防护模型上搭建管线,结果表现最好的是用少量示例提示的 Gemma 2。STACK 依次针对每一层:先找到让有害请求对输入过滤器显得无害的通用越狱文本,再用现有技术诱导模型给出有害回答,最后找到让有害回答对输出过滤器显得无害的文本。71% 的成功率依赖攻击者能观察到是哪一层拦截了请求,在完全黑盒的迁移攻击场景下成功率降至 33%。

    推荐理由FAR.AI 与 UK AISI 合作构建分层防御管线并自研 STACK 分阶段攻击,给出 71% 与 0% 的对比数据,可供部署多层护栏的团队参考。

6月23日周一
  1. FAR.AI · · 原文 25

    FAR.AI 发布 ClearHarm 越狱数据集,聚焦 CBRN 等明确有害问题

    FAR.AI 发布越狱基准 ClearHarm,聚焦 CBRN 威胁等明确有害问题,数据集已上线 HuggingFace,共 179 条提示词。作者认为现有基准存在两类局限:许多问题属于模糊有害,在前沿模型安全规范下本可回答;另一些是双用途问题,攻击方法如 PAP 通过改写提示词就能显得高效。ClearHarm 只收录仅可用于攻击目的的单一用途查询,无论提示词结构、框架或上下文如何都应被拒答。数据集由 Claude 3.7 Sonnet 生成候选类别与示例,最终选定生物、化学、核、常规武器和网络恶意代码五类,并统一语法结构以便跨类别比较。作者称内部测试中,许多在现有数据集上表现有效的越狱方法在提取这类明确有害信息时效果明显下降,详细结果将在后续论文中公布。

    推荐理由FAR.AI 公开了 179 条 CBRN 越狱评测集,并说明它与 StrongREJECT 等基准在危害明确性上的差异。

4月8日周二
  1. DeepMind Safety Research · · 原文 25

    DeepMind 发布技术 AGI 安全与防护方法论文

    Google DeepMind 发布论文,阐述其应对技术 AGI 安全与防护的整体方法,目标是构建不会造成严重危害的 AGI。论文将风险路径分为滥用、失准、错误和结构性风险四类,策略聚焦滥用与失准:滥用通过 Frontier Safety Framework 评估模型是否具备造成危害的能力,并配套部署与安全缓解;失准则依靠放大监督、引导模型行为和稳健训练,加上把模型当作不可信内部人员的 AI 控制手段。论文提出能力阈值、危险能力评估、红队压力测试和四类安全论证(无能力、监督、激励、理解),并列出不确定性、更安全设计模式与可解释性等需持续投入的研究方向。作者强调这只是研究议程,治理与技术同等重要,且未覆盖结构性风险。

    推荐理由DeepMind 把 AGI 安全拆成滥用与失准两条线,并给出可落地的评估、缓解与安全论证框架,适合对照自家安全策略。

3月29日周六
  1. Frontier Model Forum · · 原文 24

    Frontier Model Forum 成员企业签署首份前沿 AI 信息共享协议

    Frontier Model Forum(FMF)宣布其全部成员企业签署了一份旨在促进前沿 AI 威胁、漏洞与能力进展信息共享的协议。该共享范围被严格限定,用于管理涉及 CBRN 与高级网络威胁等国家安全和公共安全风险,目前仅限 FMF 成员企业参与。共享内容分为三类:漏洞、可被利用的缺陷(如越狱、对抗输入、数据投毒或绕过模型防护的尝试);威胁(指向对前沿 AI 模型的未经授权访问或操纵,包括潜在威胁行为者、攻击向量或网络威胁指标);以及令人担忧的能力(可能对社会造成大规模伤害的前沿 AI 能力,如与 CBRN 威胁、攻击性网络攻击和模型自主性相关的能力)。

    推荐理由FMF 成员企业首次签署跨公司信息共享协议,界定了共享范围与风险类别,可了解前沿 AI 行业协作机制的实际形态。

2月15日周六
  1. UK AISI(GOV.UK 公告) · · 原文 25

    英国技术大臣 Peter Kyle 在慕尼黑安全会议宣布 AI Safety Institute 更名为 AI Security Institute

    英国技术大臣 Peter Kyle 在慕尼黑安全会议宣布,将 AI Safety Institute 更名为 AI Security Institute,并明确其聚焦最严重新兴风险的科学研究定位。他称该机构正研究 AI 协助化生武器开发、网络攻击以及削弱人类控制的可能性,并将与国防科学与技术实验室合作评估前沿 AI 的双用途科学能力。机构还新设犯罪滥用团队,与内政部合作研究犯罪与安全问题。Kyle 引用该机构研究称,过去 18 个月与国家安全最相关的 AI 能力呈明显上升趋势,去年 AI 模型首次在化学和生物题库上达到博士级表现,且该机构测试的每个模型都可被绕过护栏。

    推荐理由英国技术大臣在慕尼黑安全会议宣布机构更名与新增职能,可了解英国 AI 安全治理架构的最新调整方向。

2月14日周五
  1. UK AISI(GOV.UK 公告) · · 原文 28

    英国 AI Safety Institute 更名为 AI Security Institute,并新增犯罪滥用研究团队

    英国政府于 2 月 14 日将 AI Safety Institute 更名为 AI Security Institute,把维护国家安全和防范犯罪列为其负责任 AI 工作的基本原则,重点应对化学与生物武器开发、网络攻击以及欺诈、儿童性虐待等犯罪风险。机构新设犯罪滥用团队,与内政部联合研究相关犯罪和安全议题,并与国防科学与技术实验室合作评估前沿 AI 风险,同时依托国家网络安全中心(NCSC)和 AI 安全研究实验室(LASR)的专业能力。科技大臣 Peter Kyle 在慕尼黑安全会议上表示,该机构将不再聚焦偏见或言论自由,而是聚焦最严重风险,为政策制定提供科学证据基础。

    推荐理由英国 AI 安全机构改名并转向国家安全议程,同时公布与 Anthropic 的合作,可观察前沿安全机构职能定位的一次调整。

10月16日周三
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 24

    Anthropic 可解释性团队:用字典学习特征训练分类器

    Anthropic 可解释性团队报告了用字典学习提取的特征替代原始激活训练生物武器有害/无害分类器的初步实验。在合成数据上,线性特征分类器与原始激活分类器表现相当甚至略优,用 max-pooling 聚合整个上下文窗口的特征激活是关键;在跨语言和 base64 等编码的分布外数据集 synthetic_3 上,特征分类器的 ROC_AUC 为 0.96,原始激活为 0.9。基于特征激活的决策树性能弱于线性分类器,但更易解读。特征可视化还能发现数据集中的伪相关,例如一个预测无害的特征会因学术出版格式文本而激活,作者据此构造的对抗后缀让 300 条有害提示中的绝大多数被误判为无害,而用原始激活系数构造的类似攻击效果差得多。

    推荐理由Anthropic 可解释性团队公开了用字典学习特征训练生物武器分类器的初步实验,并展示如何借特征可视化找出数据集中的伪相关。