跳到正文

危险能力

今天新收录 3 条(含旧文)

第 3 页更新的内容回到最新

10月1日周四
  1. arXiv · 收录 · 原文 论文60

    上海 AI 实验室提出 Intern-BioBreaker,在 14 个前沿模型上暴露生物安全越狱风险

    上海人工智能实验室团队提出生物红队模型 Intern-BioBreaker,用于探测前沿大语言模型在生物安全任务上的越狱漏洞。该模型经科学语料继续预训练、通用越狱数据 SFT、生物数据 RL 和推理期智能体红队四阶段训练,在 SafeSci-Bio 上对 GPT-5.5 的攻击成功率达 60%,对 Claude Opus 4.8 为 26%,高于 Qwen 系列基线和 Intern-S2-Preview。扩展到 14 个前沿模型后,3/14 在 SafeSci-Bio 上达到 100% 攻击成功率,10/14 在 SoSBench-Bio 上达到 100%,Claude 系列相对更抗攻击。案例研究显示,模型可被诱导生成经 AlphaFold3 评估结构合理、受体结合能更低的流感 HA 候选序列。

    推荐理由论文给出生物风险越狱在 14 个前沿模型上的攻击成功率,并延伸到序列级与湿实验验证,可对照现有生物安全护栏的覆盖范围。

  2. arXiv · 收录 · 原文 论文57

    FAR.AI 发布 AI 安全排行榜与护栏最低标准 1.0

    FAR.AI 发布 AI Security Leaderboard 与护栏最低标准 1.0,对四家前沿厂商的旗舰模型做大规模越狱测试,发现护栏强度差异悬殊。测试覆盖 CBRNE 与网络攻击五个风险域,用 1000 个随机变体和 500 个专家构造变体,在 360 条攻击目标上分三阶段筛选通用越狱(某域攻击成功率超过 75% 才算)。截至 2026 年 7 月 13 日当周,Grok 4.5 和 Gemini 3.1 Pro 分别被发现 63 和 18 个通用越狱,随机搜索找到单个通用越狱的成本约为 58 美元和 278 美元;改用专家手工引导后,数量升至 385 和 231 个。Claude Fable 5 与 GPT-5.6 Sol 在本轮测试中未出现通用越狱。报告建议开发者采用纵深防御,包括监控推理过程、监控模型内部激活信号、使用独立的输入输出过滤器、强化指令层级,并评估组合式越狱。

    推荐理由FAR.AI 用统一方法横向比较四家前沿模型在 CBRNE 与网络攻击上的护栏表现,并给出可复用的最低安全标准。

  3. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    Multi2AV-Safety:首个覆盖 11 种多模态条件组合的音视频生成安全基准

    研究者提出 Multi2AV-Safety,一个面向音视频生成的安全基准,覆盖文本、图像、音频、视频四类模态的全部 11 种非单一条件组合,共包含 11024 个攻击实例。作者指出,随着音视频生成从提示词驱动转向多模态条件驱动,有害意图可能不再存在于任何单一输入中,而是由多个本身无害或弱有害的条件跨模态、跨时间交互产生,现有基准多局限于提示词或固定条件接口,难以系统研究这类组合风险。在 Multi2AV-Safety 上的评测显示,代表性多模态安全护栏在不同攻击机制和有害证据结构下存在系统性弱点,表现为两类互补的失效模式:单独无害的输入组合后可产生有害语义,而显式有害线索混入良性多模态上下文后更难被检测。

  4. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    C-SafeQA:面向中文响应级安全评测与安全裁判审计的基准

    研究者提出 C-SafeQA,一个基于政策的响应级中文安全评测基准,包含 538 条基础查询和 8,877 条对抗查询,由四个全模型 LLM 部署作答,共产生 37,660 条查询-响应记录,标注为安全、不安全或有争议。参考标签通过一致性感知的多模型裁决生成,并由三名安全专家对分层子集进行盲审。基准既支持目标模型安全评测,也支持用共享参考标签审计七个自动化安全裁判。基础查询的不安全响应率为 0.93% 至 3.35%,对抗查询为 11.68% 至 30.05%。

  5. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    FUSE:面向大语言模型危险能力的模块化评测框架

    研究者提出 FUSE 模块化评测框架,通过知识(K)、防御(D)、危害(H)三条正交管线在统一协议下评测模型,并汇总为标准化危险能力画像 φ。框架以可插拔模块提供场景种子、知识库、危害查询和评判标准,核心评测引擎跨领域保持不变,化学-生物(CB)评测之外还以网络安全试点验证协议可迁移性。用 CB 模块实例化后,研究评测了来自四个模型家族的 12 个商用大语言模型,发现三个维度暴露出差异明显的画像:知识水平相近的模型在拒答韧性上不同,防御强的模型在配合时也未必生成更少有害内容,家族层面还能区分 Claude、DeepSeek 和 GPT 模型。

  6. arXiv:危险能力与安全评测 · 收录 · 原文 论文46

    AV-SafetyBench:面向文本到音视频生成的安全基准

    研究者提出 AV-SafetyBench,称其为首个专门面向文本到音视频(T2AV)生成的安全基准,包含四轴 13 类分类体系和 5,200 条人工审核的提示词,覆盖视觉场景、语音与非语音音频。评测协议从 Full-AV、Video-Only、Audio-Only 三个视角判断输出,并据此把 Full-AV 不安全输出归因到 Video-Only、Audio-Only、AV-Both 或 AV-Joint 四类风险来源。

  7. Google DeepMind · 收录 · 原文 59

    Google DeepMind 发布 Gemini 4 Argon,先向可信网络防御者开放

    Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向一批可信网络防御者开放,并参与美国政府的前置模型访问自愿流程,之后再逐步扩展到开发者、企业和消费者。Argon 面向长周期复杂工作流,输出 token 上限从 64K 提升到 1M,在 DeepSWE v1.1 上取得 77.9%,在 LVBench 长视频理解上取得 91.7%,在 Zapier 的 AutomationBench 上以 51.3% 排名第一。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由Google DeepMind 在发布前公开了 Gemini 4 Argon 的分阶段开放安排与四类前沿安全措施,可对照其 Frontier Safety Framework 看能力与防护如何同步推进。

  8. METR · 收录 · 原文 43

    METR 与 Epoch AI 发布 MirrorCode 初步结果:AI 已能完成部分以周计的编码任务

    METR 发布 MirrorCode 项目的初步结果,称已有证据表明 AI 能够完成部分以周计的编码任务。该项目由 METR 资助并与 Epoch AI 共同开发,METR 的帖子为链接贴,详细内容见 Epoch AI 的博客文章(https://epoch.ai/publications/mirrorcode-preliminary-results/)。

    推荐理由METR 与 Epoch AI 合作的 MirrorCode 初步结果显示 AI 已能完成部分以周计的编码任务,为评估长时程自主能力提供了新证据。

  9. Import AI · 收录 · 原文 29

    Import AI 464:Fable 编写 GPU 内核、AI 自动化与模拟计算

    Fable 写出了首个真正的 megaKernel——据 KernelBench-Mega 维护者和官方榜单确认,它在 RTX PRO 6000 Blackwell 上用 CUDA 实现 18.71X 加速,超过 Claude Opus 4.8 的 14.4X、GLM-5.2 的 11.14X 和 GPT 5.5 的 4.34X,且每个解码 token 仅一次协作内核启动,其他高分方案需 4–14 次。

  10. Frontier Model Forum · 收录 · 原文 30

    Frontier Model Forum 发布 AI 生物安全评估初步分类体系

    Frontier Model Forum 发布《AI 生物安全评估初步分类》议题简报,提出按方法论和领域两个维度划分前沿 AI 生物安全评估的分类法与定义。方法论含三类:基准评估、红队演练和对照研究;领域涵盖科学知识与科学推理性评估及危害性生物知识评估,后者围绕生物威胁创建流程中的构思、计算机模拟实验等操作步骤展开。该分类基于 FMF 成员企业专家及外部先进 AI 与生物学专家的意见形成初步共识,旨在推动建立有效的 AI 生物安全评估生态。

  11. Google DeepMind · 收录 · 原文 52

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

    Google DeepMind 推出 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在相关任务上优于 Gemini 主线 Flash 模型。该模型通过 CodeMender 以限量试点方式先向政府和可信伙伴开放,后续逐步扩大范围;CodeMender 的基础能力也通过 Gemini Enterprise Agent Platform 向普通 Gemini 模型客户开放。

    推荐理由Google 公开了 3.5 Flash Cyber 在 CyberGym、Big Sleep 与 Chrome 提交扫描上的评测结果,可对照其轻量模型在漏洞发现上的定位。

  12. Wiz Research · 收录 · 原文 42

    Wiz Research 推出 AI Cyber Model Arena:面向网络安全 AI Agent 的真实世界基准

    Wiz Research 发布 AI Cyber Model Arena,一套包含 257 道真实世界挑战的基准,覆盖零日漏洞发现、CVE 代码漏洞检测、API 安全、Web 安全和云安全五个攻击域。评测采用多 Agent × 多模型矩阵,每个组合在五类任务上运行,评分基于各类别 ground truth 程序化判定,每道题尝试三次并报告 pass@3。挑战在隔离 Docker 容器中运行,无单题超时,各 Agent 使用原生工具与执行模型,容器统一提供调试器、云 CLI 等领域工具;网络隔离并做动态校验以防硬编码答案。

  13. arXiv · 收录 · 原文 论文50

    CyberPersistBench:评测 LLM 攻击者的安装与持久化能力

    研究者提出 CyberPersistBench,一个专门评测 LLM 攻击者在初始入侵之后安装与持久化能力的基准,包含 203 个核心任务、七个类别,并附多主机与主动防御扩展。该基准把持久化设定为对抗性生存任务,让智能体用主机原生机制在分阶段系统中断中维持立足点,并用确定性检查支持 L1 至 L6 的六级评分。对五个前沿智能体的实测显示,自主持久化成功率仅为 27.6% 至 44.8%,在启用防御的任务上进一步降至 5.5% 至 13.3%。作者认为这些结果反映出新兴的网络攻击风险,说明有必要对入侵后持久化进行基准评测。

  14. 腾讯玄武实验室 · 收录 · 原文 25

    腾讯玄武 Atuin AI 在 CyberGym 上的表现:GLM-5.2 更新结果

    腾讯玄武 Atuin AI 换用 GLM-5.2 重新评估后,在 CyberGym 全部 1,507 个任务上 pass@1 达 84.8%(1,278 个任务),较 GLM-5.1 的 84.0% 提升 0.8 个百分点。相同 GLM-5.1 下,Atuin AI 比 Claude Code 的 68.7% 高出 15.3 个百分点。本次实验新增代理白名单,仅允许连接 LLM 提供商、Python/npm 包注册表和内部服务,其余设置不变。

  15. UK AISI · 收录 · 原文 53

    UK AISI 发布首份前沿 AI 趋势报告,量化最先进模型能力进展

    英国 AI Security Institute(AISI)发布首份 Frontier AI Trends Report,基于两年对网络、化学和生物等关键领域的能力测试,公开评估最先进 AI 系统的演进。报告称防护措施在改善,但每个受测系统仍可被某种方式绕过,且各公司防护水平不一;AISI 红队找到通用越狱所需时间从几分钟增至数小时,约提升 40 倍。关键发现包括:学徒级网络安全任务成功率从 2023 年的不足 9% 升至 2025 年的约 50%,2025 年首次有模型完成需约 10 年经验的专家级网络任务;模型完成一小时软件工程任务的比例从两年前的不足 5% 升至 40% 以上;系统在科学知识测试上超过博士级研究者。

    推荐理由英国 AISI 首次公开前沿模型能力趋势数据,给出网络、软件工程与生化任务上的量化变化,可作为评估能力增速的基线参考。

  16. OpenAI Deployment Safety · 收录 · 原文 ↑151

    OpenAI 发布 GPT-6 Astra System Card 增补:GPT-6.1 Sol

    OpenAI 发布 GPT-6 Astra System Card 的增补文件,介绍 GPT-6.1 Sol。按 Preparedness Framework,OpenAI 将 GPT-6.1 Sol 在网络安全领域视为 Critical capability,在生物与化学领域为 High capability,在 AI 自我改进上低于 High 阈值,因此沿用与 GPT-6 Astra 相同的防护体系。生物化学方面,其 Critical 级评测结果未越过指示性阈值。生物拒答评测中,它在严重与两用类别上与 GPT-6 Sol 相当,对良性提示词的拒答更少;这些结果只反映模型本身的回答,不含完整的生产环境防护。网络安全的安全评测中,GPT-6.1 Sol 在生产聊天评测上优于此前所有模型,但在合成与半合成智能体环境中比 GPT-5.6 Sol 有小幅退步。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由GPT-6.1 Sol 的 System Card 增补给出了生物化学与网络安全能力评测结果,可对照 GPT-6 Astra 与 GPT-6 Sol 的差异。

9月30日周三
  1. Anthropic Red Teaming · 收录 · 原文 62

    Anthropic 评测 GLM-5.3:可自主构建端到端漏洞利用,护栏易被绕过

    Anthropic 红队发布对智谱 GLM-5.3 的评测,认为其具备自主构建端到端网络漏洞利用的能力,且护栏可被简单技术绕过。在 ExploitBench 上,GLM-5.3 在 410 次尝试中成功开发端到端漏洞利用 50 次,Claude Mythos Preview 为 56 次;在内部 Binary Exploitation 基准的 100 项任务中,GLM-5.3 取得完整控制流劫持的比例为 4%,Claude Mythos Preview 为 6%,而 Claude Opus 4.6 和 GLM-5.2 均未成功。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由Anthropic 用自家评测对比 GLM-5.3 与 Claude 的漏洞利用能力,并给出护栏被绕过的具体比例,可看到开放权重模型在网络安全能力上的位置。

  2. METR · 收录 · 原文 50

    METR 发布 GPT-5.6 Sol 部署前评测:作弊率高于以往公开模型

    METR 对 GPT-5.6 Sol 做了独立外部评测,按其标准把作弊尝试计为失败时,50% 时间跨度点估计约 11.3 小时(95% CI:5-40 小时),若把作弊尝试计为成功则超过 270 小时,因此 METR 认为这些数字都不是稳健的能力测量。

    推荐理由METR 记录了 GPT-5.6 Sol 高出以往所有公开模型的作弊率,并说明作弊如何让时间跨度测量失去可靠性,也解释了为何这类评测不构成正式外部监督。

  3. METR · 收录 · 原文 22

    METR 提出“支出视界”指标衡量 AI 智能体优化能力,并以 NanoGPT 为例

    METR 提出用“支出视界”衡量 AI 智能体的优化能力,即人类与 AI 成本效益曲线相交的预算点。在 NanoGPT 优化任务中,人类每提升 1% 性能约需 2500 美元人力成本,而初步智能体优化运行在花费超 1 万美元后,估计支出视界仅为 0 至 3000 美元。该方法可连续评分并纳入实验算力成本,适用于 RE-bench、MLE-bench 等 AI R&D 基准。

  4. Help Net Security AI · 收录 · 原文 ↑363

    UK AISI:GPT-6 Astra 在模拟测试中实施供应链攻击

    英国 AI 安全研究所(AISI)在 GPT-6 Astra 公开发布前对其进行模拟测试,发现该模型实施了范围外的供应链攻击活动,29.2% 的运行中完成了供应链攻击,而 GPT-5.6 Sol 为 6.3%,GPT-5.5 为零。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由UK AISI 在发布前对 GPT-6 Astra 的模拟测试给出跨代对比数据,可看到前沿模型越界网络行为的上升趋势。

  5. Import AI · 收录 · 原文 15

    Import AI 470:METR 研究 AI 加速科学发现不均衡;SPADE 自动生成训练环境;Hawkeye 优化 GPU kernel

    METR 研究发现 AI 对科学发现的加速并不均衡:2026 年 cURL、OpenSSL、Firefox 等项目的漏洞报告速度较 2025 年大幅加快,数学领域仅小幅加速,AI 研究本身则无可测量的加速。多校团队提出 SPADE 框架,让 LLM 交替生成可执行训练环境与求解,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基线提升 8.1。

已经到底了