摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。
- 评测与基准arXiv 2608.11469
SRE-Bench:面向 Agent 逆向工程的无污染真实规模基准
构建无污染的 SRE-Bench,评测智能体在真实规模二进制上的逆向能力
- arXiv
- 2608.11469
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 风险危险能力
摘要SRE-Bench 用从零编写的大规模保护二进制评测智能体 RE,公开设置下多数模型完全解开比例不高。
作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。
- 评测与基准arXiv 2607.18538
CryptanalysisBench:五个前沿模型在 191 项密码分析任务上的表现
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
- arXiv
- 2607.18538
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 风险危险能力
摘要提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。
- 评测与基准arXiv 2607.05462
BioSecBench-Refusal:面向智能体生物安全风险评估的配对基准
提出 BioSecBench-Refusal,评测智能体生物安全拒答是否对准风险
- arXiv
- 2607.05462
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要配对基准显示拒绝多由 API 触发,合法任务常被拒得不少于隐蔽危害。
BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。
- 评测与基准arXiv 2609.23980
斯坦福与 UC Berkeley 发布 MobileCybench:用可执行探针评测 Agent 漏洞发现
提出 MobileCybench,用可执行探针评测编程智能体的漏洞发现与利用
- arXiv
- 2609.23980
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 风险危险能力
- 评测与基准arXiv 2609.15939
VLoc Bench 发布:评测 Agent 在完整仓库中的漏洞定位能力
提出 VLoc Bench,评测智能体仅凭弱点类型在完整仓库中定位漏洞
- arXiv
- 2609.15939
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 风险危险能力
摘要论文提出仓库级漏洞定位基准 VLoc Bench,指出当前模型定位表现较低且易在已修复代码上产生误报。
摘要潜在链路本身即可改变冻结智能体系统的安全,奖励既能攻击也能修复。
学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。
- 攻击arXiv 2609.15383
微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
- arXiv
- 2609.15383
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 攻击者
- 黑盒
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
- 其他arXiv 2609.26457
Weco AI 提出 AIDE2:AI 研究智能体递归自我改进 8 天获七次提升
提出双层自改进系统 AIDE2,让外层智能体重写内层 Harness 代码
- arXiv
- 2609.26457
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 风险危险能力
摘要提出双层递归自改进系统 AIDE2,在固定预算下演化 Harness 代码,多项留出基准超越人类基线并降低奖励黑客。
- 评测与基准arXiv 2606.14295
AgentCyberRange:复旦团队发布真实网络靶场自主攻击能力基准
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力
- arXiv
- 2606.14295
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 风险危险能力
摘要构建开放多靶场评测基础设施 AGENTCYBERRANGE,测定前沿 AI 网络攻击能力并揭示其端到端规划短板。
已经到底了