评测与基准arXiv 2609.23980
斯坦福与 UC Berkeley 发布 MobileCybench:用可执行探针评测 Agent 漏洞发现
提出 MobileCybench,用可执行探针评测 Agent 的漏洞发现能力
- arXiv
- 2609.23980
- 发表
- 层
- 应用层
- 被测模型
- OpenCode/GPT-5.5、OpenCode/GPT-5.6-Sol、OpenCode/GLM-5.2 等 5 个
- 风险危险能力
提出 MobileCybench,用可执行探针评测 Agent 的漏洞发现能力
提出 VLoc Bench,评测智能体在完整仓库中定位漏洞文件并抑制修复后误报
摘要论文提出仓库级漏洞定位基准 VLoc Bench,指出当前模型定位表现较低且易在已修复代码上产生误报。
Reality Is the Final Verifier 用 two-gap framework 解释智能体软件工程的主要失败,并主张用外层保证环持续收窄缺口,而不是试图在部署前证明缺口已关闭。
提出基准 PATCHBENCH,评测编程 Agent 的漏洞修补是否真正修复根因
摘要论文揭示漏洞修复评测的记忆与表面防护问题,提出离栈变异基准与双重验证,测得智能体实际解决率仅约五成。
提出 SRE-Bench 评测智能体的真实规模二进制逆向能力
作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。
用 CryptanalysisBench 评测大模型的端到端密码分析能力
摘要提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。
提出技能名称抢注攻击,利用 Agent 虚构技能名实施供应链劫持
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
构建真实网络靶场基准,评测 AI 的端到端自主攻击能力
摘要构建开放多靶场评测基础设施 AGENTCYBERRANGE,测定前沿 AI 网络攻击能力并揭示其端到端规划短板。