评测与基准arXiv 2609.23980
斯坦福与 UC Berkeley 发布 MobileCybench:用可执行探针评测 Agent 漏洞发现
提出 MobileCybench,用可执行探针评测 Agent 的漏洞发现能力
- arXiv
- 2609.23980
- 发表
- 层
- 应用层
- 被测模型
- OpenCode/GPT-5.5、OpenCode/GPT-5.6-Sol、OpenCode/GLM-5.2 等 5 个
- 风险危险能力
提出 MobileCybench,用可执行探针评测 Agent 的漏洞发现能力
提出 READY 框架,认证企业 Agent 在人工监督下能否达到规定可靠性
READY 把“智能体能否自主完成工作”改写成“哪个人机监督策略能在留出证据上达到规定可靠性,以及要付多少运营成本”。。
提出 AgentRewind,支持长程 Agent 回退对齐检查点并继续执行
提出 SRE-Bench 评测智能体的真实规模二进制逆向能力
作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。
用 CryptanalysisBench 评测大模型的端到端密码分析能力
摘要提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。
构建真实网络靶场基准,评测 AI 的端到端自主攻击能力
摘要构建开放多靶场评测基础设施 AGENTCYBERRANGE,测定前沿 AI 网络攻击能力并揭示其端到端规划短板。