Artificial Analysis 发布 Cyber Index,联合三家机构评测 Agent 网络安全防御能力
Announcing the Artificial Analysis Cyber Index Alliance: toward better benchmarking of agentic cyber defense
AI 导读
Artificial Analysis 宣布成立 Cyber Index Alliance,并推出 Artificial Analysis Cyber Index,用于评测 AI 智能体在防御性网络安全任务上的能力。首发版本整合三项评测:Collinear AI 的 CWE-Bench-AA 在 120 个覆盖 OWASP Top 10(2025)全部十类的留出任务上审计并修补真实开源仓库漏洞;Vercel 的 DeepsecBench-AA 在开源应用代码中查找漏洞,对照专家核验的黄金集评分;Berkeley RDI 的 CyberGym-E2E-AA 从 920 条 CyberGym-E2E 数据集中抽取 131 个任务,发现、复现并修补 C/C++ 项目的内存安全漏洞。三项评测均运行在其开源 Agent 框架 Stirrup 上,并单独统计模型或厂商以安全为由拒绝任务的情况。