Cyber RL Benchmark v1.0 发布:评测 10 款前沿模型的网络安全能力
Cyber RL Benchmark v1.0: Measuring Frontier Cybersecurity Capability
AI 导读
Alice Labs 发布 Cyber RL Benchmark v1.0,在 12 项真实软件漏洞任务上评测 10 款前沿模型,Qwen 3.8 Max 以 0.72 均分、解出 7 项任务居首,Mistral Medium 3.5 以 0.36 垫底。基准覆盖恶意软件分析、漏洞检测、漏洞修补与黑盒渗透测试四类,每任务每模型跑 3 次并按 0-1 分部分给分,被护栏拦截计 0 分。漏洞修补类最高有 6 款模型并列 100%,黑盒渗透测试最难,最高仅 42%;Opus 5.5 的护栏在 API 层拒绝了全部渗透测试任务。