事件观察中
Alice Labs发布Cyber RL Benchmark v1.0
先了解这件事
AI 综述
Alice Labs 发布 Cyber RL Benchmark v1.0,在 12 项真实软件漏洞任务上评测 10 款前沿模型,覆盖恶意软件分析、漏洞检测、漏洞修补与黑盒渗透测试四类,每任务每模型跑 3 次并按 0-1 分部分给分,被护栏拦截计 0 分。Qwen 3.8 Max 以 0.72 均分、解出 7 项任务居首,Mistral Medium 3.5 以 0.36 垫底。漏洞修补类最高有 6 款模型并列 100%。
AI 根据报道生成 · 13 小时前更新
后续时间线
10月7日
- Alice LabsCyber RL Benchmark v1.0 发布:评测 10 款前沿模型的网络安全能力
Alice Labs 发布 Cyber RL Benchmark v1.0,在 12 项真实软件漏洞任务上评测 10 款前沿模型,Qwen 3.8 Max 以 0.72 均分、解出 7 项任务居首,Mistral Medium 3.5 以 0.36 垫底。基准覆盖恶意软件分析、漏洞检测、漏洞修补与黑盒渗透测试四类,每任务每模型跑 3 次并按 0-1 分部分给分,被护栏拦截计 0 分。漏洞修补类最高有 6 款模型并列 100%,黑盒渗透测试最难,最高仅 42%;Opus 5.5 的护栏在 API 层拒绝了全部渗透测试任务。
相关讨论
关注度走势
每天新增来源
- 10月7日 新增 1 个来源(1 家媒体、0 个账号)
- 10月8日 新增 0 个来源(0 家媒体、0 个账号)