跳到正文
事件观察中

Alice Labs发布Cyber RL Benchmark v1.0

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Alice Labs 发布 Cyber RL Benchmark v1.0,在 12 项真实软件漏洞任务上评测 10 款前沿模型,覆盖恶意软件分析、漏洞检测、漏洞修补与黑盒渗透测试四类,每任务每模型跑 3 次并按 0-1 分部分给分,被护栏拦截计 0 分。Qwen 3.8 Max 以 0.72 均分、解出 7 项任务居首,Mistral Medium 3.5 以 0.36 垫底。漏洞修补类最高有 6 款模型并列 100%。

AI 根据报道生成 · 13 小时前更新

后续时间线

10月7日
  1. Alice Labs
    Cyber RL Benchmark v1.0 发布:评测 10 款前沿模型的网络安全能力

    Alice Labs 发布 Cyber RL Benchmark v1.0,在 12 项真实软件漏洞任务上评测 10 款前沿模型,Qwen 3.8 Max 以 0.72 均分、解出 7 项任务居首,Mistral Medium 3.5 以 0.36 垫底。基准覆盖恶意软件分析、漏洞检测、漏洞修补与黑盒渗透测试四类,每任务每模型跑 3 次并按 0-1 分部分给分,被护栏拦截计 0 分。漏洞修补类最高有 6 款模型并列 100%,黑盒渗透测试最难,最高仅 42%;Opus 5.5 的护栏在 API 层拒绝了全部渗透测试任务。

相关讨论

本站还没有收集到这件事的讨论链接。

关注度走势

每天新增来源

2 天共 1 个·最多 1(10月7日)·今天 0

  • 10月7日 新增 1 个来源(1 家媒体、0 个账号)
  • 10月8日 新增 0 个来源(0 家媒体、0 个账号)

每小时关注度

当前关注度 32·可比范围峰值 35(10月7日 17:00)·近 24 小时可比范围变化 –

01020304010月7日17:0010月7日21:0010月8日02:0010月8日06:00