跳到正文
原文
Cisco· Huaibo Zhao·本站收录 · 原文发表 精选关注度39

Cisco 发布 VLoc Bench 与 Safety-VLoc-Bench,评测 Agent 的漏洞定位与攻防不对称

Foundation AI in September: VLoc Bench and Cyber-Capability Safety

AI 导读

Cisco 发布 VLoc Bench,用于评测 Agent 在仓库规模下定位漏洞代码的能力:任务只给 CWE 描述和真实仓库的只读访问权限,不含公告文本、CVE 编号、修复提交或文件提示。该基准覆盖 290 个仓库、六个包生态和 147 个 CWE 类别的 500 个真实漏洞,每个任务包含修复前定位与修复后确认漏洞已消失两个阶段,以区分理解代码、定位漏洞代码和验证修复三种能力。在统一提示词、只读工具和命令预算下评测 27 个语言模型和 4 个静态分析工具,最强系统仅达到 0.229 File F1,38.4% 的任务中没有任何被评测模型找到正确文件;参数量仅 30 亿的 Antares-3B 以 0.223 排名第二。

推荐理由

Cisco 公开了仓库级漏洞定位基准与攻防不对称评测,给出 27 个模型和 4 个静态分析工具的统一对比结果。

阅读原文blogs.cisco.com