CheckerBench:长程 Agent 能否合成静态分析检查器
CheckerBench: Can Long-Horizon Agents Synthesize Static-Analysis Checkers?
AI 导读
研究者提出 CheckerBench,一个可执行基准,用于评估编码 Agent 能否从缺陷规范出发、检查代码仓库、实现分析器逻辑并反复编译调试,最终完成静态分析检查器的开发。该基准包含 300 个任务,源自 167 个仓库中的 297 个 CVE,覆盖 85 种 CWE 和五个语言生态,每个任务提供漏洞版与修复版代码、固定分析环境和检查器脚手架。配套的 CheckerLab 评测框架会独立重建提交的检查器,并测量漏洞与修复版本的诊断对比、补丁定位、误报和工具使用情况。在 21 种模型与 harness 组合、每种配置三次独立重复下,平均 Pass@1 为 32.30%,最佳配置达到 45.33%。