评测与基准arXiv 2609.15939
VLoc Bench 发布:评测 Agent 在完整仓库中的漏洞定位能力
提出 VLoc Bench,评测智能体仅凭弱点类型在完整仓库中定位漏洞
- arXiv
- 2609.15939
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Llama-3.3-70B、GPT-5.5 (xhigh)、GPT-5.5 (default) 等 15 个
- 风险危险能力
摘要论文提出仓库级漏洞定位基准 VLoc Bench,指出当前模型定位表现较低且易在已修复代码上产生误报。