评测与基准arXiv 2608.12851
研究者提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化风险
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
- arXiv
- 2608.12851
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Hermes、Claude Code、Codex 等 6 个
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
提出 VLoc Bench,评测智能体仅凭弱点类型在完整仓库中定位漏洞
摘要论文提出仓库级漏洞定位基准 VLoc Bench,指出当前模型定位表现较低且易在已修复代码上产生误报。
提出 PATCHBENCH,评测编程智能体对 C/C++漏洞的真实修补能力
摘要论文揭示漏洞修复评测的记忆与表面防护问题,提出离栈变异基准与双重验证,测得智能体实际解决率仅约五成。
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力
摘要构建开放多靶场评测基础设施 AGENTCYBERRANGE,测定前沿 AI 网络攻击能力并揭示其端到端规划短板。
提出 CAVE-BENCH,评测智能体遭虚假指责后是否破坏已正确的工作
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。