评测与基准arXiv 2609.34262
论文提出基准完整性维护框架,审计 Agent 通过轨迹中的非应得通过
提出过程核验框架,审计 Agent 基准的无根据通过与奖励黑客
- arXiv
- 2609.34262
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Opus 4.7、Opus 4.8、Opus 5 等 11 个
摘要审计通过轨迹、分开奖励黑客与验证器弱点,并用重放加现场重测验收修复。
Scale AI 的这篇工作把 agentic benchmark 的有效性写成持续维护问题:验证器给满分,并不等于智能体展示了任务所要的能力。