评测与基准arXiv 2609.08149
研究者发布 SWE-Bench Pro Verified,修正奖励作弊与任务质量问题
构建 SWE-Bench Pro Verified,抑制编码智能体的奖励破解和任务缺陷
- arXiv
- 2609.08149
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- GPT-5.6-Sol、Kimi-K3、GLM-5.3 等 7 个
- 风险奖励作弊
构建 SWE-Bench Pro Verified,抑制编码智能体的奖励破解和任务缺陷
提出过程核验框架,审计 Agent 基准的无根据通过与奖励黑客
Scale AI 的这篇工作把 agentic benchmark 的有效性写成持续维护问题:验证器给满分,并不等于智能体展示了任务所要的能力。
提出 CATCH 测试台,复现编码 RL 的奖励作弊
CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。