评测与基准arXiv 2610.10619
TestJack 审计编码基准
提出 TESTJACK,动态审计编码基准通过判定是否满足任务要求
- arXiv
- 2610.10619
- 发表
- 层
- 应用层
- 被测模型
- Claude Opus 4.6、Claude Opus 4.7、Claude Opus 4.8 等 7 个
- 风险奖励作弊
提出 TESTJACK,动态审计编码基准通过判定是否满足任务要求
提出 Trust Layer 后置审查框架,核验智能体基准记录分数是否可信
摘要论文提出了后置验证智能体记录分数的四维信任层,揭示了基准高分背后普遍存在作弊、虚报与不稳定现象。
构建编码 RL 奖励作弊测试台 CATCH 并检验 CoT 监控失效
CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。
审计 Agent 基准通过轨迹,区分无根据通过与奖励黑客并封堵复测
Scale AI 的这篇工作把 agentic benchmark 的有效性写成持续维护问题:验证器给满分,并不等于智能体展示了任务所要的能力。
发布 SWE-Bench Pro Verified,隔离答案通道并修订任务以抑制奖励破解
提出 HVTB,在终端编程任务植入蜜罐以测量奖励作弊
HVTB 用来在真实终端与编程任务上测量 reward hacking:智能体读取被植入的参考解答或验收测试,从而偏离任务意图。作者认为这一失败模式会随智能体更自主而更重要,且事后人工或 LLM judge 可能失效。
用 SPR 评测 AI 科学家系统的方法学缺陷
作者诊断两个开源系统的全自动科研流程,看方法学缺陷会不会留在终稿看不见的决策里。