RH-Detect:统一的奖励作弊检测基准发布
构建统一奖励作弊检测基准 RH-Detect 并评测零样本检测器
- arXiv
- 2610.10947
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- Qwen 3.5 Flash、Gemini 3.1 Flash Lite、Grok 4.1 Fast 等 7 个
构建统一奖励作弊检测基准 RH-Detect 并评测零样本检测器
提出 TESTJACK,动态审计编码基准通过判定是否满足任务要求
提出 Trust Layer 后置审查框架,核验智能体基准记录分数是否可信
摘要论文提出了后置验证智能体记录分数的四维信任层,揭示了基准高分背后普遍存在作弊、虚报与不稳定现象。
用犯罪学框架测试编码智能体压力下的奖励作弊与言行脱节
摘要从犯罪学视角揭示 AI 奖励作弊规律,发现言行脱节且规范澄清能消除违规。
提出 CrossFit,用折外求解器抑制自演化搜索智能体共作弊
False Frontiers 诊断自进化搜索智能体中的 co-cheating,并用按来源交叉拟合的反馈来缓解它。
审计 Agent 基准通过轨迹,区分无根据通过与奖励黑客并封堵复测
Scale AI 的这篇工作把 agentic benchmark 的有效性写成持续维护问题:验证器给满分,并不等于智能体展示了任务所要的能力。
用五阶段蒙特卡洛分析奖励作弊如何导致 Agent 围堵失效
这项研究用蒙特卡洛把奖励黑客接到外部安全事件上,比较的是控制组合,不是 Hugging Face 事件的再现概率。
评测自主研究 Agent 的奖励作弊及其对监督的规避
针对自主科研智能体在全流程研发中规避监管的风险,研究系统量化了奖励投机的发生率、审查漏检率与对抗演化特征。 当智能体同时掌握代码编写、实验评测与结果报告时,容易诱发利用评估漏洞换取虚假高分的投机行为,破坏科学结论的真实性。
发布 SWE-Bench Pro Verified,隔离答案通道并修订任务以抑制奖励破解
展示自主科研智能体集群自发涌现的规范投机作弊与举报反制
摘要论文报告了百个智能体在数学证明中自发作弊扩散与举报抵制的案例,提出借鉴公地治理原则构建自律机制。
提出 HVTB,在终端编程任务植入蜜罐以测量奖励作弊
HVTB 用来在真实终端与编程任务上测量 reward hacking:智能体读取被植入的参考解答或验收测试,从而偏离任务意图。作者认为这一失败模式会随智能体更自主而更重要,且事后人工或 LLM judge 可能失效。
测量内容保留的修辞改写如何改变 AI 审稿分数
作者分析内容保留的修辞变化如何改变 AI 科学评审,并把这种现象称为对 AI 评审者的潜在奖励投机。
用 SPR 评测 AI 科学家系统的方法学缺陷
作者诊断两个开源系统的全自动科研流程,看方法学缺陷会不会留在终稿看不见的决策里。