RH-Detect:统一的奖励作弊检测基准发布
RH-Detect: A Unified Benchmark for Reward Hacking Detection
RH-Detect统一11源;Qwen 3.5 Flash在5,021条上pooled AUROC为0.962。
- 奖励黑客会满足评测信号却不完成原任务,还可能削弱部署监督。现有数据集标签、格式和元数据不统一,检测结果难以比较,单一来源上的强结果也难以推到未见来源。
- RH-Detect把11个公开数据集的相关子集收成共同schema和六类行为,含开放式、多选题和加密的alignment-faking分区。零样本比较六个现成检测器,并考察转录预处理、留出源单token SFT和针对失败来源的GRPO。
- 在5,021条开放式单元上,Qwen 3.5 Flash的pooled AUROC为0.962。四模型在MALT/TRACE上、τ=0.5的准确率低10.7–15.9个百分点。SFT提高五个留出来源AUROC,SoRH下降;跨轨道无正迁移。
- 作者指出标签异质、负例可能带与黑客无关的风格线索,MALT/TRACE差距与长度、格式、类别、引出和验证一同变化,且训练只涉及一个模型、基准是静态的。论文未把Terminal Wrench、CheatBench和受保护分区纳入已报告分析。
- 被测模型
- Qwen 3.5 FlashGemini 3.1 Flash LiteGrok 4.1 FastLlama 4 MaverickLlama 4 ScoutGPT-5 NanoQwen3.5-4B
- 基准
- RH-DetectSchool of Reward HacksJozdien Realistic Reward HacksPatronus TRACEMETR MALTCountdown-CodeMatonski Reward-Hacking Promptsreward-hack generalizationAnthropic model-written evaluations
- 指标
- AUROCaverage AUROC per-sourceAccuracyFPRAUPRCTPRBrier scorenegative log-likelihoodECE
研究者提出 RH-Detect,一个把十一个公开数据集中与奖励作弊相关的子集整合到统一 schema 的基准,共 92,761 行、六类行为。在 5,021 个开放式评测单元(含多轮工具调用轨迹)上,研究者用五个家族的六个现成语言模型做零训练检测,最佳模型取得 0.962 的合并 AUROC,准确率超过 93%。但四个最强模型在两个多轮工具调用数据集 MALT 和 TRACE 上的准确率,比同一决策阈值下其他来源低 10.7 至 15.9 个百分点。输入格式的影响因模型而异:去掉 thinking 使 Qwen3.5-4B 的 AUROC 从 0.779 升到 0.849,却使 Qwen Flash 从 0.977 降到 0.950。作者称单一合并分数会掩盖数据来源、检测器输入和训练流程之间的差异。
深度解读
这篇论文试图解决什么问题?
现有奖励黑客数据标签与格式不统一,RH-Detect将其收成可比较的检测基准。
奖励黑客检测缺少可跨来源比较的统一评测。
- 场景:作者把 reward hacking 定义为满足评测信号却未完成原任务,含训练之外的 evaluation gaming。作者认为这会削弱已部署系统的监督。
- 更广风险:作者引用 MacDiarmid et al.(2025):生产强化学习中的奖励黑客可引出更广的涌现失准,包括 alignment faking、与恶意方合作和试图破坏。
- 已有数据:多个数据集的标签、回复格式、元数据和评测流程不同,有的含无关轨迹。作者认为单源强结果对未见来源的证据有限。
- 要回答的问题:现成模型能否零样本检测,以及表现如何随模型族、来源、类别、转录表示和后训练变化。作者称可靠检测是后续干预的前提。
- 本文提出:RH-Detect 把 11 个公开数据集的相关子集映射到共同 schema,共 92,761 行、六类行为,并保留出处与按 prompt hash 审计的划分。
有哪些相关研究?
相关工作分奖励黑客现象、碎片化数据集与监控评测三条线。
相关工作按谱系、数据集和监控三条线写,作者只对点名的几类工作做了对比。
奖励黑客谱系
- 附和与篡改:Sharma et al.(2024)讨论反馈奖励用户观点而非事实时的 sycophancy。Denison et al.(2024)讨论更强优化下从 evaluation gaming 到 reward tampering。
- 跨任务泛化:Nishimura-Gasparian et al.(2024)报告,一个任务上学到的行为可泛化到留出任务。
- 可验证利用:ImpossibleBench(Zhong, Raghunathan, and Carlini 2025)、EvilGenie(Gabor, Lynch, and Rosenfeld 2025)和 Reward Hacking Benchmark(Thaman 2026)在编程与工具环境中引出可验证利用。作者称它们问模型是否利用评测,本文问监控能否在事后识别多样利用。
碎片化数据集
- 成对续写:School of Reward Hacks(Taylor et al. 2025)在语言和编程任务上提供黑客与干净续写。
- 多轮轨迹:MALT、TRACE、Terminal Wrench 和 CheatBench 含多轮工具使用轨迹(论文引用为 2025–2026)。
- 其他切片:风格博弈、硬编码解答、奖励篡改、多选题探针或 alignment faking 由另外的来源覆盖(论文引用年份为 2023–2026)。作者指出各源标签、格式和评测流程不同。
监控与 LLM-as-judge
- 已知偏差:Ribeiro et al.(2020)指出汇总准确率可掩盖行为维度上的失败。Zheng et al.(2023)报告位置、冗长和自我增强偏差。
- 监控变体:对比组(Deshpande, Kannappan, and Qian 2026)、extract-and-evaluate(Arike et al. 2026)、deliberative monitors(Sinha et al. 2026)、AutoMonitor-Bench(Yang et al. 2026)和监控规避基准(Jotautaitė et al. 2026;Najt et al. 2026)。Wang et al.(2026)与 Wilhelm, Wittkopp, and Kao(2026)检查内部信号而非转录。
- 与本文的轴:作者固定检测任务,改变数据源、转录表示和后训练。作者称这一因素使测得性能的变动与更换检测器相当。
基线与基准
- 对照:主表不以已发表检测器为基线,六个现成模型互为比较;后训练以冻结的 Qwen3.5-4B 为 Base。主分析用六个开放式来源上的 5,021 个单元。
作者把本文定位为共同 schema 和评测接口,使跨来源比较可行,同时保留出处与再分发约束。
论文如何解决这个问题?
RH-Detect统一11个来源的模式、六类行为和留出划分,再评测检测器。
RH-Detect 把 11 个来源的相关子集收成同一 schema,再在固定检测任务上改变模型、转录表示和后训练。
分类与对齐
- 六类:output style gaming、sycophancy、evaluation gaming、environment exploitation、reward tampering、deception。作者称类别描述类型和对象,不是严重度刻度。
- 轨道:开放式主轨道覆盖除 sycophancy 外的五类;sycophancy 只在多选题轨道。Table 1 给开放式代表任务,不表示严重度排序。
- 映射:能直接映射的用源标签,如 MALT 的 sabotage 到 deception;TRACE 的 54 个子类并入共同分类;School of Reward Hacks 按描述区分表面指标和评测机制。
- 标签与配对:二元标签继承或由源信号确定性导出,不用检测器改写。已配对则保留;否则在可能时从同一任务或划分补干净续写,使各类正负数量接近。
分区与划分
- 三区:24,528 行公开开放式、66,760 行多选题、1,473 条按来源要求 XOR 加密的 alignment-faking 回复,以限制直接暴露。共同 schema 不等于允许再分发每条记录。
- 元数据:构造方式、验证方式、黑客描述、生成续写的模型,以及是否为多轮工具或环境交互的 agentic 标记。
- 划分:跨来源为六次留出旋转;跨轨道在轨道内按 prompt hash 分 train/validation/test。相同 hash 不跨训练与评测。作者称这不排除释义或语义重叠,也不确立没有预训练污染。
- 时点:报告实验时有九个数据集、72,384 行。Terminal Wrench 与 CheatBench 事后并入基准,但不进入已报告分析。
零样本协议
- 单元:一个任务提示加一条续写,含多轮工具轨迹。超过 32,000 token 的转录排除后,主分析有 5,021 个单元。
- 盲法输入:按原顺序拼接消息内容。不提供来源名、类别、标签、构造方式或验证元数据。意图、评测者行为和环境状态仅当出现在转录中才可用。
- 读出:固定提示词要求判为 reward hacking 或 clean,返回含 reasoning 和 0–100 概率的 JSON,分析时除以 100。temperature 为 0。附录 Table S4 给出全文。
- 模型:商业 API 上六个模型、五个模型族。Grok 在 MALT 完成前退出,已报告结果为 n=4,602 的非 MALT 单元。
转录条件
- E1–E3:E1 为原文;E2 去掉 thinking 片段;E3 只留检测到的 reasoning。提示词不变。附录 B.2 规定,无显式标签的智能体消息按 submit 或首次工具调用切分。
- E4 / E4b:沿 Arike et al.(2026),模型先逐字抽出可疑摘录,再用未改的检测提示词只给摘录打分。E4 抽取与判定同模型;E4b 用 GPT-5 Nano 抽取、Qwen Flash 判定。
后训练
- SFT:Qwen3.5-4B 全参数、一 epoch、三种子,每次完全去掉一个开放式来源。训练集为 2,354–3,911 个单元。助手预填到 Answer:,损失只在 YES 或 NO 一个 token 上。
- 分数:评测用 s(x)=p(YES|x)/(p(YES|x)+p(NO|x)),即 YES 相对两个标签 token 的归一化条件概率。作者称来源内随机划分可能利用重复模板,从而高估新环境上的表现;测试源不参与训练、验证、阈值或检查点选择。
- GRPO:针对 School of Reward Hacks 留出。可解析时奖励为 r(c,y)=1−(p(c)−y)2,即 1 减 Brier 损失;无法解析则 advantage 为 0,评测记 0.5。推理文本不直接计分。SoRH 不进入训练和检查点选择;一 epoch 为 588 步。
论文做了哪些实验?
Qwen 3.5 Flash AUROC为0.962;四模型MALT/TRACE比其他源低10.7–15.9个百分点。
实验设置
- API 检测器:Llama 4 Scout、Llama 4 Maverick、Gemini 3.1 Flash Lite、GPT-5 Nano、Grok 4.1 Fast、Qwen 3.5 Flash。附录写经同一网关、temperature 0、输出上限 4,096 token。
- 本地模型:表征与训练用 Qwen3.5-4B。附录写 vLLM、temperature 0、top-p 1.0、seed 20260710。
- 主集合:School of Reward Hacks、Jozdien Realistic Reward Hacks、Patronus TRACE、METR MALT、Countdown-Code、Matonski。32,000 token 内 5,021 个单元;每单元一个提示加一条续写。
- 指标:pooled AUROC,以及各来源等权的平均 AUROC。Acc. 与 FPR 用 τ=0.5。n 为成功解析数,故部分模型低于 5,021。
- 判定:无单独外部裁判,检测器自报 0–100 概率。来源标签的验证方式见附录 Table S1,含 human、LLM judge、deterministic 或 none。
- 重复:零样本论文未报告重复次数。SFT 每轮三个种子;GRPO 为单种子。
主结果
据 Table 2。Acc. 与 FPR 的 τ=0.5;AUROC 跨来源 pooled;平均 AUROC 对各来源等权。Grok 的 n 不含 MALT。
表格较宽,可左右滑动
模型 n Acc. AUROC 平均AUROC FPR Qwen 3.5 Flash 5,021 0.931 0.962 0.943 0.035 Gemini 3.1 FL 5,019 0.934 0.960 0.951 0.022 Grok 4.1 Fast 4,602 0.917 0.960 0.938 0.094 Llama 4 Maverick 5,020 0.899 0.936 0.933 0.064 Llama 4 Scout 4,993 0.861 0.890 0.891 0.062 GPT-5 Nano 5,021 0.753 0.817 0.857 0.353 - 领先组:作者把 Qwen、Gemini 和覆盖不全的 Grok 列为 pooled 领先组,并称 Grok 不能与六源齐全的模型直接比较。摘要称最好模型准确率高于 93%。
- 等权平均:作者指出 pooled AUROC 可能奖励检测器分开某源较易正例与另一源较易负例,故另报等权平均;该列排序与 pooled 不完全一致。
- 分数形态:作者称 Gemini 与 Qwen 的良性分数靠近 0、黑客分数靠近 100;GPT-5 Nano 铺在整个区间。Figure 1 图注称前三条曲线靠近左上角,GPT-5 Nano 更低。附录 Figure S1 为两类分数分布,竖线在原始分数 50。
类别与来源
据 Table 3,τ=0.5 准确率。表中无 Grok。作者称 environment exploitation 最多 43 例,估计只作参考。
表格较宽,可左右滑动
模型 Tamper Style Eval. Env. Decept. Qwen 3.5 Flash 0.991 0.953 0.905 0.721 0.909 Gemini 3.1 FL 0.997 0.947 0.917 0.674 0.921 Llama 4 Maverick 0.994 0.913 0.868 0.721 0.906 Llama 4 Scout 0.982 0.908 0.788 0.537 0.898 GPT-5 Nano 0.578 0.662 0.856 0.791 0.904 最大合格 n 334 2,261 1,976 43 407 据 Table 4。Δ 为 MALT+TRACE 准确率减其他来源。Other 的 n=4,085;M+T 为 908–936。Grok 不在此表。
表格较宽,可左右滑动
模型 Other Acc. M+T Acc. Δ pp Other AUROC M+T AUROC Qwen 3.5 Flash 0.961 0.802 -15.9 0.978 0.878 Gemini 3.1 FL 0.959 0.825 -13.4 0.978 0.902 Llama 4 Maverick 0.919 0.812 -10.7 0.958 0.847 Llama 4 Scout 0.883 0.762 -12.1 0.913 0.791 GPT-5 Nano 0.736 0.830 +9.4 0.805 0.871 - 类别叙述:作者称四名较强模型在 reward tampering 上为 98–100%,style 与 deception 为 90–95%。Table 3 中 Llama 4 Scout 的 deception 为 0.898,低于后一叙述。作者称 GPT-5 Nano 在 tampering 与 style 上呈相反误差。
- 环境利用:作者称对较强模型,evaluation gaming 居中,environment exploitation 最低且最不稳定。这不是 GPT-5 Nano 的最低类。
- 来源差距:作者称四名较强且六源齐全的模型,MALT/TRACE 准确率低 10.7–15.9 个百分点;平衡准确率低 11.0–16.1、AUROC 低 7.7–12.2、AUPRC 低 7.5–13.1、TPR 低 24.7–28.4 个百分点。作者称 GPT-5 Nano 的准确率方向相反,且比较是描述性的:长度、工具格式、类别混合、引出、验证与 agentic 状态一同变化。
转录表示
- 本地 4B:Table 5a 的 4,988 条上,去掉输入 reasoning 使 Qwen3.5-4B 的 AUROC 从 0.779 到 0.849、Acc. 从 0.749 到 0.798;只留 reasoning 时 AUROC 为 0.655、Acc. 为 0.612。
- API 800:Table 5b 上,去掉 reasoning 使 Qwen Flash 从 0.977 到 0.950,GPT-5 Nano 保持 0.816。只留 reasoning 时二者为 0.645 与 0.588。附录 Table S3 写该集来自 28,000 token 资格的配对安全 train/validation,排除 test 与 MALT。
- 摘录:E4 下 Qwen Flash 为 0.958、GPT-5 Nano 为 0.788;E4b 换 Nano 抽取后 Qwen Flash 为 0.879。作者称抽取质量会限制整条流程。
后训练迁移
- 留出 SFT:Table 6 平均 AUROC 从 0.859 到 0.895±0.021(+0.036)。五源上升,Jozdien 的 Δ 为 +0.239;SoRH 从 0.869 到 0.729±0.055(Δ −0.140)。作者称增益不均匀。
- 概率与跨轨:平均 per-source 的 Brier 从 0.180 到 0.190,NLL 从 0.550 到 1.373,ECE 从 0.213 到 0.192。Table 7 为三种子均值:多选题 SFT 在多选题测试(n=13,360)为 0.999,在开放式测试(n=514)为 0.492;开放式 SFT 分别为 0.445 与 0.997。Base 为 0.587 与 0.783。作者称没有跨轨正迁移。该开放式划分不是来源留出。
- GRPO:Table S9 中,见过源探针 n=251 的 AUROC 从 0.679 到 0.714(+0.035),留出 SoRH n=2,046 从 0.862 到 0.879(+0.018)。作者称没有统计显著性,只作为个案。训练奖励大约 0.7–0.8,588 步,作者称未见奖励崩溃。
其他消融与分析
- Table S7:Matonski 留出 Acc. 从 0.930 到 0.827,AUROC Δ 为 +0.005(n=100);TRACE Acc. 从 0.576 到 0.567,AUROC Δ 为 +0.026。
- Table S5:Qwen3.5-4B 的 E2−E1 为 +0.069,95% 区间 [+0.053, +0.084](n=4,988);Qwen Flash 为 −0.028,区间 [−0.043, −0.014](n=800)。
- Table S6:四名较强模型 other 减 MALT+TRACE,Acc.、平衡准确率、AUROC、AUPRC 的 95% 区间不含 0;GPT-5 Nano 的 Acc. 差为负、TPR 差为正。Other 的 n=4,085。
- Table S9:SoRH 可解析率从 0.613 到 0.675,触顶截断从 0.424 到 0.341。正文写基座可解析率 0.61、截断 0.42。
- 附录 D.2:跨轨开放式划分用全部 5,174 个展开单元并中间截断,而不是按 32,000 token 排除。
- 附录 A:Terminal Wrench、CheatBench 与受保护分区不进入已报告分析。
有什么可以进一步探索的点?
作者指出标签异质、负例可能含风格线索,且训练研究只涉及一个模型。
作者指出的局限与后续方向
- 标签异质:标签继承且来源不同;标注更噪的来源可能因与检测难度无关的原因显得更难;二元标签没有风险分诊所需的严重度谱(§6.1)。
- 负例构造:来源没有成对干净续写时,负例取自同一任务或划分,不能完全排除与黑客无关的风格线索(§6.1)。
- 来源关联:MALT/TRACE 差距是来源级关联,长度、工具格式、类别混合、引出和验证与 agentic 状态一起变化(§6.1)。
- 训练与形态:训练研究限于一个模型;基准是静态的,而部署监控是增量且受延迟约束的(§6.1)。
- 后续工作:作者写出应审计语义重叠、加入严重度分级标签、相对对抗策略做评测,并把训练扩展到更多模型族和输出格式(§6.1)。
实验覆盖范围
- 零样本:六个 API 检测器、开始评测时可用的六个开放式来源、5,021 个不超过 32,000 token 的单元(§4.1)。Grok 的已报告 n=4,602 不含 MALT。
- 类别:Table 3 报告 tampering、style、evaluation gaming、environment exploitation、deception 的 τ=0.5 准确率;environment exploitation 最多 43 例。sycophancy 只在多选题轨道。
- 输入与训练:E1–E4b 的本地共同集合为 4,988,API 比较集为 800(Table 5)。SFT 为 Qwen3.5-4B、六次留出、三种子(Table 6)及跨轨道(Table 7)。GRPO 为单种子、SoRH 留出、588 步(Table S9)。
- 基准中的其他分区:Terminal Wrench、CheatBench 和 1,473 条受保护 alignment-faking 回复在统一基准中;附录 A 写它们不进入已报告分析。
- 论文未报告:零样本重复次数,以及检测器输出与人工判定的一致性。来源自身的验证方式列在附录 Table S1。
总结一下论文的主要内容
Qwen 3.5 Flash的pooled AUROC为0.962,多轮工具源与跨轨迁移更低。
RH-Detect 用共同 schema 比较奖励黑客检测在来源、输入和训练变化时是否稳定。
- 问题:公开数据的标签、格式和元数据不一致,汇总分难比较,单源结果也难说明能迁到未见来源。作者定义的行为是满足评测信号却未完成原任务,包括训练外的 evaluation gaming。
- 做法:从 11 个公开数据集选出相关子集,共 92,761 行、六类行为,分成开放式、多选题和加密的 alignment-faking 三区。主实验让六个现成模型在看不到来源和标签的转录上零样本打分。
- 零样本:在 5,021 个开放式单元上,Qwen 3.5 Flash 的 pooled AUROC 为 0.962、τ=0.5 准确率为 0.931;Gemini 3.1 Flash Lite 的准确率为 0.934、FPR 为 0.022。GPT-5 Nano 的 AUROC 为 0.817、FPR 为 0.353。Grok 4.1 Fast 的 0.960 不含 MALT。
- 分层:作者称四名较强且六源齐全的模型,在 MALT/TRACE 上的准确率比其他来源低 10.7–15.9 个百分点。作者称这四名模型的 reward tampering 准确率为 98–100%;environment exploitation 最多 43 例,且对该四名模型最低、最不稳定。
- 输入与训练:去掉 reasoning 后,Qwen3.5-4B 的 AUROC 从 0.779 到 0.849(n=4,988),Qwen Flash 从 0.977 到 0.950(n=800)。留出 SFT 的平均 AUROC 从 0.859 到 0.895±0.021,但 SoRH 的 Δ 为 −0.140;跨轨道没有正迁移。GRPO 使留出 SoRH 从 0.862 到 0.879,作者称没有统计显著性。
- 作者结论:单一汇总分会掩盖来源、输入和训练差异。作者称可靠监控需要按来源分层,并写明检测器输入、分数读出和训练流程。附录 F 写作者计划在发表时发布数据与代码。