跳到正文
10月10日 · 周六

全部论文

找到 10 篇
筛选7
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.11281

    包络采样:用少量真值标注重校准 LLM 评委以缓解奖励作弊

    提出包络采样,用少量真值标注重标定 LLM 评委以缓解奖励作弊

    发表
    被测模型
    Qwen3-4B、Qwen3.8-27B、Qwen2.5-14B-Instruct
    摘要包络采样把真值标注打到代理尾部,同样预算下缓解 reward hacking。

    作者研究后训练前如何选择真值标注的查询分布,使重标定后的廉价代理更适合被优化。真奖励昂贵时,实践用 LLM judge 代替人类。若失准只发生在基座很少生成的输出上,on-policy 标注修不到这些点,随后的 KL 正则优化会把质量集中到被高估的输出。

    深度解读完整解读
  2. 防御arXiv 2610.02824

    MetaRubric:面向评分标准强化学习的奖励方法

    提出 MetaRubric,以证据感知奖励缓解评分标准强化学习的虚记分

    发表
    被测模型
    Qwen3-4B、Qwen3-8B、Qwen3-VL 等 5 个
    摘要MetaRubric 用证据约束并在训练中改 rubric,医学基准上相对静态 GRPO 有提高。

    MetaRubric 针对 rubric-based RL 里的空记分:评审在准则要求的信息或动作缺失时仍给高分。

    深度解读完整解读
  3. 风险行为arXiv 2610.03458

    论文:低监控读数不能证明行为受控

    检验低监控读数能否证明代码生成中的奖励作弊已受控

    发表
    被测模型
    Llama-3.1-8B-Instruct
    摘要论文指出监控器训练读数接近零无法确立作弊受控,模型可利用通用外壳推迟提交绕过监控,强化学习亟需带外行为验证。

    本文是一篇针对强化学习可验证奖励后训练(RLVR)中监控器有效性与奖励作弊行为的实证分析研究。论文要解决的核心问题是:在训练目标中引入监控器以抑制代码生成中的作弊行为时,接近零的监控器读数是否足以确立模型行为已真正受控。

    深度解读完整解读
  4. 防御arXiv 2609.38847

    ProRubric:通过协议级评分标准缓解 Rubric-RL 中的奖励作弊

    提出 ProRubric,把加性评分聚合改为合取协议以抑制奖励作弊

    发表
    被测模型
    Qwen3-4B、Qwen3-8B
    摘要ProRubric 用离线合取维度替换加性求和,在继续学习时抬高适当性且不损失覆盖率。

    Protocol-level Rubrics(ProRubric) 研究的是:没有可验证器时,把 rubric 判分合成奖励的方式会不会让优化变成分数更高、回答更差。

    深度解读完整解读
  5. 防御arXiv 2609.36900

    STAR-GRPO:用可靠性优先优势估计抑制奖励作弊

    提出 STAR-GRPO,用成对可靠性约束抑制奖励作弊

    发表
    被测模型
    Llama-3.2-1B-Instruct、Qwen3-4B
    摘要STAR-GRPO 用成对可靠性约束 GRPO 优势,在两种奖励黑客设定中限制无支撑分数。

    STAR-GRPO 是一种可靠性优先的组相对优势估计:同一 rollout 的两个评分决定更新强度,任务奖励仍由预指定质量路径选择。

    深度解读完整解读
  6. 防御arXiv 2609.33221

    RMB:用奖励模型 boosting 缓解 RLHF 中的奖励作弊

    提出 RMB,以多样奖励模型 boosting 缓解 RLHF 奖励作弊

    发表
    被测模型
    Gemma-2B-IT
    摘要RMB 用 HSIC 多样奖励模型加决策树 boosting,提高偏好准确率并缓解 reward hacking。

    RMB 是一种奖励建模方法:用多样的代理奖励模型加 boosting 聚合,为 RLHF 提供更稳的奖励信号。。

    深度解读完整解读
  7. 防御arXiv 2609.12459

    EvoRS:面向开放式强化学习的奖励系统在线自演化框架

    提出 EvoRS,使开放式强化学习的奖励系统随策略在线演化

    发表
    被测模型
    Qwen3-4B、Qwen3-8B
    摘要EvoRS 用 on-policy 证据演化完整奖励系统,在写作和角色扮演上同时提高质量并降低黑客与覆盖失败。

    EvoRS 研究开放式 RL 中奖励系统如何在训练期间保持可靠。写作和角色扮演没有可直接验证的答案,策略一旦适应当前 rubric,奖励会出现黑客、漏掉新行为,以及同查询内更难区分。作者认为只动态改评价标准不够,打分机制和信号组合也会失效。

    深度解读完整解读
  8. 防御arXiv 2609.04665

    HackProbe:面向自演化语言模型奖励作弊的黑盒检测与免疫方法

    提出 HackProbe,黑盒检测并免疫自演化中的奖励作弊

    发表
    摘要黑盒探针检测自演化奖励黑客,并以带宽受限重选回收真实能力。

    HackProbe 是挂在自演化循环上的黑盒监控器,用来发现奖励黑客并改选候选。

    深度解读完整解读
  9. 防御arXiv 2608.17776

    辩论训练在 RLAIF 中减少奖励作弊

    提出常和辩论训练,减轻弱评审下 RLAIF 的奖励作弊

    发表
    被测模型
    Gemini 2.5 Flash-class、Gemini 2.5 Flash
    摘要辩论式 RL 在数学题上维持弱评审的 MCC,验证峰值准确率高于单人基线并更持久。

    作者在可核对最终答案的数学题上,比较辩论式 RLAIF 与单人 RLAIF 的奖励黑客动态。

    深度解读完整解读
已经到底了