跳到正文
10月8日 · 周四

奖励作弊 · 论文

找到 21 篇

另有 39 篇还没有研究类型,暂不在这些分类里。

  1. 风险行为arXiv:2609.33220 ·

    斯坦福与 Anthropic 研究:RL 后训练中模型承认失败的披露行为远不如任务能力稳定

    揭示纯结果强化学习下失败披露跨运行不稳定,并提出失败条件参考锚定

    模型与 API测试Qwen2.5-1.5B、Qwen2.5-7B、Qwen2.5-14B 等 11 个训练与数据层

    摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。

    完整解读
  2. 防御arXiv:2610.01800 ·

    LineupRL:基于描述与时序配对识别的可验证强化学习时间序列描述方法

    提出 LineupRL,用描述到序列识别作可验证奖励训练时序描述模型

    模型与 API测试Qwen2.5-VL-3B、Qwen2.5-VL-72B、Qwen3-VL-8B 等 15 个训练与数据层
    摘要LineupRL 用统计近邻上的序列识别做可验证奖励,3B 描述器超过 SFT、两种 RL 奖励和 72B 教师。

    LineupRL 是给开放式时间序列描述用的 RLVR:不模仿合成参考,而奖励一条描述能否让冻结文本 LLM 从相近序列里认出目标。

    完整解读
  3. 防御arXiv:2610.00332 ·

    最弱一环:用最坏情况约束强化学习蒸馏 LLM 推理能力

    提出最坏情况约束强化学习,抑制推理蒸馏中的奖励投机

    模型与 API测试Qwen2.5-1.5B、Qwen2.5-Math-7B-Instruct、Llama-3.2-3B 等 6 个训练与数据层
    摘要最坏前缀教师似然约束让小模型在接近 GRPO 正确率的同时维持更高保真,从而得到最高 RSR。

    Weakest Link 把大模型推理蒸馏改写成带最坏前缀约束的强化学习:学生最大化可验证任务奖励,但任一前缀上对教师的平均负对数似然不得超过预算 d。作者认为,序列级软 KL 只惩罚平均散度,学生可以用别处的高概率文本掩盖某一步的逻辑错误,同时仍得到正确最终答案。GRPO 则只优化最终答案。

    完整解读
  4. 防御arXiv:2609.38847 ·

    ProRubric:通过协议级评分标准缓解 Rubric-RL 中的奖励作弊

    提出 ProRubric,把加性评分聚合改为合取协议以抑制奖励作弊

    模型与 API测试Qwen3-4B、Qwen3-8B训练与数据层
    摘要ProRubric 用离线合取维度替换加性求和,在继续学习时抬高适当性且不损失覆盖率。

    Protocol-level Rubrics(ProRubric) 研究的是:没有可验证器时,把 rubric 判分合成奖励的方式会不会让优化变成分数更高、回答更差。

    完整解读
  5. 对齐/训练方法arXiv:2609.12459 ·

    EvoRS:面向开放式强化学习的奖励系统在线自演化框架

    EvoRS 把开放式 RL 的奖励系统做成可执行 Reward-DAG,随策略从 on-policy 轨迹演化。

    测试Qwen3-4B、Qwen3-8B、Qwen3.5-27B 等 7 个
    摘要EvoRS 用 on-policy 证据演化完整奖励系统,在写作和角色扮演上同时提高质量并降低黑客与覆盖失败。

    EvoRS 研究开放式 RL 中奖励系统如何在训练期间保持可靠。写作和角色扮演没有可直接验证的答案,策略一旦适应当前 rubric,奖励会出现黑客、漏掉新行为,以及同查询内更难区分。作者认为只动态改评价标准不够,打分机制和信号组合也会失效。

    完整解读
  6. 对齐/训练方法arXiv:2609.12623 ·

    SteerDuplex:可操控的全双工语音对话模型

    AI 导读SteerDuplex 是一个基于 Moshi 微调的全双工语音对话模型,通过自然对话与合成对话训练提升指令跟随、发声表现与双工交互能力,并采用两阶段强化学习结合可验证交互检查与评判式语义反馈优化时序与响应连续性。

    测试SteerDuplex-SFT、SteerDuplex-RL、Moshi 等 4 个
    摘要SteerDuplex 用 SFT 提升语音可控,用两阶段 RL 改时序,并记录奖励黑客。

    SteerDuplex 是基于 Moshi 的全双工语音模型,目标是在保留轮替、打断和一般任务能力的同时,按用户指令改变内容与发声。

    完整解读
  7. 对齐/训练方法arXiv:2609.14648 ·

    通过密集行为信号优化稀疏结果:价值引导偏好蒸馏

    作者用多头多视野价值模型把稠密用户行为标量化,蒸馏进对话策略。

    测试Llama-3.3-70B-Instruct、内部微调模型(基座与规模未披露)
    摘要稠密行为头支撑稀疏留存的优化,参考锚定蒸馏在线上提高留存与部分治疗过程标记。

    Value-Guided Preference Distillation 把多轮心理健康对话的对齐,从轮级偏好改成对多视野用户行为向量的多目标优化,再蒸馏进可部署策略。

    完整解读
  8. 对齐/训练方法arXiv:2609.14896 ·

    MoDA:通过模式条件强化学习实现质量-多样性对齐

    AI 导读MoDA(Mode-conditioned Diversity Alignment)是一种在线后训练 RL 算法,通过让单一共享 LLM 策略以抽象编号角色为条件、各角色作为智能体竞争生成差异化输出来同时优化生成质量与多样性。

    测试Qwen3-8B、Llama-3.1-8B、GLM-4-9B 等 4 个
    摘要MODA 以编号角色和质量门控 RL 扩大输出多样性,并在三项能力平均上高于基座。

    MODA是一种在线后训练 RL:用抽象编号角色把共享 LLM 变成一组竞争智能体,只对过质量门的回答给多样性奖励。

    完整解读
  9. 对齐/训练方法arXiv:2609.18642 ·

    STRETCH:面向 LLM 渐进式进化的统一自教框架

    AI 导读针对固定难度导致 LLM 自我改进训练中能力停滞的问题,研究者提出统一框架 STRETCH(Self-Taught Reasoning Evolution via Targeted CHallenge),其动态 Stretch Zone 机制持续让问题难度与模型解题能力对齐。

    测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、GPT-4o-mini
    完整解读
  10. 对齐/训练方法arXiv:2609.33221 ·

    RMB:用奖励模型 boosting 缓解 RLHF 中的奖励作弊

    作者提出 RMB:用 HSIC 训练多样奖励模型,再用决策树 boosting 聚合,以缓解 RLHF 的 reward hacking。

    测试Gemma-2B-IT、Mistral-7B-Instruct-v0.2、DeepSeek-R1 等 7 个
    摘要RMB 用 HSIC 多样奖励模型加决策树 boosting,提高偏好准确率并缓解 reward hacking。

    RMB 是一种奖励建模方法:用多样的代理奖励模型加 boosting 聚合,为 RLHF 提供更稳的奖励信号。。

    完整解读
  11. 对齐/训练方法arXiv:2609.33662 ·

    Audit-First VAPO:不完美验证下的风险认证选择性更新

    AI 导读Audit-First VAPO 将离散的方向准入与连续的幅度控制分离,用仅观测的接受-申诉-弃权策略在有限二次验证预算下冻结动作轨迹,再通过同时有限样本界认证所选有害风险、覆盖率和验证器调用率。

    测试Qwen3.5-0.8B、Llama-3.2-3B-Instruct
    摘要Audit-First VAPO 先认证方向准入,再限制非负幅度。

    Audit-First VAPO 把验证器条件下的策略更新拆成方向准入和准入后的非负幅度控制,并用冻结轨迹上的有限样本界认证 selected harmful risk、coverage 和二次验证调用率。不完美验证器即使幅度已被裁剪和正则限制,仍可能指向有害方向。仅观测的 accept–appeal–abstain 在干净标签接合前冻结。

    完整解读
  12. 对齐/训练方法arXiv:2608.18607 ·

    VA-Judger:面向联合视频-音频生成的人类偏好反馈奖励建模

    作者提出 VA-Judger,用人类偏好训练联合音视频奖励模型。

    测试Qwen3-Omni、VA-Judger、LTX-2 等 6 个
    摘要VA-Judger 用易到难的人类偏好学习做联合音视频奖励,并用于 LTX-2 后训练。

    VA-Judger 是面向联合音视频生成的思维链全模态奖励模型,用来替代由分维度专家指标拼成的强化学习奖励。

    完整解读
  13. 对齐/训练方法arXiv:2609.36900 ·

    STAR-GRPO:用可靠性优先优势估计抑制奖励作弊

    STAR-GRPO 用成对评分的可靠性约束组相对优势,限制无支撑奖励改写基线与更新。

    测试Llama-3.2-1B-Instruct、Skywork-Reward-V2-Qwen3-8B、Qwen3-4B 等 6 个
    摘要STAR-GRPO 用成对可靠性约束 GRPO 优势,在两种奖励黑客设定中限制无支撑分数。

    STAR-GRPO 是一种可靠性优先的组相对优势估计:同一 rollout 的两个评分决定更新强度,任务奖励仍由预指定质量路径选择。

    完整解读