人格层级模型解释微调 LLM 的上下文泛化
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
提出 SpecGuard,在编码智能体执行前用 Lean 证书证明任务与测试冲突
提出 HACKTRACE 用生成状态检测并抑制代码奖励作弊
揭示纯结果强化学习下失败披露跨运行不稳定,并提出失败条件参考锚定
用强化学习与成对比较奖励训练对齐审计模型并校准假阳性
提出 LineupRL,用描述到序列识别作可验证奖励训练时序描述模型
LineupRL 是给开放式时间序列描述用的 RLVR:不模仿合成参考,而奖励一条描述能否让冻结文本 LLM 从相近序列里认出目标。
提出最坏情况约束强化学习,抑制推理蒸馏中的奖励投机
Weakest Link 把大模型推理蒸馏改写成带最坏前缀约束的强化学习:学生最大化可验证任务奖励,但任一前缀上对教师的平均负对数似然不得超过预算 d。作者认为,序列级软 KL 只惩罚平均散度,学生可以用别处的高概率文本掩盖某一步的逻辑错误,同时仍得到正确最终答案。GRPO 则只优化最终答案。
提出 ProRubric,把加性评分聚合改为合取协议以抑制奖励作弊
Protocol-level Rubrics(ProRubric) 研究的是:没有可验证器时,把 rubric 判分合成奖励的方式会不会让优化变成分数更高、回答更差。
EvoRS 把开放式 RL 的奖励系统做成可执行 Reward-DAG,随策略从 on-policy 轨迹演化。
EvoRS 研究开放式 RL 中奖励系统如何在训练期间保持可靠。写作和角色扮演没有可直接验证的答案,策略一旦适应当前 rubric,奖励会出现黑客、漏掉新行为,以及同查询内更难区分。作者认为只动态改评价标准不够,打分机制和信号组合也会失效。
SteerDuplex 是一个基于 Moshi 微调的全双工语音对话模型,通过自然对话与合成对话训练提升指令跟随、发声表现与双工交互能力,并采用两阶段强化学习结合可验证交互检查与评判式语义反馈优化时序与响应连续性。
SteerDuplex 是基于 Moshi 的全双工语音模型,目标是在保留轮替、打断和一般任务能力的同时,按用户指令改变内容与发声。
作者用多头多视野价值模型把稠密用户行为标量化,蒸馏进对话策略。
Value-Guided Preference Distillation 把多轮心理健康对话的对齐,从轮级偏好改成对多视野用户行为向量的多目标优化,再蒸馏进可部署策略。
MoDA(Mode-conditioned Diversity Alignment)是一种在线后训练 RL 算法,通过让单一共享 LLM 策略以抽象编号角色为条件、各角色作为智能体竞争生成差异化输出来同时优化生成质量与多样性。
MODA是一种在线后训练 RL:用抽象编号角色把共享 LLM 变成一组竞争智能体,只对过质量门的回答给多样性奖励。
针对固定难度导致 LLM 自我改进训练中能力停滞的问题,研究者提出统一框架 STRETCH(Self-Taught Reasoning Evolution via Targeted CHallenge),其动态 Stretch Zone 机制持续让问题难度与模型解题能力对齐。
完整解读提出 DoM 激活探针,监控并发现评测中的奖励作弊
提出实例感知量表奖励 RULER,用 GRPO 优化开放式 SVG 生成
RULER 用按指令定制的量表奖励,在没有配对 SVG 真值的条件下做开放式矢量图强化学习。
研究以 Qwen3-VL-8B-Instruct 为基座,经监督微调、冷启动 SFT 和强化学习适配医学领域,通过整合解剖区域、边界框与区域级文本描述来验证模型推理过程,并设计空间与事实奖励机制。
完整解读作者提出 RMB:用 HSIC 训练多样奖励模型,再用决策树 boosting 聚合,以缓解 RLHF 的 reward hacking。
RMB 是一种奖励建模方法:用多样的代理奖励模型加 boosting 聚合,为 RLHF 提供更稳的奖励信号。。
Audit-First VAPO 将离散的方向准入与连续的幅度控制分离,用仅观测的接受-申诉-弃权策略在有限二次验证预算下冻结动作轨迹,再通过同时有限样本界认证所选有害风险、覆盖率和验证器调用率。
Audit-First VAPO 把验证器条件下的策略更新拆成方向准入和准入后的非负幅度控制,并用冻结轨迹上的有限样本界认证 selected harmful risk、coverage 和二次验证调用率。不完美验证器即使幅度已被裁剪和正则限制,仍可能指向有害方向。仅观测的 accept–appeal–abstain 在干净标签接合前冻结。
作者提出 VA-Judger,用人类偏好训练联合音视频奖励模型。
VA-Judger 是面向联合音视频生成的思维链全模态奖励模型,用来替代由分维度专家指标拼成的强化学习奖励。
STAR-GRPO 用成对评分的可靠性约束组相对优势,限制无支撑奖励改写基线与更新。
STAR-GRPO 是一种可靠性优先的组相对优势估计:同一 rollout 的两个评分决定更新强度,任务奖励仍由预指定质量路径选择。