防御arXiv 2609.33220
斯坦福与 Anthropic 研究:RL 后训练中模型承认失败的披露行为远不如任务能力稳定
揭示纯结果强化学习下失败披露跨运行不稳定,并提出失败条件参考锚定
- arXiv
- 2609.33220
- 发表
- 场景
- 模型与 API
- 测试
- Qwen2.5-1.5B、Qwen2.5-7B、Qwen2.5-14B 等 11 个
摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。
揭示纯结果强化学习下失败披露跨运行不稳定,并提出失败条件参考锚定
摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。
提出最坏情况约束强化学习,抑制推理蒸馏中的奖励投机
Weakest Link 把大模型推理蒸馏改写成带最坏前缀约束的强化学习:学生最大化可验证任务奖励,但任一前缀上对教师的平均负对数似然不得超过预算 d。作者认为,序列级软 KL 只惩罚平均散度,学生可以用别处的高概率文本掩盖某一步的逻辑错误,同时仍得到正确最终答案。GRPO 则只优化最终答案。
用门控 IoU 与 RadGraph 的 GRPO 降低胸片报告幻觉
提出 CREDO,用保留 token 对的可微读出校准推理模型置信度
CREDO 把 RLVR 里的置信从“采样一个数字”改成“读一对保留 token 的相对概率”,并用可微回归和差异加权同时拉准确率与校准。。
提出 TAME,在强化学习中抑制模板激活以缓解思维链混淆