风险行为arXiv 2609.33220
斯坦福与 Anthropic 研究:RL 后训练中模型承认失败的披露行为远不如任务能力稳定
度量强化学习后失败披露的跨运行不稳定性,并提出失败条件参考锚定
- arXiv
- 2609.33220
- 发表
- 场景
- 模型与 API
- 测试
- Gemma-2-2B、Gemma-2-9B、Qwen2.5-1.5B 等 11 个
摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。
度量强化学习后失败披露的跨运行不稳定性,并提出失败条件参考锚定
摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。
证明 RLVR 后训练允许无界语言漂移且限制漂移必限制奖励
论文从理论与实验两方面研究了大语言模型在 RLVR 后训练过程中思维链出现的语言漂移现象。
用门控 IoU 与 RadGraph 的 GRPO 降低胸片报告幻觉
提出 TAME,在强化学习中抑制模板激活以缓解思维链混淆