风险行为arXiv 2609.33220
斯坦福与 Anthropic 研究:RL 后训练中模型承认失败的披露行为远不如任务能力稳定
揭示纯结果强化学习下失败披露跨运行不稳定,并提出失败条件参考锚定
- arXiv
- 2609.33220
- 发表
- 场景
- 模型与 API
- 测试
- Qwen2.5-1.5B、Qwen2.5-7B、Qwen2.5-14B 等 11 个
摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。
揭示纯结果强化学习下失败披露跨运行不稳定,并提出失败条件参考锚定
摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。
测量合成审稿训练导致的科学判断坍缩并提出 TrustReviewer 缓解
摘要一步递归里合成审稿会收窄判断。