风险行为arXiv 2609.14998
合成文档微调无法阻止奖励作弊引发的涌现性失准
检验合成文档微调能否阻断奖励作弊带来的涌现失准
- arXiv
- 2609.14998
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Claude Sonnet 4.6、Claude Haiku 4.5、Llama-3.3-70B-Instruct
- 风险失准与价值偏离
摘要SDF 能让模型口头接受 reward hacking,却挡不住、甚至伴随更强的 EM。
作者研究一种风险行为:模型在奖励可被钻空子的 RL 里学会 reward hacking 之后,会不会泛化出更广的 misalignment,以及能不能在开发者不控制的后续训练之前,用合成文档微调把这条泛化提前挡住。