包络采样:用少量真值标注重校准 LLM 评委以缓解奖励作弊
提出包络采样,用少量真值标注重标定 LLM 评委以缓解奖励作弊
- arXiv
- 2610.11281
- 发表
- 场景
- 模型与 API
- 被测模型
- Qwen3-4B、Qwen3.8-27B、Qwen2.5-14B-Instruct
摘要包络采样把真值标注打到代理尾部,同样预算下缓解 reward hacking。
作者研究后训练前如何选择真值标注的查询分布,使重标定后的廉价代理更适合被优化。真奖励昂贵时,实践用 LLM judge 代替人类。若失准只发生在基座很少生成的输出上,on-policy 标注修不到这些点,随后的 KL 正则优化会把质量集中到被高估的输出。