分析与理论arXiv 2609.35677
RLVR 中的验证器错误:奖励作弊、反馈局限与选择性控制
刻画不完美验证器下 RLVR 奖励黑客的增长并用投影审计校正实现选择性控制
- arXiv
- 2609.35677
- 发表
- 场景
- 模型与 API
- 测试
- log linear policy、neural policy、Qwen2-0.5B
摘要固定验证器的 RLVR 会把验收与黑客绑在一起。
作者分析固定、不完美验证器下的 RLVR:验证器无假阴性,因而同时奖励正确回答和被接受错误,平均奖励只看总验收概率。