ProRubric:通过协议级评分标准缓解 Rubric-RL 中的奖励作弊
提出 ProRubric,把加性评分聚合改为合取协议以抑制奖励作弊
- arXiv
- 2609.38847
- 发表
- 场景
- 模型与 API
- 测试
- Qwen3-4B、Qwen3-8B
摘要ProRubric 用离线合取维度替换加性求和,在继续学习时抬高适当性且不损失覆盖率。
Protocol-level Rubrics(ProRubric) 研究的是:没有可验证器时,把 rubric 判分合成奖励的方式会不会让优化变成分数更高、回答更差。