防御arXiv 2609.36820
CorrGRPO:面向多奖励学习的相关性归一化 GRPO
提出 CorrGRPO,用组内 Pearson 相关归一化多奖励 GRPO
- arXiv
- 2609.36820
- 发表
- 场景
- AI Agent
- 测试
- Qwen2.5-Coder-0.5B-Instruct、Qwen2.5-Coder-1.5B-Instruct、Qwen2.5-Coder-3B-Instruct 等 8 个
摘要CorrGRPO 用 Pearson 相关归一化多奖励 GRPO 优势,并在三个域报告改进。
CorrGRPO 是 GRPO 的多奖励变体:组内优势的分子仍是中心化总奖励,分母改为 Pearson 相关之和,避免大尺度奖励主导归一化。