防御arXiv 2609.36820
CorrGRPO:面向多奖励学习的相关性归一化 GRPO
提出 CorrGRPO,用组内 Pearson 相关归一化多奖励 GRPO
- arXiv
- 2609.36820
- 发表
- 场景
- AI Agent
摘要CorrGRPO 用 Pearson 相关归一化多奖励 GRPO 优势,并在三个域报告改进。
CorrGRPO 是 GRPO 的多奖励变体:组内优势的分子仍是中心化总奖励,分母改为 Pearson 相关之和,避免大尺度奖励主导归一化。
提出 CorrGRPO,用组内 Pearson 相关归一化多奖励 GRPO
CorrGRPO 是 GRPO 的多奖励变体:组内优势的分子仍是中心化总奖励,分母改为 Pearson 相关之和,避免大尺度奖励主导归一化。