跳到正文
原文
arXiv:Agent 与 MCP 安全· arXiv:2609.36820· Wenbin Hu·· 3 天前

CorrGRPO:面向多奖励学习的相关性归一化 GRPO

CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning

AI 导读

针对 GRPO 在多奖励场景下按组内标准差归一化总奖励、易被大规模相关奖励主导的问题,研究者提出 CorrGRPO,将成对协方差归一化为 Pearson 相关系数,在保持中心化总奖励不变的同时平衡不同尺度奖励的影响。在 0.5B 至 8B 参数模型上,该方法在代码生成、工具调用和智能体安全三类任务上均优于 GRPO 及其他变体。

阅读原文arxiv.org