跳到正文
10月9日 · 周五

全部论文

找到 1 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 552 篇还没打标签,不在筛选结果里。

另有 552 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.36820

    CorrGRPO:面向多奖励学习的相关性归一化 GRPO

    提出 CorrGRPO,用组内 Pearson 相关归一化多奖励 GRPO

    发表
    场景
    AI Agent
    测试
    Qwen2.5-Coder-0.5B-Instruct、Qwen2.5-Coder-1.5B-Instruct、Qwen2.5-Coder-3B-Instruct 等 8 个
    摘要CorrGRPO 用 Pearson 相关归一化多奖励 GRPO 优势,并在三个域报告改进。

    CorrGRPO 是 GRPO 的多奖励变体:组内优势的分子仍是中心化总奖励,分母改为 Pearson 相关之和,避免大尺度奖励主导归一化。

    深度解读完整解读
已经到底了