跳到正文
原文
arXiv:对齐与欺骗· arXiv:2609.32340· Yunkai Yang·· 6 天前

SGA-Flow-GRPO:面向 Flow-GRPO 的空间梯度引导信用分配

SGA-Flow-GRPO: Spatial Gradient-Guided Credit Assignment for Flow-GRPO

AI 导读

针对 Flow-GRPO 在时间去噪步与空间潜维度上统一使用标量优势、忽略图像空间结构的问题,研究者提出 SGA-Flow-GRPO,为 Diffusion Transformers(DiTs)设计梯度引导的空间信用分配框架。该方法将 Flow-GRPO 的转移级对数似然改写为与 DiT patch 架构对齐的 token 级表示,并用奖励梯度构建连续空间信用图,配合基于 Median Absolute Deviation(MAD)的异常值鲁棒归一化与温度缩放抑制梯度噪声。在 GenEval 上的评测显示其达到 SOTA 对齐质量,收敛速度与 DiffusionNFT 等顶级方法相当,对齐性能显著优于 Flow-GRPO 类方法。

阅读原文arxiv.org