跳到正文
原文
arXiv:对齐与欺骗· arXiv:2609.36245· Zhaolong Su·· 3 天前

CoRe:协同演化奖励模型缓解视频扩散模型中的潜在奖励作弊

CoRe: Co-Evolving Reward Models for Mitigating Latent Reward Hacking in Video Diffusion Models

AI 导读

针对固定潜在奖励模型优化会导致潜在奖励作弊、生成视频的感知与运动质量下降的问题,研究者提出协同演化奖励框架 CoRe,将潜在空间对齐视为生成器与奖励模型之间的动态交互,持续用生成器当前样本重新拟合奖励模型并锚定真实视频偏好,使生成器无法通过偏离数据分布获取高奖励。在 Wan2.1-T2V-1.3B 上,CoRe 的生成质量持续优于预训练模型和既有对齐方法,并避免了固定奖励优化带来的质量崩溃。

阅读原文arxiv.org