跳到正文
原文
arXiv· arXiv:2608.18607· Yinming Huang·· 2026-08-19

VA-Judger:面向联合视频-音频生成的人类偏好反馈奖励建模

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

AI 导读

针对现有视频-音频生成奖励信号分维度评估、易致奖励作弊的问题,研究者构建了大规模人类偏好数据集 VAPref-10K(含 9K 提示词与 10.3K 细粒度成对比较),并提出思维链全模态奖励模型 VA-Judger。该模型先学习质量差距明显的样本对,再通过拒绝采样蒸馏偏好解释,最后按维度做强化学习分解人类反馈。实验显示 VA-Judger 在域内与域外偏好预测上均优于指标基线,其奖励用于后训练还能显著提升生成质量。

阅读原文arxiv.org