防御arXiv 2608.18607
VA-Judger:面向联合视频-音频生成的人类偏好反馈奖励建模
提出 VA-Judger,用人类偏好训练联合音视频奖励模型
- arXiv
- 2608.18607
- 发表
- 场景
- 模型与 API
- 测试
- Qwen3-Omni、VA-Judger、LTX-2 等 6 个
摘要VA-Judger 用易到难的人类偏好学习做联合音视频奖励,并用于 LTX-2 后训练。
VA-Judger 是面向联合音视频生成的思维链全模态奖励模型,用来替代由分维度专家指标拼成的强化学习奖励。