防御arXiv 2610.02967
用偏好奖励与评分标准奖励组合后训练前沿文生图模型
组合偏好奖励与评分标准奖励后训练文生图模型以抑制奖励作弊
- arXiv
- 2610.02967
- 发表
- 场景
- 模型与 API
- 被测模型
- FLUX.2-dev、Ideogram-4
摘要组合奖励后训练 FLUX.2-dev 与 Ideogram-4,并报告高于基座的胜率与 Elo。
作者给出一套开放域文生图后训练配方:把人类偏好奖励和 prompt 条件的 rubric 奖励合在一起,而不是换一个新优化器。问题是单一奖励盖不住用户意图。偏好模型能看整体观感,但对“是否实现每个要求”这类稀疏属性不敏感。