Uni-TMPO:统一轨迹匹配策略优化,提升 T2I 生成多样性与 VLA 泛化
Unified Trajectory Matching Policy Optimization: Diverse T2I Generation and VLA Generalization
AI 导读
Uni-TMPO 是一个面向扩散与流策略的统一 RL 后训练框架,用前向 KL 优化让策略分布匹配由标准化奖励构造的目标分布,替代传统的奖励最大化。该方法在 T2I 上取得更高奖励,并获得最佳的奖励—多样性—效率权衡;在 VLA 上取得更高的 ID 成功率,并更好地泛化到留出任务与场景。真机评测显示,当更高奖励目标受阻时,多种动作策略具有实际价值。