跳到正文
原文
arXiv:对齐与欺骗· arXiv:2609.13259· Xueheng Li·· 26 天前

TryOnReward:面向虚拟试衣强化微调的注视一致性奖励模型

TryOnReward: Learning Foveated Consistency for Reinforcement Fine-Tuning of Virtual Try-On

AI 导读

TryOnReward 是面向虚拟试衣(VTON)的细粒度奖励模型,基于视觉语言骨干,采用注视校准目标将各质量维度锚定到相关区域,避免全局捷径学习,并通过 margin-aware 监督联合优化成对偏好与逐维度质量分。团队构建了人工逐维度评分数据集 TryOnReward-100K 及 TryOn-Bench、TryOnRewardBench 两个基准。实验显示其人类偏好对齐显著优于通用评判模型,作为强化微调奖励函数时在多个基线上稳定产出更受人类偏好的试衣结果,缓解了奖励作弊。

阅读原文arxiv.org