IDRF:掩码离散扩散模型的逆蒸馏奖励微调
IDRF: Inverse-Distilled Reward Fine-tuning of Masked Discrete Diffusion Models
AI 导读
IDRF 是一种面向少步掩码离散扩散生成器的奖励微调框架,用逆蒸馏正则替代难以计算的序列级 KL 惩罚,并证明在最优辅助去噪器下该损失是序列级 KL 散度的上界。它无需参考模型 rollout,将少步生成视为有限时域马尔可夫决策过程,用裁剪策略梯度目标优化奖励。在 DNA、图像和文本生成任务上,IDRF 以最多减少 32 倍去噪步数取得高奖励,同时缓解奖励作弊并保持样本质量。