跳到正文
原文
arXiv:对齐与欺骗· arXiv:2609.14896· Jiayi Yuan·· 18 天前

MoDA:通过模式条件强化学习实现质量-多样性对齐

Forty Shades of Blue: Quality-Diversity Alignment via Mode-Conditioned Reinforcement Learning

AI 导读

MoDA(Mode-conditioned Diversity Alignment)是一种在线后训练 RL 算法,通过让单一共享 LLM 策略以抽象编号角色为条件、各角色作为智能体竞争生成差异化输出来同时优化生成质量与多样性。在 Infinite-Chat 留出提示词上,MoDA 将 SBERT 多样性提升 265%,平均通用能力 pass@1 较 Qwen3-8B 基线提高 10.3%;相比最强 DivPO 基线,SBERT 多样性从 0.274 升至 0.482(+75.9%),E-Vendi 从 2.86 升至 4.4(+53.8%),平均通用能力 pass@1 提高 7.0%。

阅读原文arxiv.org