跳到正文
原文
arXiv:对齐与欺骗· arXiv:2609.12607· Ioannis Stylianou·· 21 天前

Direct Preference Density Alignment:面向对话式音频均衡的对齐框架

Direct Preference Density Alignment for Conversational Audio Equalization

AI 导读

研究提出 Direct Preference Density Alignment,用约 90,000 条用户数据构建非参数偏好密度图作为经验奖励面,从而无需学习代理奖励模型,同时保留在线强化学习能力。该方法将 GRPO 的在线结构 grounding 与 DPO 的离线精调结合,在盲听音频均衡测试中让 1.5B 参数模型达到精心设计提示词的 GPT-4o mini 基线的感知水平,且推理算力消耗仅为后者一小部分。

阅读原文arxiv.org