跳到正文
原文
arXiv:对齐与欺骗· arXiv:2609.19144· Peter Chen·· 15 天前

面向 LLM 偏好对齐的零阶范式:ComPO 方法

A Zeroth-Order Paradigm for LLM Preference Alignment

AI 导读

研究者提出并分析 Comparison-based Preference Optimization(ComPO),一种基于比较 oracle 的零阶偏好对齐方法,不直接优化可微偏好损失,而是从偏好对中提取方向信息。该方法在平滑性、梯度稀疏性与 oracle 兼容性假设下给出了离线方案的收敛保证,并引入使用无标注策略生成做 reverse-KL 控制的在线版本。在 Mistral、Llama、Gemma-2、Qwen3 和 Gemma-3 上的实验显示其优于现有直接对齐方法,长度控制胜率提升,配对级诊断与缓解似然位移一致。

阅读原文arxiv.org