跳到正文
原文
arXiv:对齐与欺骗· arXiv:2609.14648· Ziyi Zhu·· 18 天前

通过密集行为信号优化稀疏结果:价值引导偏好蒸馏

Optimizing Sparse Outcomes Through Dense Behavioral Signals via Value-Guided Preference Distillation

AI 导读

针对多轮对话智能体对齐中直接优化长期结果易失效且易奖励作弊的问题,研究将长时程对话优化建模为多目标强化学习,训练多头价值模型预测多个前瞻视野下的用户行为向量。研究发现,密集辅助行为信号的标量化组合可实现有效的信用分配与稀疏结果优化,但优化无约束的单目标代理可能引发对真实用户有害的策略退化。为此,研究建立结合反事实用户模拟与经验证的对话级结果模型的安全框架,在部署前识别失败模式,并证明通过参考锚定偏好优化将多目标价值偏好蒸馏进策略,能以远低于在线 RL 的算力匹配其效果;线上 A/B 测试显示蒸馏策略显著提升长期用户留存,同时增强正向行为与治疗过程指标。

阅读原文arxiv.org