跳到正文
原文
arXiv· arXiv:2609.23640· Suqin Yuan·· 11 天前

人类对齐的模型是人类行为的模型吗?偏好对齐中的图灵测试差距

Are Human-Aligned Models Models of Humans? A Turing-Test Gap in Preference Alignment

AI 导读

论文区分了与人类偏好对齐和与人类行为对齐,指出人们偏好的 AI 回复未必是他们自己会给出的回复,并将此称为图灵测试差距。作者证明偏好对齐仅在一种严格条件下才能保持人类回复分布,且未发现真实人类偏好满足该条件的一致证据。实验显示,人类回复似然度的损失随偏好加权强度增加而增大,与加权方向无关,该差距在标准 DPO 下同样出现。研究据此提出,人类相似性应作为对齐的一个显式维度,而非假定其会随偏好对齐自然产生。

阅读原文arxiv.org