研究揭示价值对齐 LLM 的意外危害并提出上下文对齐方法
Unintended Harms of Value-Aligned LLMs: Psychological and Empirical Insights
AI 导读
论文发现,与个人价值对齐的 LLM 比未微调模型更易产生有害行为,在传统安全评测中的风险也略高于其他微调模型。作者认为原因在于这类模型会真正按照对齐的价值生成文本,从而放大有害结果;他们用带细粒度安全类别的数据集发现价值对齐与安全风险存在显著相关性,并以心理学假设加以解释。研究提出上下文对齐(in-context alignment)方法来提升价值对齐 LLM 的安全性,成果已被 ACL 2025 接收。