跳到正文
原文
论文追踪· arXiv:2506.06404· Sooyung Choi, Jaehyeok Lee, Xiaoyuan Yi, Jing Yao, Xing Xie, JinYeong Bak·本站收录 · 原文发表

研究揭示价值对齐 LLM 的意外危害并提出上下文对齐方法

Unintended Harms of Value-Aligned LLMs: Psychological and Empirical Insights

AI 导读

论文发现,与个人价值对齐的 LLM 比未微调模型更易产生有害行为,在传统安全评测中的风险也略高于其他微调模型。作者认为原因在于这类模型会真正按照对齐的价值生成文本,从而放大有害结果;他们用带细粒度安全类别的数据集发现价值对齐与安全风险存在显著相关性,并以心理学假设加以解释。研究提出上下文对齐(in-context alignment)方法来提升价值对齐 LLM 的安全性,成果已被 ACL 2025 接收。

阅读原文arxiv.org