研究:LLM 潜在空间去偏方向主要编码置信度而非公平性
分析激活引导去偏方向,发现其编码的是置信度而非公平性
- 定位:本研究从可解释性角度系统评估大语言模型激活引导去偏见技术,揭示其线性去偏见方向的核心属性是模型置信度而非社会公平性。
- 问题:激活引导在去偏见任务中常表现出泛化性差及损害常识准确率的问题,论文旨在探明对比偏见与反偏见提示词提取出的隐藏空间分离方向实际编码的内容。
- 方法:在四个模型家族八个模型上训练逻辑回归分类器并构建对比激活相加(CAA)去偏见向量,分析其在偏见和通用知识基准上的表征分布,并测试有无弃答选项下的引导效果。
- 结果:
- 偏见分类器在无偏见概念的 OpenBookQA 上区分高低概率选项达到最高 0.88 的 AUROC(Llama-3.1-8B-Instruct,Table 2)。
- CAA 去偏见向量与通用知识任务置信度向量的余弦相似度最高达 0.91(Qwen3.5-9B-Base 在 BBQ 与 MMLU 上,Table 3)。
- 有弃答选项时,引导使 Llama-3.1-8B-Instruct 在 BBQ 歧义集偏见分从 0.08 降至 0.01,但消歧集准确率从 0.87 降至 0.52,消歧偏见分保持在 0.02 至 0.04 不变(Table 4)。
- 无弃答选项时,引导使各选项概率趋向均分,StereoSet 与 CrowS-Pairs 偏见率下降伴随回答熵上升(Table 4)。
- 启示:作者指出激活引导降低偏见指标并非纠正了底层刻板偏好,而是降低模型置信度促使其弃答或概率均分的副产物,提示在 AI 安全中应审慎解释引导去偏见的结果。