研究:LLM 潜在空间去偏方向主要编码置信度而非公平性
剑桥大学与 Visa 风险与安全 AI 实验室的研究发现,通过对比偏见与反偏见提示激活得到的去偏方向主要编码模型置信度,而非偏见本身。研究在 Llama-3.1-8B、Falcon3-7B、Ministral-3-8B 和 Qwen3.5-9B 的基座与指令微调版本上训练线性分类器,该分类器在 BBQ 去歧义语境下区分偏见与反偏见提示的 AUROC 仅 0.57,但按最高与最低概率答案划分时 AUROC 达 0.94。在 MMLU 和 OpenBookQA 等不含社会偏见概念的数据集上,该分类器区分高低概率答案的 AUROC 仍高达 0.88。激活引导实验显示,沿去偏方向引导会降低模型置信度:在提供弃答选项时模型弃答率上升,BBQ 歧义提示的偏见分数从 0.08 降至 0.01,但去歧义语境的偏见分数基本不变;不提供弃答选项时各选项概率趋于均衡、熵上升。
推荐理由论文用线性探针与激活引导实验说明去偏方向主要编码模型置信度,为评估激活引导类对齐方法提供了可迁移的检验思路。