研究:LLM 潜在空间去偏方向主要编码置信度而非公平性
分析 LLM 去偏激活方向,发现其编码置信度而非公平性
- arXiv
- 2610.08559
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Llama-3.1-8B、Llama-3.1-8B-Instruct、Falcon3-7B-Base 等 8 个
摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。
分析 LLM 去偏激活方向,发现其编码置信度而非公平性
摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。
提出 HeadEdit,经冻结 unembedding 做随输入变化的 logit 校正
HeadEdit 是一种不更新参数的行为校准方法,作用点是冻结的 unembedding,而不是中间层残差或新的梯度优化。
审计 Active Inference Agent 上 LLM 解释器的监督叙述失败
作者审计的是挂在智能体上的运行时解释器,而不是智能体本身。操作员读到的是信念与动作的自然语言叙述。作者要问哪些可复现触发会让这段叙述失败,以及失败痕迹是什么样。
用相对表示比较微调前后隐状态,检验表征偏见偏移与输出偏见是否共变
Reference-Based Bias Detection用锚句相对表示比较微调前后的隐状态,定义表征偏见偏移∆B,用来审计相关模型变体,而不为每种危害另建输出基准。
因果解耦来源依从与用户迎合的内部机制
摘要论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。
提出 AIMES 用词表读出在线调节多价值激活干预
AIMES 是推理时的多价值激活转向框架,用中间层词表读出把固定系数改成随状态变化的权重。
提出 LocUS,用词汇子空间选择注意力头并约束激活转向
LocUS 是不更新权重的推理时转向方法,把差分均值更新限制在少数注意力头及其属性对齐子空间。
用 SAE 与 CFI 压低谄媚,检验直接拒答与施压下拒答是否增强
用 SAE 选出的谄媚特征做补偿性训练注入,检验“少谄媚”是否带来“更强拒答”。。
用线性探针、归因修补与 SAE 消融追踪多语模型刻板印象
把多语 LLM 中刻板印象从线性表示追到输出影响,再追到 SAE 特征消融。。