可解释性arXiv:2610.08559 · 10月6日研究:LLM 潜在空间去偏方向主要编码置信度而非公平性分析激活引导去偏方向,发现其编码的是置信度而非公平性模型与 API·测试Llama-3.1-8B、Llama-3.1-8B-Instruct、Falcon3-7B-Base 等 8 个·模型层推理时干预偏见与歧视摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。完整解读