可解释性arXiv:2610.08559 · 10月6日研究:LLM 潜在空间去偏方向主要编码置信度而非公平性分析激活引导去偏方向,发现其编码的是置信度而非公平性模型与 API·测试Llama-3.1-8B、Llama-3.1-8B-Instruct、Falcon3-7B-Base 等 8 个·模型层推理时干预偏见与歧视摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。完整解读
可解释性arXiv:2609.10060 · 9月9日研究者提出基于参考的隐藏状态相对表示偏见检测方法用相对表示比较微调前后隐状态,检验表征偏见偏移与输出偏见是否共变模型与 API·测试Llama 3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Gemma 3-4B-IT·模型层偏见与歧视摘要相对表示上的∆B 在多数微调设置中与三个基准的输出层偏见变化共变。Reference-Based Bias Detection用锚句相对表示比较微调前后的隐状态,定义表征偏见偏移∆B,用来审计相关模型变体,而不为每种危害另建输出基准。完整解读