可解释性arXiv 2610.08559
研究:LLM 潜在空间去偏方向主要编码置信度而非公平性
分析激活引导去偏方向,发现其编码的是置信度而非公平性
- arXiv
- 2610.08559
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Ministral-3-8B-Base、Ministral-3-8B-Instruct、Llama-3.1-8B 等 8 个
摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。
分析激活引导去偏方向,发现其编码的是置信度而非公平性
摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
提出 GeoSteer,把保范数激活引导做成球面测地线优化