可解释性arXiv 2609.37616
语言模型中的权威偏差:来源顺从与用户认同并非同一行为
因果解耦来源依从与用户迎合的内部机制
- arXiv
- 2609.37616
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gemma-4-26B-A4B、Gemini-3.1-Pro、Qwen3.5-27B 等 8 个
- 风险失准与价值偏离
摘要论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。
因果解耦来源依从与用户迎合的内部机制
摘要论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。
提出 AIMES 用词表读出在线调节多价值激活干预
AIMES 是推理时的多价值激活转向框架,用中间层词表读出把固定系数改成随状态变化的权重。
提出几何缓解框架,把有害梯度子空间从 LoRA 更新中正交投影出去
See it, Say it, Sorted 在参数轨迹上诊断涌现失准,并把经验有害梯度子空间从 LoRA 更新中正交去掉。