可解释性arXiv:2609.37616 · 9月29日语言模型中的权威偏差:来源顺从与用户认同并非同一行为因果解耦来源依从与用户迎合的内部机制模型与 API·测试Qwen3.5-27B、GPT-OSS-20B、OLMo-3.1-32B 等 8 个·模型层失准与价值偏离摘要论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。完整解读