可解释性arXiv 2609.37616
语言模型中的权威偏差:来源顺从与用户认同并非同一行为
因果解耦来源依从与用户迎合的内部机制
- arXiv
- 2609.37616
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Qwen3.5-27B、GPT-OSS-20B、OLMo-3.1-32B 等 8 个
- 风险失准与价值偏离
摘要论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。
因果解耦来源依从与用户迎合的内部机制
摘要论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。