可解释性arXiv 2609.08322
多语言 LLM 中的刻板印象如何从内部表征传导到输出:Llama-3.1-8B、Qwen3-8B 与 Gemma-2-9B 的机制对比
用线性探针、归因修补与 SAE 消融追踪多语模型刻板印象
- arXiv
- 2609.08322
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Llama-3.1-8B、Qwen3-8B、Gemma-2-9B 等 4 个
- 风险偏见与歧视
摘要可解码、输出影响与稀疏特征消融需要分开测量。
把多语 LLM 中刻板印象从线性表示追到输出影响,再追到 SAE 特征消融。。