可解释性arXiv 2609.07746
LLM Forensics:用稀疏自编码器定位并控制后门触发机制
用 SAE 定位后门触发机制并分离检测与因果控制
- arXiv
- 2609.07746
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gaperon-1B、Gaperon-8B、Gaperon-24B
- 攻击投毒与后门
摘要Gaperon 语言切换后门可分成检测、残差路由和后期语言跟踪三类 SAE 特征,只有部分能改行为。
作者用稀疏自编码器分解 Gaperon 中无害的语言切换后门,区分识别触发的特征与真正能抑制或诱发该行为的特征。固定触发使英语提示在 Gaperon-1B 与 8B 上续写成法语或德语。