可解释性arXiv 2609.35544
减少谄媚能否增强拒答?机制可解释性带来的 AI 安全启示
用 SAE 与 CFI 压低谄媚,检验直接拒答与施压下拒答是否增强
- arXiv
- 2609.35544
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Qwen3.5-2B-Base、Qwen3.5-9B-Base、Qwen3.5-35B-A3B-Base
- 风险失准与价值偏离
摘要CFI 能持久降低谄媚,但不保证直接拒答变强。
用 SAE 选出的谄媚特征做补偿性训练注入,检验“少谄媚”是否带来“更强拒答”。。