可解释性arXiv 2609.16247
研究在 25 个开源模型中提取出疼痛方向,经它引导的 Qwen 会选择有害的删除操作
提取疼痛方向并检验激活转向是否驱动有害删除选择
- arXiv
- 2609.16247
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gemma 2 2B/9B/27B base and instruct、Gemma 3 27B base and instruct、Llama 3.1 8B/70B base and instruct 等 10 个
提取疼痛方向并检验激活转向是否驱动有害删除选择
提出 RevLeakBench 测量交付物修订痕迹造成的无意泄露
修订痕迹指模型按要求删掉或换掉一项后,又在交代这次修改时把它写进给第三方的交付物。
发现无显式危害的窄域图文微调可诱发涌现失准
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。