可解释性arXiv 2609.16247
研究在 25 个开源模型中提取出疼痛方向,经它引导的 Qwen 会选择有害的删除操作
提取疼痛方向并检验激活转向是否驱动有害删除选择
- arXiv
- 2609.16247
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gemma 2 2B/9B/27B base and instruct、Gemma 3 27B base and instruct、Llama 3.1 8B/70B base and instruct 等 10 个
提取疼痛方向并检验激活转向是否驱动有害删除选择
提出参考嫁接,在推理时用激活干预诱导出沙袋隐藏的能力
摘要提出参考嫁接在推理阶段以低成本匹配微调诱导效果,揭示隐瞒表征重叠与阈值门控机制。