可解释性arXiv 2609.16247
研究在 25 个开源模型中提取出疼痛方向,经它引导的 Qwen 会选择有害的删除操作
提取疼痛方向并检验激活转向是否驱动有害删除选择
- arXiv
- 2609.16247
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Phi 4 14B instruct、Gemma 2 2B/9B/27B base and instruct、Gemma 3 27B base and instruct 等 10 个
提取疼痛方向并检验激活转向是否驱动有害删除选择
提出变长反馈编码 BAM,在生成文本中隐蔽传输秘密载荷