可解释性arXiv 2609.37040
研究:自然语言自动编码器中哪些 token 最值得审计
比较用于审计提示注入与隐瞒的 token 位置选择信号
- arXiv
- 2609.37040
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen2.5-7B、Gemma-3-12B、Gemma-3-27B 等 4 个
比较用于审计提示注入与隐瞒的 token 位置选择信号
用因果激活修补定位模型服从提示注入的决策层
这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。