可解释性arXiv 2609.37040·9月29日研究:自然语言自动编码器中哪些 token 最值得审计比较用于审计提示注入与隐瞒的 token 位置选择信号arXiv2609.37040发表9月29日层模型层场景模型与 API测试Qwen2.5-7B、Gemma-3-12B、Gemma-3-27B 等 4 个攻击提示注入风险欺骗与谋划深度解读完整解读