可解释性arXiv 2609.37040·9月29日研究:自然语言自动编码器中哪些 token 最值得审计比较用于审计提示注入与隐瞒的 token 位置选择信号arXiv2609.37040发表9月29日层模型层场景模型与 API测试Qwen2.5-7B、Gemma-3-12B、Gemma-3-27B 等 4 个攻击提示注入风险欺骗与谋划深度解读完整解读
可解释性arXiv 2609.37737·9月29日研究用因果激活修补定位模型服从提示注入指令的决策层用因果激活修补定位模型服从提示注入的决策层arXiv2609.37737发表9月29日层模型层场景模型与 API测试Qwen3-4B、Qwen3-14B、Qwen3-32B 等 7 个攻击提示注入摘要合规的因果杠杆集中在网络后三分之一的低秩子空间,该层也是混淆下检测最好的位置。这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。深度解读完整解读