可解释性arXiv 2609.24801·9月22日研究用 XAI 归因分析 Prompt Guard 2,同义词替换可翻转其提示注入判定用词级归因指导同义词替换,翻转提示注入检测并验证越狱arXiv2609.24801发表9月22日层提示层场景模型与 API测试Prompt Guard 2 (86M)、Llama 3.1 8B防御检测与过滤攻击检测规避技术梯度与表征优化组件护栏与评审+1+1摘要作者称检测靠分散的词法线索。深度解读完整解读