跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.24801· Fernando Outeda·· 10 天前

研究用 XAI 归因分析 Prompt Guard 2,同义词替换可翻转其提示注入判定

Decoding Guardrails: XAI-Guided Perturbation Analysis of Prompt Injection Detection

AI 导读

研究以可解释性方法分析分类器护栏 Prompt Guard 2 如何区分恶意与良性提示词。作者用 Vanilla Gradient 和 SHAP 归因开展四项实验,发现其判定依赖大量 token 的累积贡献而非少数主导 token,但依据显著性做同义词替换和句子级改写,只需改动中等比例文本即可翻转预测,部分情况下还成功越狱底层大语言模型。数据集规模的显著性分析显示,未被检出的注入提示词系统性地缺少分类器依赖的词汇标记。作者据此讨论分类器护栏的设计与评估,并指出用于提升透明度的解释方法同时也会降低构造对抗绕过的成本。

阅读原文arxiv.org