特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent
Defusing Explosive Prompts: Understanding and Preventing Trigger-Based Prompt Injections in LLM Agents
AI 导读
特拉维夫大学研究者提出爆炸性提示词(explosive prompt),一种把恶意载荷写成条件语句、在攻击者选定的触发词出现前保持休眠的间接提示注入形式,无需训练即可在推理时植入单条检索内容。在 896 对配对样本上,同一恶意目标改为休眠条件式后,在拒绝直接指令的前沿模型上仍能触发真实工具调用,Grok-4.20 从 0.0% 升至 34.2%,Llama-3.1-70B 从 0.1% 升至 26.1%,七款模型配对均值 16.5% 对 2.4%。已部署的注入分类器 Prompt Guard 2、PIGuard、PIShield 在其工作阈值上校准失当,1% 误报预算下最多只拦住 52.7%;偏好优化模型 SecAlign 完全阻断直接注入,却仍执行 11.8% 的爆炸性提示词,且全部在触发轮触发。
论文速读
- 间接提示注入(IPI)通常在代理读取内容时立即触发。作者提出“explosive prompt”:把恶意载荷写成条件式,潜伏到攻击者选定的触发条件(如用户说“thanks”)出现时才执行,从而获得注入与执行的时间分离。
- 用组合式生成器把越狱、条件词、触发器和载荷拼成条件式提示,与同一目标的命令式 IPI 配对,在 AgentDojo 上做真实多轮工具执行实验;并测试九款生产代理、三种已部署注入分类器和七个基础模型,另提出轻量检测器 DeFuse。
- 在七个模型上,条件式提示的执行率均不低于命令式(配对均值 16.5% vs 2.4%),在拒绝命令式的模型上最高达 34.2%,且几乎都在触发轮才触发;九款生产代理中成功率 43–83%,命令式基线至多 3%;已部署分类器在阈值下漏检,SecAlign 仍执行 11.8%。用生成器数据重训后,编码器类检测器把攻击成功率从 34.3% 降到 7.5–8.1%,DeFuse 在 5% 误报预算下为 3.0%,AUC 0.9994,延迟 1.16 ms/文档。
- 生产应用结果仅 n=30,属可行性估计;模型与工具套件范围有限;DeFuse 只针对条件式表层结构,未针对会改写条件的自适应攻击者加固,且需按文档长度调整阈值;实验只覆盖两轮会话,载荷能否在更长会话中存活尚未验证。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
论文把条件触发式提示注入与普通注入做了配对实测,并给出九款生产 Agent 的绕过率,部署 Agent 的团队可据此检查检索内容的摄入环节。