研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现
重评提示注入检测器,检验基准分数对智能体部署的预测力
- 研究定位:评估主流提示注入检测器在智能体工具输出环境下的真实防御效能,检验公开基准分数是否具备跨环境预测力。
- 核心问题:现有基准使用非结构化文本且存在数据重合,导致评测得出的高分无法反映检测器在智能体工具输出中的表现与误报阻断代价。
- 评测方法:基于无 LLM 的真实调用重放构建良性工具输出,结合环境差异重放构建并标注注入样本,在 1% FPR 运行点下对比 15 个检测器与 2 个 LLM 评审,并审计训练集重合。
- 关键实验发现:基准间检测排名缺乏显著迁移性(相关系数 0.01 至 0.31),在 BIPIA 达 95.1% 检出率的 PIGuard 在 AgentDojo 仅检出 2.1%;而在无数据重合但采用智能体风格数据训练的 Horizon-Labs 检出率达 82.2%(AgentDojo)与 100.0%(τ-bench);同时检测器在工具输出上的误报率高达 0% 至 90% 以上,可导致高达 69.1% 的良性任务中断。
- 机理与启示:检测器的有效性高度依赖于输入数据形态与训练集的相似度,而非对注入指令本身的通用理解;针对智能体部署的检测防御应在真实工具输出上以低误报率为基准进行评测,并严格审计训练数据泄漏,将检测器作为纵深防御中的过滤层使用。