研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现
作者在两个智能体基准上评估15个提示注入检测器,发现基准排名迁移性弱且误报常使任务中断,训练输入形态决定检测效果。
- 95.1%PIGuard 在 BIPIA 测试集上 1% FPR 下的 TPR(Table 2)
- 2.1%PIGuard 在 AD-Matched 上 1% FPR 下的 TPR(Table 2)
- 82.2%Horizon-Labs 在 AD-Matched 上 1% FPR 下的 TPR(Table 2)
公开基准评测难以反映提示注入检测器在智能体真实工具输出下的检测率与误报代价,基准排名存在迁移偏差。
研究涵盖注入检测评测方法、安全实证缺陷、检测防御及多层防护,作者强调现有评测忽视了工具输出形态与训练数据泄漏。
通过无模型重放生成良性输出、环境差异重放标注注入、审计训练集重合,在低误报率运行点下度量检测表现。
评测15个检测器与2个评审模型,发现基准间检测排名不相关,训练集形态决定效果,移除格式可降低默认误报。
作者指出当前局限在于模拟环境、静态模板、检测器覆盖度及评审设计;实验覆盖了15个分类器与2个智能体基准。
论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。