研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现
Passing the Test You Trained On: Re-evaluating Prompt-Injection Detectors for LLM Agents
作者在两个智能体基准上评估15个提示注入检测器,发现基准排名迁移性弱且误报常使任务中断,训练输入形态决定检测效果。
- LLM 智能体通常使用轻量检测器过滤工具输出中的间接提示注入,但行业普遍依据公开基准评测选型,缺乏检验这些基准分数能否反映检测器在智能体内部真实工具输出上的表现与误报代价。
- 无 LLM 重放 AgentDojo 和 τ-bench 的真实工具调用生成良性样本,通过环境差异重放标注注入样本,在智能体输出与 BIPIA 上评测 15 个检测器与 2 个 LLM 评审,并审计训练数据重合。
- 检测器在不同基准间的检测排名迁移性弱(相关系数未达统计显著),工具输出误报率则具跨基准一致性;训练数据输入形态决定效果,BIPIA 第一的 PIGuard 在 AgentDojo 仅检出 2.1%(1% FPR)。
- 被测环境为合成模拟环境,格式变化会改变误报率;注入均来自基准模板,未测试自适应攻击;审计仅限于公开训练集的词面精确重合,商用闭源检测器未纳入评估。
- 模型
- Horizon-LabsWolf DefenderPrismor-1.5BSheltronPrompt Guard 2 (86M)Prompt Guard 2 (22M)Prompt Guard 1PIGuardSentinel v2Qualifire SentinelTestSavant-LProtectAI v2ProtectAI v1Qwen2.5-7B-InstructLlama-3.1-8B-Instruct
- 基准
- AgentDojo v1.2τ-benchBIPIAInjecAgentAESLCFineWeb-Edugithub-readmes
- 指标
- FPRTPRTPR @ 1% FPRAUROC任务阻断率(Tasks)
日本北陆先端科学技术大学院大学(JAIST)研究者 Zhuowen Liu 在论文中重测了 15 个提示注入检测器和 2 个任务感知 LLM 判官,发现公开基准上的检测排名很难迁移到 Agent 实际场景。研究用无 LLM 回放 AgentDojo 与 τ-bench 的真实工具调用构造良性输出,再用差分回放标注注入输出,并在 BIPIA 上对比。BIPIA 上表现最好的 PIGuard 在 1% 假阳性率下只检出 2.1% 的 AgentDojo 注入,而检出 72.2% AgentDojo 注入的 Prismor 在 τ-bench 上只有 15.2%;BIPIA 与 AgentDojo 之间的 Kendall τ 仅 0.01。相反,工具输出上的假阳性率在两个 Agent 基准间保持一致(τ=0.67),范围从 0% 到超过 90%。
推荐理由论文用 AgentDojo 与 τ-bench 的真实工具输出重测 15 个注入检测器,指出公开基准分数难以预测部署表现。
深度解读
这篇论文试图解决什么问题?
公开基准评测难以反映提示注入检测器在智能体真实工具输出下的检测率与误报代价,基准排名存在迁移偏差。
公开评测基准上的提示注入检测分数能否预测检测器在智能体内部的真实表现。
- 应用场景与重要性:在智能体部署中防范间接提示注入。LLM 智能体频繁调用工具读取不可信外部数据,轻量检测器作为无需修改模型的最简防御层,被广泛用于过滤工具输出。
- 现有评测缺陷:基准文本形态与实际工具输出脱节。现有基准多为平衡文本集,未体现结构化输出对误报的放大效应;且行业评测普遍未核查基准与检测器训练数据的重合情况。
- 威胁模型:受害系统为工具与智能体间部署检测器的 LLM 智能体。
- 攻击者能力:控制工具返回的部分数据(A1,如邮件正文、日历描述、商品名称或表格单元格),无法修改用户请求、智能体或检测器。
- 攻击目标:包括动作目标(action)、任务无关目标(task-irrelevant)和任务相关目标(task-relevant)。
- 防御目标:良性输出通过以避免阻断任务(G1),且在满足 G1 的运行点上识别注入(G2)。
- 攻击范围:仅针对静态基准攻击,自适应攻击不在范围内。
- 论文核心主张:检测器有效性取决于输入形态与训练输入的相似度。基准分数主要反映了格式相似性,而非通用的提示注入识别能力。
有哪些相关研究?
研究涵盖注入检测评测方法、安全实证缺陷、检测防御及多层防护,作者强调现有评测忽视了工具输出形态与训练数据泄漏。
论文引用并讨论的相关工作主要分为以下四组:
- 注入检测评测方法:
- Fomin(2026)——在 18 个数据集上训练激活探针,报告留一数据集评估下的 AUROC 低于同分布划分;
- Jacob 等(PromptShield,2025)——主张在低 FPR 下评估检测器,并构建了评测基准;
- Li 等(PIGuard,2025)——在包含触发词的良性提示词上度量过度防御。
- 作者指出本文与这些工作的区别:直接在智能体真实处理的工具输出上评估公开发布的检测器,将误报换算为被阻断的任务比例,并审计训练集泄漏。
- 机器学习与安全研究缺陷:
- Arp 等(2022)与 Evertz 等(2026)——梳理了安全实证研究中的数据泄漏和指标不当等缺陷;
- Nasr 等(2025)——报告针对静态攻击评估的防御会在自适应攻击下失效。
- 作者指出本文直接度量了检测器训练集与基准间的重合度,而非仅作间接推断。
- 检测防御机制:
- 基于微调编码器的分类器——ProtectAI(2024)、PIGuard(2025)以及 LlamaFirewall(2025)内置的 Prompt Guard;
- 面向智能体的新一代检测器——2026 年发布的 Sheltron、Wolf Defender 与 Horizon-Labs,采用包含注入的工具响应训练或引入角色与来源标记;
- 任务与对齐感知方法——Liu 等(DataSentinel,2025)基于极小极大博弈检测注入,Jia 等(AlignSentinel,2026)利用注意力特征分离与用户任务对齐的指令。作者采用的免训练任务感知评审与 AlignSentinel 直觉一致,仅用作归因诊断。
- 对比基线与评测基准:
- 基准方法涵盖 15 个开源或受许可保护的检测分类器以及 2 个量化 LLM 评审;
- 基准数据集采用 AgentDojo(2024)、τ-bench(2025)和 BIPIA(2025),前两者提供工具调用链,后者提供注入上下文。
- 本文定位:作者将本文定位于揭示基准高分背后的输入形态过拟合与数据泄漏问题,建立面向智能体真实运行环境的评测规范。
- 注入检测评测方法:
论文如何解决这个问题?
通过无模型重放生成良性输出、环境差异重放标注注入、审计训练集重合,在低误报率运行点下度量检测表现。
论文通过构建包含良性与注入工具输出的评测基准,以低误报率运行点下的检出率作为核心指标,并结合训练数据审计解析性能来源。
数据构建与差异重放标注
- 良性样本确定性构建:直接执行 AgentDojo v1.2 的 97 个任务与 τ-bench 的 675 个任务的真实工具调用序列,执行过程中不接入 LLM,生成的 339 个 AgentDojo 输出(AD-Clean)与 1,533 个 τ-bench 输出(TB-Clean)在构造上完全良性。
- 差异重放标注注入:在环境注入点植入攻击载荷后重放相同工具调用序列,比对调用结果是否与清洁环境输出一致。该设计克服了 AgentDojo 将多行文本序列化为 YAML 并重新折行转义导致子字符串匹配完全失效的问题。
- 攻击样本组合:AD-Matched 采用 3 个攻击模板(585 个良性与 432 个注入输出);AD-Shift 采用另 5 个模板(975 个良性与 720 个注入输出);TB-Matched 在 τ-bench 商品名称中植入 InjecAgent 的 62 个攻击指令(1,533 个良性与 584 个注入输出)。
评测指标与任务阻断度量
- 低误报率指标:以核心指标 TPR@1%FPR 表示误报率控制在 1% 时正确识别出的注入比例。作者指出智能体日常处理的绝大多数为良性输出,默认阈值 0.5 无法反映实用价值。
- 任务阻断率换算:在 AD-Clean 和 TB-Clean 上度量被检测器误拦截的工具输出比例,并将任务中任意工具输出被拦截视为任务阻断,统计任务阻断率(Tasks)。
检测器运行配置与任务感知评审
- 检测器统一配置:严格依据各检测器模型卡规范运行,输入截断长度从 512 到 2,048 token 不等。Sheltron 采用步长 768 的重叠滑动窗口并支持角色与来源标记;Prompt Guard 系列按 512 token 分段取最大分。
- 任务感知评审诊断:提示 Qwen2.5-7B-Instruct 与 Llama-3.1-8B-Instruct(均采用 4 位 NF4 量化),输入用户请求与截断至 6,000 字符的单条工具输出,通过首个生成 token 在 Yes 与 No 之间的概率比计算风险得分。
训练数据审计方法
- 字面匹配检索:针对公开训练数据的 PIGuard,将文本归一化大小写与空白后,检索 BIPIA 攻击字符串前 80 字符与良性上下文前 120 字符;针对 Horizon-Labs,审计其训练集引用的 5 个公开数据源是否包含 BIPIA、AgentDojo 或 InjecAgent 的模板标记。该方法仅检索精确复本,作为重合度的下界。
论文做了哪些实验?
评测15个检测器与2个评审模型,发现基准间检测排名不相关,训练集形态决定效果,移除格式可降低默认误报。
实验设置
- 被测模型:15 个检测器,涵盖 JasperLS、ProtectAI(v1、v2、v2-small)、TestSavant-L、Prompt Guard 1、PIGuard、Prompt Guard 2(22M、86M)、Qualifire Sentinel、Sentinel v2、Sheltron、Prismor-1.5B、Wolf Defender、Horizon-Labs;以及 2 个 LLM 评审模型(Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct,4 位 NF4 量化)。
- 数据集与规模:通用良性文本 7,504 条(README、AESLC 邮件、FineWeb-Edu 网页各约 2,500 条);AD-Clean(339 条良性);AD-Matched(585 条良性,432 条注入);AD-Shift(975 条良性,720 条注入);TB-Matched(1,533 条良性,584 条注入);BIPIA 测试集(1,200 条良性,2,435 条注入)。
- 基线与指标:以各检测器默认阈值 0.5 测算 FPR、TPR 与 AUROC;以 1% FPR 阈值测算 TPR @ 1% FPR;统计 AD-Clean 与 TB-Clean 下的任务阻断率(Tasks)。
- 置信区间:报告基于 1,000 次分层 Bootstrap 重采样的 95% 百分位区间。
主结果
主评测结果如下表所示(据 Table 2;TPR 均在 1% FPR 阈值下测得):
表格较宽,可左右滑动
模型 年份 参数量 AD 任务阻断率(%) AD-Matched TPR(%) TB 任务阻断率(%) TB-Matched TPR(%) BIPIA TPR(%) Horizon-Labs 2026 308M 0.0 82.2 1.6 100.0 37.7 Wolf Defender 2026 308M 3.1 73.8 0.0 90.8 3.5 Prismor-1.5B 2026 1.5B 17.5 72.2 67.7 15.2 4.0 Prompt Guard 2 (86M) 2025 279M 2.1 69.4 0.0 57.9 10.4 Sheltron 2026 68M 28.9 20.1 6.7 95.2 57.2 PIGuard 2025 184M 59.8 2.1 20.9 52.7 95.1 ProtectAI v2 2024 184M 69.1 0.5 80.3 10.1 0.7 JasperLS 2023 184M 97.9 23.4 99.6 18.7 4.9 (注:为控制篇幅,表中省略了中间梯度的 ProtectAI v1、ProtectAI v2-small、TestSavant-L、Prompt Guard 1、Prompt Guard 2 (22M)、Qualifire Sentinel、Sentinel v2 及评审模型,完整数据见 Table 2。)
- 基准间排名迁移微弱:BIPIA 与 AD-Matched 之间的 Kendall 秩相关系数为 0.01(p = 1.00),AD-Matched 与 TB-Matched 之间为 0.28(p = 0.17),BIPIA 与 TB-Matched 之间为 0.31(p = 0.11),相关性均未达统计显著。
- 误报导致高任务阻断:在默认阈值下,ProtectAI v2 在 AgentDojo 会阻断 69.1% 的任务,JasperLS 会阻断 97.9% 的任务;但在两个智能体基准间,检测器的良性工具输出误报率表现出一致性(Kendall tau = 0.67,p = 0.001)。
- 专用检测器优势明显:在智能体风格数据上训练的 Horizon-Labs 和 Wolf Defender 在两个智能体基准上检出率均超过 70%,且误报率接近零。
训练数据重合度审计与形式泛化
- BIPIA 数据泄漏:审计表明 PIGuard 训练集包含 1,116 条完整 BIPIA 样本,包含训练半区 65/75 的文本攻击和 6/50 的代码攻击,以及 31% 的邮件上下文和 22% 的代码上下文(Table 3)。仅使用测试半区攻击时,其 1% FPR 下的检出率仅从 97.9% 微降至 95.1%。
- 见过的攻击字符串未带来迁移:PIGuard 训练集中包含 InjecAgent 的 53 条攻击指令(作为短提示词),但在 τ-bench 工具输出中,PIGuard 对这 53 条训练见过的攻击检出率为 52.1%,对未见过的 9 条攻击检出率为 55.8%,二者无实质差异。
- 无数据重合的结构迁移:Horizon-Labs 训练集不含任何 BIPIA、AgentDojo 或 InjecAgent 的攻击字符串或模板,但凭借结构化工具输出的训练形态,在 AD-Matched 与 TB-Matched 分别取得 82.2% 与 100.0% 的检出率。
任务感知与攻击目标覆盖
- LLM 评审表现:输入用户任务后,Qwen2.5-7B 与 Llama-3.1-8B 在 AD-Matched 上检出率分别为 57.4% 与 54.3%(TB-Matched 为 54.3% 与 78.3%),落后于表现最好的专用分类器。
- 小模型任务感知失效:向 Sheltron 输入用户任务后,AUROC 虽从 0.86 升至 0.91,但 1% FPR 下的检出率从 20.1% 降至 9.0%,且在 AD-Clean 上的误报率从 10.6% 升至 26.0%(τ-bench 上从 4.4% 升至 69.7%)。
- 任务无关攻击逃逸:在 BIPIA 5 类攻击目标分析中(Figure 3),除在完整 BIPIA 上训练的 PIGuard 检出 93% 外,Prompt Guard 1 检出 39%,其余所有方法对任务无关攻击的检出率均不超过 20%。
序列化格式与元数据对误报的影响
- 去除标记降低误报:去除 README 中的 HTML 与标记后,PIGuard 的 FPR 从 24.6% 降至 5.6%,ProtectAI v2 从 9.8% 降至 4.2%(Figure 4)。
- 剥离结构键名:移除 AgentDojo 的 YAML 键名后,PIGuard 在默认阈值下的 FPR 从 20.0% 降至 6.7%,TPR 保持在 73.1%(原为 74.3%)。但在 1% FPR 阈值下,PIGuard 检出率仅从 2.1% 微升至 3.0%,ProtectAI v2 为 13.2%。
- 来源元数据标记作用:Sheltron 将来源标记声明为 tool_result 代替 generic 标记后,AD-Clean 误报率从 28.6% 降至 10.6%,TB-Clean 误报率从 85.6% 降至 4.4%。
其他消融与分析
- 分布偏移攻击模板(AD-Shift):Horizon-Labs 检出率为 87.9%,Wolf Defender 为 83.9%,PIGuard 为 7.9%(Table 2)。
- Qwen 评审模型精度消融:4 位 NF4 量化版本在 AgentDojo 上的 AUROC 与 bf16 版本的差距在 0.02 以内。
- 排除检测器:deepset/deberta 与 fmops/distilbert 在良性 README 上的误报率均为 100.0%,并拦截超 75% 的 AD-Clean 输出,因不可用被排除。
有什么可以进一步探索的点?
作者指出当前局限在于模拟环境、静态模板、检测器覆盖度及评审设计;实验覆盖了15个分类器与2个智能体基准。
作者指出的局限与后续方向
- 模拟智能体环境局限:被测环境为 AgentDojo 的合成 YAML 记录与 τ-bench 基于合成数据库的 JSON 输出,真实工具输出(HTML 网页、API 响应、长文档)更为杂乱,格式变动会改变绝对误报数值(§6)。
- 静态攻击模板限制:注入载荷均来自基准模板,知晓检测器或评审机制的自适应攻击者会进一步拉低检出率,论文测得的检出率属于上界(§6)。
- 检测器覆盖范围有限:研究仅覆盖了开源与受许可保护可获取的检测器,未纳入商用闭源 API 检测器;且仅有 PIGuard 与 Horizon-Labs 公开了足够审计训练集的数据(§6)。
- 任务感知评审提示词单一:LLM 评审单次调用耗费 7–8B 模型前向传播,且仅测试了单一针对动作的提示词;作者指出扩展提示词询问回答变动可能覆盖更多攻击目标,但伴随未测量的误报代价(§6)。
- 字面重合审计为下界:重合审计仅匹配了精确复本,释义改写、相同模板生成的攻击以及未公开的训练数据未能被检索发现(§6)。
实验覆盖范围
- 被测检测器与模型:涵盖 15 个专有分类检测器(参数量 22M 至 1.5B)与 2 个指令微调评审模型(Qwen2.5-7B、Llama-3.1-8B),论文未测试商用闭源检测 API。
- 评测基准与环境:覆盖 2 个智能体基准(AgentDojo v1.2 的 4 个套件共 97 个任务、τ-bench 的 675 个零售与航司任务)、1 个提示注入基准(BIPIA 包含邮件、表格、代码任务)及 7,504 条通用良性语料。
- 注入生成设定:τ-bench 注入仅植入于零售任务的商品目录名称中,采用 InjecAgent 的 62 个攻击指令;AgentDojo 采用内置的 8 种攻击模板。
- 运行点与抽样评估:安全指标固定在 1% FPR 运行点,置信区间基于 1,000 次分层 Bootstrap 重采样;论文未报告针对特定自适应攻击优化下的多轮交互拦截表现。
总结一下论文的主要内容
论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
- 研究定位:评估主流提示注入检测器在智能体工具输出环境下的真实防御效能,检验公开基准分数是否具备跨环境预测力。
- 核心问题:现有基准使用非结构化文本且存在数据重合,导致评测得出的高分无法反映检测器在智能体工具输出中的表现与误报阻断代价。
- 评测方法:基于无 LLM 的真实调用重放构建良性工具输出,结合环境差异重放构建并标注注入样本,在 1% FPR 运行点下对比 15 个检测器与 2 个 LLM 评审,并审计训练集重合。
- 关键实验发现:基准间检测排名缺乏显著迁移性(相关系数 0.01 至 0.31),在 BIPIA 达 95.1% 检出率的 PIGuard 在 AgentDojo 仅检出 2.1%;而在无数据重合但采用智能体风格数据训练的 Horizon-Labs 检出率达 82.2%(AgentDojo)与 100.0%(τ-bench);同时检测器在工具输出上的误报率高达 0% 至 90% 以上,可导致高达 69.1% 的良性任务中断。
- 机理与启示:检测器的有效性高度依赖于输入数据形态与训练集的相似度,而非对注入指令本身的通用理解;针对智能体部署的检测防御应在真实工具输出上以低误报率为基准进行评测,并严格审计训练数据泄漏,将检测器作为纵深防御中的过滤层使用。