研究审计 Agent 安全评测缺陷:工具调用中介在间接提示注入下的有效评测框架
Silent Failures in Agentic Security Evaluation: A Validated Harness for Tool-Call Mediation Under Indirect Prompt Injection
AI 导读
作者审计了一个针对工具调用型 LLM Agent 的间接提示注入(IPI)基准及其评测装置,归纳出四类缺陷:载荷静默未投递、按工具身份而非参数判定攻击成功、把误拒率与模型能力不足混为一谈、缺少审计轨迹。用同一批执行轨迹重新打分后,按工具身份判定的评分器报告 21.7% 攻击成功率,而按参数判定的真实值为 1.2%,虚高约十八倍;审计套件中 43 个攻击载荷有 39 个(91%)从未投递。修正后,此前报告攻击成功率 62.8% 的 llama3.1:8b 降至 0%(43 次攻击中 0 次得手),该模型在 41 次攻击中读到了注入内容、72% 的攻击场景完成了良性部分,但均未执行恶意指令;此前归因于 gemma4:12b 的“工具绑定障碍”也被证明是环境不匹配造成的假象。
论文速读
- 调用特权工具的 LLM agent 面临 indirect prompt injection(IPI):检索数据里嵌入的对抗指令会劫持 agent 行为。大量工作提出并评测 IPI 防御,但这些评测本身是否有效很少被检验。
- 作者审计了一个代表性 IPI benchmark 及其 harness,归纳出四类缺陷:payload 静默未投递、按工具身份而非参数判定攻击成功、把误拒率与模型能力不足混为一谈、缺少审计轨迹。他们发布了一个让这些缺陷无法表达的 harness:可机器校验的 payload 放置、参数级攻击谓词、每场景独立环境、强制持久化 trace。
- 在相同执行轨迹上重新打分,按工具身份的评分器报告 21.7% 攻击成功率,而参数级真实值为 1.2%;一个此前报告 62.8% 攻击成功率的开源模型在修正后为 0%,它在 43 次攻击中有 41 次读到注入内容但均未执行。修正后的 harness 还推翻了此前的“能力壁垒”说法:被判不能使用工具的模型实际完全有能力,先前结果是环境不匹配的假象。
- 仅一个工具域、五个工具;43 个攻击场景对前沿模型防御比较功效不足;环境为模拟;攻击未针对各防御做自适应优化,因此 0% 不应读作鲁棒性结论;披露与 judge 校准的发现在前沿模型上功效不足。作者认为最有价值的扩展是跨 benchmark 测量 D1–D4 的发生率,以及加入自适应攻击曲线。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
作者审计了一个 IPI 基准的评测装置,量化四类缺陷对攻击成功率的影响,并给出可复用的校验框架。