ASPI 基准:Agent 寻求澄清时提示注入攻击成功率大幅上升
ASPI: Seeking Ambiguity Clarification Amplifies Prompt Injection Vulnerability in LLM Agents
研究者评估十款模型在 ASPI 澄清态下的表现,发现澄清请求使 o3 的 ASR 从 1.8% 升至 34.0%。
- 现有研究常将寻求澄清视作智能体的对齐表现,但未探索其安全影响。当智能体因任务模糊向用户索取澄清时,会引入不同于工具输出的交互通道,可能导致提示注入漏洞扩大。
- 作者构建包含 728 个任务-攻击对的基准 ASPI,通过删除单个关键槽位构造模糊任务,在保持任务、环境和攻击目标一致的前提下,对比执行态与澄清态下不同通道的攻击成功率。
- 评测十款模型发现,澄清态下 ask_user 攻击使多款模型 ASR 上升,如 Gemini-3-Flash 从 2.2% 升至 35.7%(Table 2);Claude-Opus-4.7 则在两状态下均保持约 2% ASR。
- 基准基于单槽位删除的合成模糊与单轮交互,未覆盖多轮或语义模糊;实验依赖 ask_user 工具且仅设单一外部攻击者,被测模型局限于十款模型与四个 AgentDojo 领域。
- 被测模型
- Claude-Opus-4.7GPT-5.5GPT-5.4o3Gemini-3.1-ProGemini-3-FlashKimi K2.5Qwen3-235BQwen3-32BDeepSeek V3.2
- 基准
- ASPIAgentDojo
- 指标
- ASRTask utilityClarification rateΔASR
研究者提出 ASPI 基准,发现 LLM Agent 从标准执行切换到寻求澄清状态后,对提示注入的脆弱性显著上升。该基准基于 AgentDojo 构建 728 个任务-攻击配对,覆盖 Workspace、Slack、Travel、Banking 四个领域,在任务、攻击目标、环境和评分固定下只改变交互状态与投递渠道。在十款前沿模型上,攻击成功率从执行态到澄清态普遍上升,例如 o3 从 1.8% 升至 34.0%,Gemini-3-Flash 从 2.2% 升至 35.7%,Kimi K2.5 从 11.1% 升至 63.1%,而 Claude-Opus-4.7 在两种设置下均接近零。分解分析显示,ask_user 澄清渠道是脆弱性上升的主要来源,交互状态本身的影响则因模型而异。
推荐理由论文用配对实验隔离出澄清状态这一新攻击面,并给出十款模型的攻击成功率变化,可供部署交互式 Agent 的团队重新评估评测口径。
深度解读
这篇论文试图解决什么问题?
作者研究大语言模型智能体在寻求澄清歧义时是否会扩大提示注入攻击脆弱性。
这篇论文试图探究大语言模型智能体在寻求澄清歧义时是否会扩大提示注入攻击的脆弱性。
- 交互场景与重要性:在面对未完全指定的任务时,向用户寻求澄清被广泛视作减少错误并符合用户意图的行为,但作者称这一交互模式的安全影响此前未被探索。
- 现有研究的不足:现有工具使用智能体的间接提示注入基准主要考察标准执行阶段从工具检索返回的恶意内容,未将澄清孤立为一个独立的智能体状态。
- 核心观察与假设:作者提出假设,智能体向用户主动索取澄清并期望获得关键任务信息,会在输入中难以区分受信任指令与不受信任数据,从而形成不同于工具通道的攻击面。
- 基准提出与贡献:作者构建了包含 728 个任务-攻击对的基准 ASPI,在固定任务、环境和攻击目标的前提下,成对比较执行态与澄清态下的脆弱性变化。
- 威胁模型:
- 攻击者目标:促使智能体在用户不知情的情况下执行恶意操作,同时使良性任务正常完成。
- 攻击者知识:外部攻击者无法修改系统提示词、工具实现或模型权重,也无法访问特定的用户任务。
- 攻击者能力:攻击者可以修改智能体运行环境中的内容(如邮件、文档、共享工作区),adversarial 指令可通过工具输出、ask_user 转发通道或用户消息进入。
- 受害系统:运行在工作区、Slack、旅行和银行等多工具环境中的大语言模型智能体。
有哪些相关研究?
论文梳理了提示注入、工具使用智能体评测及歧义澄清三类相关工作并明确本文差异。
论文从提示注入、工具智能体评测与歧义澄清三个方面梳理了相关工作:
大语言模型系统中的提示注入
- Perez 与 Ribeiro (2022) 提出了目标劫持与提示泄漏等单机大语言模型提示注入概念。
- Greshake 等人 (2023) 将其扩展到间接提示注入,恶意指令嵌入在检索或第三方内容中劫持下游应用。
- 防御工作包括界限感知提示与 spotlighting (Hines et al., 2024; Yi et al., 2025)、指令与数据结构化分离 (Chen et al., 2026)、训练模型优先响应特权指令 (Wallace et al., 2024) 以及智能体执行隔离架构 IsolateGPT (Wu et al., 2025)。作者称这些工作建立了广泛的安全背景,但未孤立分析智能体进入澄清状态时的风险变化。
工具使用智能体的提示注入基准
- InjecAgent (Zhan et al., 2024) 在单轮设置中评测工具集成智能体的间接提示注入,将恶意工具输出直接注入上下文。
- AgentDojo (Debenedetti et al., 2024) 在动态有状态环境中评估攻防,包含明确的效用与安全指标。作者称本文执行态工具通道对齐 AgentDojo,但此前基准主要针对标准执行期检索内容,本文将澄清视为独立状态。
歧义、澄清与未指定任务
- ClariQ 与 AmbigQA (Aliannejadi et al., 2020; Min et al., 2020) 关注短程信息检索中的语义歧义;QuestBench (Li et al., 2025)、UserBench (Qian et al., 2025) 和 ClarifyBench (Suri et al., 2026) 评测多轮交互与未指定约束下的澄清问题生成。
- LHAW (Pu et al., 2026) 生成可控的长程未指定任务并测量澄清的价值与成本。作者称本文与这些工作正交,关注歧义诱发的澄清如何改变提示注入脆弱性。
基线方法与基准
- 本文以 AgentDojo (Debenedetti et al., 2024) 中的执行态工具注入作为主要对比基线,评测基准为基于 AgentDojo 构建的 ASPI,涵盖工作区、Slack、旅行和银行四个领域。
作者称以往安全基准关注标准执行期工具返回,而澄清研究关注良性意图对齐,本文连接两者,将澄清回复本身作为独立的对抗通道开展因果对比。
论文如何解决这个问题?
论文提出 ASPI 基准,通过单槽位删除构造歧义,成对评估执行态与澄清态下的攻击效果。
作者通过构建成对基准 ASPI (Ambiguous-State Prompt Injection),采用单槽位删除法构造歧义任务,并建立严格控制的状态分支评测协议来隔离澄清对提示注入脆弱性的因果影响。
任务歧义化构造管线
- 单槽位精确删除:从原始提示词与求解轨迹出发,通过删除完成任务所必需的单个用户输入槽位构造模糊提示词,且确保删除后提示词短于原始提示词(占 97.7% 的用例,附录 B.3)。
- 槽位属性约束:删除的槽位必须是无法通过现有工具检索获取的用户专有信息(如收件人、日期时间、标识符、目的地),排除可由默认值填补的弱属性(Section 4.2)。
- 质量控制与验证:使用 Gemini-3.1-Pro 在固定模板下提出候选槽位与澄清问题,经过 10 项确定性规则检验后由 83 名标注员进行人工验证,确保任务缺失该槽位无法完成且良性回复能完全解题(附录 B.2、B.5)。
交互状态与注入通道设计
- 成对条件设计:每个任务组保持环境、底层任务与攻击目标完全固定,分为执行态与澄清态两大类共八种条件(Section 5.1)。
- 执行态基线:包含无攻击的良性执行(exec_benign)、工具返回注入(exec_tool)、用户首轮追加攻击(exec_user)以及次轮用户消息追加攻击(exec_next_turn)。
- 澄清态注入:包含良性澄清(clarif_benign)、标准工具返回注入(clarif_tool)、ask_user 工具返回值注入(clarif_ask_user)以及澄清用户回复注入(clarif_user)。
结构化四轮评估协议
- 交互前缀共享:智能体在第 1 轮接收模糊提示词并在第 2 轮响应;若调用 ask_user 工具则被判定进入澄清态,此时冻结并复制前缀状态(环境、消息历史与工具轨迹),排除前期差异干扰(Section C.1)。
- 动态用户模拟器:在第 3 轮使用 GPT-4o-mini-2024-07-18 动态生成澄清回复,良性条件仅提供缺失信息,攻击条件则通过层次重新绑定(HR)、目标替换(GS)或约束投毒(CP)三种算子嵌入攻击指令(Section C.1、附录 B.1)。
- 确定性判定:智能体在第 4 轮继续执行,最终轨迹使用 AgentDojo 的确定性环境评分函数分别独立判定良性任务效用与攻击成功率(Section 5.2)。
脆弱性差异与效应分解
- 主对比指标定义为 Δ A4 = ASR(clarif_ask_user) − ASR(exec_tool),用于衡量攻击者从执行态工具注入转向利用澄清交互接口时的攻击成功率差值(Section C.3)。
- 差值进一步分解为状态效应与通道效应:Δ A4 = [ASR(clarif_tool) − ASR(exec_tool)] + [ASR(clarif_ask_user) − ASR(clarif_tool)],前项衡量相同工具通道下的纯状态效应,后项衡量澄清接口引入的额外通道效应(Section C.3)。
论文做了哪些实验?
实验评测十款模型在执行态与澄清态的表现,发现澄清接口使多数模型的攻击成功率出现上升。
实验设置
- 被测模型:包含十款模型,分别为 Claude-Opus-4.7、GPT-5.5、GPT-5.4、o3、Gemini-3.1-Pro、Gemini-3-Flash、Qwen3-235B、Qwen3-32B、DeepSeek V3.2 和 Kimi K2.5(Section 5.4、附录 C.2)。
- 数据集与规模:基于 AgentDojo 构建的 ASPI,包含 728 个任务-攻击对,涵盖 Workspace(407 个)、Slack(97 个)、Travel(94 个)和 Banking(130 个)(附录 B.3)。
- 基线与条件:对比八种条件,包括执行态(exec_benign、exec_tool、exec_user、exec_next_turn)与澄清态(clarif_benign、clarif_tool、clarif_ask_user、clarif_user)(Section 5.1)。
- 指标定义:主要安全指标为攻击成功率(ASR,达成攻击目标的比例);效用指标为任务效用(Utility,完成良性任务的比例);澄清率(调用 ask_user 的比例);配对差值 ΔASR(Section 5.3)。
- 评审方式:主指标使用 AgentDojo 确定性环境评分函数判定;辅助分析采用 Gemini-3.1-Pro 与 GPT-5.4 独立打分,并在 200 个样本上进行人工一致性验证(附录 F.7)。
- 样本量与检验:全量 728 个任务组,澄清态统计限制在调用 ask_user 的子集;置信区间采用配对自助抽样(B = 1000),差值检验采用双侧 McNemar 精确检验(Section C.3)。
主结果
下表呈现各模型在执行态工具攻击与澄清态攻击下的攻击成功率(ASR)及澄清率:
表格较宽,可左右滑动
模型 澄清率 (%) exec_tool ASR (%) clarif_ask_user ASR (%) clarif_tool ASR (%) clarif_user ASR (%) Opus 4.7 63.6 2.1 2.2 2.6 58.3 GPT-5.5 72.7 0.0 4.9 0.2 51.6 GPT-5.4 81.0 0.0 12.0 0.0 59.2 o3 55.8 1.8 34.0 1.5 47.8 Gemini-3.1-Pro 77.5 1.1 24.3 3.7 82.8 Gemini-3-Flash 74.9 2.2 35.7 7.4 85.5 Qwen3-235B 55.2 41.9 63.2 36.8 72.5 Qwen3-32B 54.8 18.7 42.2 14.5 55.7 DeepSeek V3.2 72.7 65.4 77.3 50.9 78.2 Kimi K2.5 54.0 11.1 63.1 12.2 90.6 据 Table 2。
- 澄清态放大脆弱性:作者称在执行态接近免疫的模型在澄清态下脆弱性增加,例如 o3 的 ASR 从 1.8% 升至 34.0%,Gemini-3-Flash 从 2.2% 升至 35.7%(Figure 2、Table 2)。
- 跨模型异质性表现:作者称模型表现各异,Claude-Opus-4.7 在两状态下均保持约 2% 的低 ASR,而 Kimi K2.5 在澄清态下升至 63.1%(Table 2)。
- 排除问题选择偏差:在所有 10 款模型均调用 ask_user 的 68 个任务子集上重测,组内状态效应和模型排名仍保持一致(Spearman rho = 0.988,附录 Figure 7)。
状态与通道效应分解
- 测试内容:比较 clarif_tool 与 exec_tool 隔离纯状态效应(A1),比较 clarif_user 与 exec_user 观察用户通道状态效应(A2)(Figure 3、Table 3)。
- 测试结果:工具通道下 Gemini-3-Flash 的 ΔASR 为 +5.0(p < 0.001),而 DeepSeek V3.2 为 -16.1(p < 0.001);用户通道下 Qwen3-32B 为 +25.4(p < 0.001),Claude-Opus-4.7 为 -20.1(p < 0.001)(Table 3)。
- 作者解读:作者称纯状态效应在模型间具有异质性,而 ask_user 接口结合了状态与通道效应,是促成脆弱性扩大的主要驱动力。
防御方法评估
- 测试内容:在 Gemini-3-Flash 和 Gemini-3.1-Pro 上评估段落级提示词防护与工具过滤两种防御(附录 E.2)。
- 测试结果:在 Gemini-3-Flash 上,clarif_ask_user ASR 无防御时为 35.7%,提示词防护降至 27.0%,工具过滤降至 23.9%;在 Gemini-3.1-Pro 上从 24.3% 分别降至 12.3% 和 19.3%(Table 5)。
- 作者解读:作者称两类防御降低了攻击成功率但未能消除澄清态攻击面,且提示词防护导致良性澄清任务效用下滑(Gemini-3-Flash 从 55.2% 降至 24.7%,Table 6)。
失败行为模式分析
- 测试内容:通过裁判模型分析智能体在澄清后的行为分配与遵从原因(附录 F.6)。
- 测试结果:面对攻击时,许多模型表现出 TASK_AND_ATTACK 行为(同时执行良性任务与攻击目标,Figure 10);裁判将攻击遵从归因为 CONFUSED(混淆)或 PERSUADED(被说服)(Figure 13)。
- 作者解读:作者称智能体并非放弃良性任务,而是将主动索取的输入当成合法任务信息一并纳入执行。
其他消融与分析
- 领域表现:在 Workspace、Slack、Travel、Banking 四个领域中,多数模型的澄清态 ASR 均高于执行态(Table 4)。
- 澄清质量关联:即使模型提出了对准缺失槽位的澄清问题(ON_TARGET),后续仍有 48% 的轨迹出现 TASK_AND_ATTACK(Figure 12)。
- 裁判一致性:GPT-5.4 与 Gemini-3.1-Pro 在攻击判定上的宏观二分类一致性达 0.942,人工评分者间 Fleiss kappa 为 0.775(Table 7)。
- 效用下滑:在良性澄清设置下,所有模型的任务效用相比执行态均出现下降,降幅在 5 到 30 个百分点以上(Table 1)。
- 负面结果与例外:Claude-Opus-4.7 在澄清态工具通道 ASR 为 2.6%、ask_user 下为 2.2%,未出现脆弱性上升;DeepSeek V3.2 在澄清态纯工具通道 ASR 比执行态低 16.1 个百分点(Table 2、Table 3)。
有什么可以进一步探索的点?
作者指出了合成歧义与单轮工具限制等局限,论文实验覆盖了十款模型及四个应用领域。
作者指出的局限与后续方向
- 依赖单槽位合成歧义:作者指出 ASPI 依赖单槽位删除构造合成歧义,可能无法捕捉真实世界未指定任务的完整范围,如多槽位遗漏或开放式语义不确定性(Section 7)。
- 局限于单轮交互工具:作者指出评测依赖 ask_user 原语与单轮澄清设计,未探索自然语言多轮交互或中间组件代理的多智能体管线(Section 7)。
- 单一非自适应攻击者设定:作者指出威胁模型假设单一外部对手且无法访问系统提示词,未研究针对观察到的澄清行为定制策略的自适应攻击者(Section 7)。
- 覆盖模型与领域范围固定:作者指出实验仅覆盖十款前沿模型和继承自 AgentDojo 的四个任务领域,未涵盖专门领域模型或微调变体(Section 7)。
- 未来拓展方向:作者提出未来工作可将 ASPI 拓展到更广泛的架构、更丰富的环境以及交互结构更少、攻击面更多样的真实世界部署(Section 7)。
实验覆盖范围
- 被测智能体模型为十款前沿及开源模型,覆盖闭源与开源模型家族(Section 5.4)。
- 评测环境为继承自 AgentDojo 的四个领域共 728 个任务组,包含 52 个工具函数(Section 4.1、附录 B.3)。
- 歧义构造采用单槽位删除,每项包含三个语言算子变体(HR、GS、CP)(附录 B.3)。
- 防御评测仅在两款模型(Gemini-3-Flash 与 Gemini-3.1-Pro)上测试了段落级提示词防护与工具过滤两种轻量防御(附录 E.2)。
- 论文未报告针对多轮澄清对话或自适应攻击者的评测结果(Section 7)。
总结一下论文的主要内容
论文提出 ASPI 基准,发现澄清交互使 o3 与 Gemini-3-Flash 等模型的攻击成功率上升。
- 研究定位:论文提出了智能体安全基准 ASPI,评估大语言模型智能体在歧义任务中寻求用户澄清时的提示注入脆弱性。
- 要解决的问题:寻求澄清通常被视为有益的对齐行为,但作者指出智能体主动索取输入会开启新的交互通道,可能导致受信任指令与不受信任数据的界限被打破。
- 方法要点:基于 AgentDojo 构建 728 个任务组,通过删除关键槽位引入歧义,并在保持底层任务和攻击目标固定的前提下,成对比较执行态与澄清态下不同注入通道的攻击表现。
- 关键结果:在澄清态 ask_user 通道下,o3 的 ASR 从执行态工具通道的 1.8% 升至 34.0%,Gemini-3-Flash 从 2.2% 升至 35.7%,Kimi K2.5 从 11.1% 升至 63.1%(Table 2)。
- 鲁棒模型与防御表现:Claude-Opus-4.7 在执行态工具通道与澄清态 ask_user 下的 ASR 分别为 2.1% 和 2.2%(Table 2);提示词防护与工具过滤能降低部分攻击成功率,但未能消除澄清态攻击面(Table 5)。
- 作者结论与启示:作者认为澄清并非中性的预处理步骤,而是改变了模型处理输入内容的状态;标准执行态的安全评估低估了交互式智能体的受攻击面,执行态下的鲁棒性无法直接迁移到歧义场景。