MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测
An Experimental Evaluation of Multimodal Prompt Injection Attacks on Agentic AI Frameworks
作者用MMPIBench测试多模态提示注入对6个智能体框架的影响,发现视觉通道尝试率12.8%高于完成率1.11%,音频完成率达49%。
- 智能体框架为大语言模型集成规划、记忆和工具调用,常需处理包含潜在注入文本的图像等感知输入。现有研究多局限于纯文本注入、孤立模型或特定黑盒GUI,缺乏对多模态载荷在智能体内部各执行阶段传播与防御机制的跨框架评测。
- 构建MMPIBench基准,统一测试LangGraph等6个框架、5个基座模型、6种视觉载体及4类攻击目标,共720次运行。采用白盒阶段追踪定位终止阶段,并通过确定性检验与三模型评审团分层判定完成与尝试行为;进一步拓展评测到音频模态。
- 视觉通道中攻击完成率为1.11%,尝试率达12.8%,未完成攻击大多在规划阶段被模型阅读后放弃执行。模型选择对是否行动起主导作用;音频通道中仅半数框架能交付音频,但在交付后完成率达49%,其中gpt-audio达75%。
- 每单元仅在温度为零下单次运行且未设固定种子,个别边缘结果存在变异;CrewAI重测了部分单元且提示词配置不同带来混淆;音频与图像采用不同任务设定不可跨模态直接对比;工具调用采用模拟环境仅测行为而非实际破坏;评审团依赖轻量模型。
- 威胁模型
- 攻击者仅提供一个包含恶意指令的文件,无权访问模型权重、框架代码、系统提示词或运行机器。攻击者将恶意文本嵌入图像,通过上传、邮件附件、共享网盘或访问页面等途径进入智能体上下文,在用户发起正常处理请求时试图诱导规划器执行未授权工具调用。操作系统、认证与网络均假设完好。
- 模型
- Claude Opus 4.8GPT-5.4Gemini 3.1 ProGrok 4.3Llama 4 Maverickgpt-audio
- 基准
- MMPIBench
- 指标
- ASRattempted rateattack-recognition ratepartial execution ratefailed execution ratefurthest pipeline stage reached
研究者提出 MMPIBench,一个可复现的多模态提示注入基准,用同一套攻击、工具集和系统提示词在 LangGraph、CrewAI、AutoGen、OpenAI Agents SDK、Semantic Kernel、LlamaIndex 六种 Agent 框架上运行,覆盖五种基础模型、六种视觉载体和四类攻击目标,共 720 次运行。结果显示攻击完成率约 1%,但被尝试的比例达 12.8%,差距几乎全部在规划阶段被消解,即模型读到注入指令后拒绝执行。模型比框架更能决定指令是否被采纳:Claude Opus 4.8 在 144 次运行中从未尝试攻击并在 59.7% 的运行中识别出注入,Grok 4.3 与 Llama 4 Maverick 的尝试率均为 23.6%。载体方面,渲染 OCR 文本最有效,贡献了 8 次完成中的 7 次;EXIF 元数据和二维码约 88% 的运行中未被感知。
推荐理由论文用统一的跨框架测试台定位注入攻击在感知、规划、工具调用各阶段被拦下的位置,并给出模型与框架各自的作用。
深度解读
这篇论文试图解决什么问题?
论文试图解决多模态间接提示注入在智能体架构内部如何传播、被何处阻断,以及框架与模型在防御中各自所起作用的问题。
论文试图解决多模态间接提示注入在智能体系统内部的传播路径、防御瓶颈定位以及框架与模型安全责任解耦的问题。
- 多模态智能体的应用风险:按作者说法,LangGraph、CrewAI等框架使大语言模型具备规划、长效记忆和外部工具调用能力,能触达真实文件、邮件与数据库;当智能体处理带有文字的图像时,攻击者可绕过用户将恶意指令注入模型上下文,诱发非授权工具调用甚至持久污染记忆。
- 现有评估基准的局限:作者称,现有提示注入研究主要集中于纯文本环境(如用户提示词或检索文档),而多模态智能体研究要么仅孤立测试视觉语言模型,要么局限于单一黑盒GUI或网页界面,无法查明是流水线哪个阶段阻断了攻击,也无法判断替换模型或框架是否会改变结果。
- 核心观察与假设:图像或音频等感知输入在进入规划器后与操作者指令并无明确边界,均转化为统一的token;黑盒端到端成功率会掩盖模型的尝试行为,大部分注入未完成是因为规划器读取后主动放弃,而非存在架构级安全隔离。
- 论文的研究方案:构建基准 MMPIBench,在统一控制系统提示词与工具集的适配层下,评测6个主流框架、5个前沿模型、6种视觉载体与4类目标,利用白盒阶段插桩定位攻击终止位置,并延伸测试音频通道。
- 威胁模型:
- 攻击者目标:诱导规划器将嵌入在非受信内容中的文本视作指令,执行未授权工具调用(文件删除、敏感数据外传、虚假策略持久化或跨智能体安全绕过)。
- 攻击者知识:黑盒设定,攻击者无权访问模型权重、框架代码、系统提示词或运行机器。
- 攻击者能力:攻击者仅提供一个包含恶意载荷的文件(如图像或音频),通过正常文件上传、邮件附件、共享网盘或网页浏览等渠道呈现在智能体输入中。
- 受害系统假设:底层操作系统、身份验证与网络通信均完好,攻击纯粹取决于模型规划器对读取内容的决策。
有哪些相关研究?
相关研究包括文本与工具智能体注入基准、多模态与GUI攻击以及防御机制,论文在跨框架与白盒阶段追踪上与之形成对比。
论文将相关研究划分为文本与工具集成智能体提示注入基准、多模态与GUI智能体攻击以及防御方法三大类,并在此基础上定位自身贡献。
文本与工具集成智能体提示注入基准
- Greshake et al. (2023):提出间接提示注入概念,报告了攻击者通过模型检索的内容引入恶意指令可破坏实际的LLM集成应用。
- InjecAgent (Zhan et al., 2024) 与 AgentDojo (Debenedetti et al., 2024):形式化评估了工具集成智能体的间接注入问题,其中AgentDojo提供了包含任务与防御的动态测试环境。作者指出,这两项基准均为纯文本设定,注入载荷作为工具输出或文档文本传递,未涉及图像等感知通道。
多模态与GUI智能体攻击
- Liu et al. (2024) 与 WebInject (Wang et al., 2025):Liu等通过基于梯度的自动生成方法学习通用注入字符串;WebInject通过扰动渲染网页的原始像素驱动视觉语言网页智能体执行恶意动作。
- LaSM (Yan et al., 2025) 与 VPI-Bench (Cao et al., 2025):LaSM针对GUI智能体屏幕上的弹窗指令叠加攻击并提出防御;VPI-Bench针对计算机使用智能体在Web和操作系统环境中评估视觉提示注入。作者指出,这些工作将攻击载体固定在单一表面(渲染网页或屏幕叠加),并将智能体视为黑盒,仅报告最终动作是否被劫持。
提示注入防御机制
- StruQ (Chen et al., 2024) 与 SecAlign (Chen et al., 2024):StruQ通过结构化查询格式在训练阶段分离受信指令与不可信数据;SecAlign通过偏好优化对齐模型以抵御注入指令。
- MELON (Zhu et al., 2025):提出推理时检查机制,通过比对掩码提示词前后的执行轨迹一致性来检测攻击。作者说明本文不提出新防御,而是提供衡量攻击停留在流水线何处的测量工具,为防御部署提供依据。
基线方法与基准定位
- 基线与参照:论文复用了InjecAgent与AgentDojo的任务与攻击目标配对结构,并借鉴了VPI-Bench的行为分类轴线与多模型评审机制。
- 本文定位:作者称MMPIBench处于工具集成基准与多模态攻击的交集,填补了跨框架测试的空白,并通过白盒流水线阶段追踪揭示攻击在内部何处终结,克服了黑盒评估无法定位阻断机制的问题。
论文如何解决这个问题?
论文构建MMPIBench统一评测框架,通过固定变量适配层、白盒阶段插桩、双层评审协议与音频扩展解耦系统脆弱性。
论文通过构建可复现基准 MMPIBench,将固定的多模态攻击集通过统一适配器接入不同框架与模型,结合流水线阶段插桩和双层评审机制解耦各环节的影响。
攻击数据集与多载体设计
数据集由6种视觉载体与4类攻击目标全交叉构成24个标准用例(附录 Table XI, Table XII),所有攻击均由固定模板通过确定性脚本生成:
- 六类载体:OCR文本(文字直接渲染为图像)、视觉叠加(文本覆盖于正常照片上)、元数据注入(写入图像EXIF字段)、QR码(指令编码为二维码)、截图伪造(假UI界面中的文本)以及混合载体(QR码与可见文字叠加)。
- 四类目标:O1工具滥用(未授权删除文件)、O2数据外传(读取机密文本并通过邮件外发)、O3记忆投毒(将伪造策略写入长期记忆)、O4跨智能体传播(向第二智能体传递安全豁免指示)。每个攻击用例均配对良性文档处理任务(如总结报告),使恶意指令与良性目标竞争。
统一框架适配与执行环境
测试覆盖6个主流智能体框架:LangGraph、CrewAI、AutoGen、OpenAI Agents SDK、Semantic Kernel以及LlamaIndex Workflows。
- 薄适配层:每个框架通过轻量适配器统一接口,执行框架原生循环,但保持系统提示词、多模态输入通道和4个模拟工具(read_file、send_email、write_memory、delete_file)一致。O4目标则额外接入一个真实的Reviewer智能体调用。
- 模型接入:模型全部通过OpenRouter网关以温度0调用,覆盖Claude Opus 4.8、GPT-5.4、Gemini 3.1 Pro、Grok 4.3与Llama 4 Maverick。图像直接送入模型视觉编码器,不外挂独立OCR引擎。
白盒流水线阶段追踪
为避免黑盒二元标签的信息丢失,论文对每次运行插桩记录载荷达到的最远阶段(Section V-G):
- None(未感知):载荷未被模型识别,如未能从像素中解码QR码或读取EXIF元数据。
- Perception(感知):载荷被读取,但智能体在推理中标记为可疑并停止。
- Planning(规划):载荷被读取且参与推理,但智能体未调用恶意工具。
- Tool invocation(工具调用):智能体调用了恶意工具。
- Execution(执行):确定性校验确认攻击目标完全达成。
双层评审与行为分类协议
结果判定采用两层机制,以平衡准确性与成本(Figure 1, Section V-F):
- 第一层(确定性判定):对执行日志进行机械校验(如检查是否调用delete_file或邮件参数是否含金丝雀字符串),直接判定是否完成(completed)。
- 第二层(模型评审团):由Claude Haiku 4.5、GPT-4o mini和Gemini 2.5 Flash-Lite组成三厂商评审团,按2/3多数投票判定智能体是否尝试攻击(attempted)。
- 行为细分:结合Gemini 2.5 Flash-Lite子分类器,将结果划分为成功(success)、部分执行(partial)、执行失败(failed)与识别拒绝(attack-recognition)。
音频通道扩展设计
将基准扩展至前沿模型支持的第二种原始感知模态——音频(Section VII):
- 载荷与合成:复用4类目标,采用高、中、低3种隐蔽表述生成12条语音备忘录,由中性TTS语音合成。
- 任务形式:采用split-task设定,在同一音频备忘录中同时包含良性记事请求与恶意指令,用户提示词授权处理备忘录并提示可按需使用工具。
论文做了哪些实验?
论文在图像通道完成720次全矩阵测试,在音频通道完成72次测试,发现尝试率远超完成率,模型是主导因素,音频缺乏防御。
实验设置
- 被测模型:视觉通道评测Claude Opus 4.8、GPT-5.4、Gemini 3.1 Pro、Grok 4.3、Llama 4 Maverick(共5个);音频扩展测试Gemini 3.1 Pro与gpt-audio(共2个)。
- 被测框架:LangGraph (1.2.6)、CrewAI (1.15.1)、AutoGen (0.7.5)、OpenAI Agents SDK (0.17.7)、Semantic Kernel (1.43.1)、LlamaIndex Workflows (0.14.23)(共6个,据 Table XIII)。
- 数据集与规模:视觉通道为主实验,24个用例全交叉生成720个单元;音频通道测试3个支持框架、2个模型与12条载荷,共72个单元。
- 工具与判定协议:包含4个模拟工具及1个多智能体交互通道。第一层日志机械检查判定完成,第二层轻量模型评审团(Claude Haiku 4.5、GPT-4o mini、Gemini 2.5 Flash-Lite)多数表决判定尝试。
- 运行参数:所有模型调用温度设为0。视觉矩阵进行单次全量执行,其中159个单元进行了重新执行。
主结果
视觉通道主实验结果如表所示(据 Table III):
表格较宽,可左右滑动
评测模型 尝试率 (Attempted) 识别拒绝率 (Recognized) 完成数 (Completed) 出处 Claude Opus 4.8 0.0% 59.7% 0 / 144 Table III GPT-5.4 4.2% 30.6% 0 / 144 Table III Gemini 3.1 Pro 12.5% 25.0% 2 / 144 Table III Grok 4.3 23.6% 19.4% 6 / 144 Table III Llama 4 Maverick 23.6% 16.0% 0 / 144 Table III - 模型是行为的主导预测因素:Claude Opus 4.8在144次运行中尝试率为0.0%,主动识别拒绝率达59.7%;Grok 4.3与Llama 4 Maverick尝试率最高,均为23.6%,作者称模型在面对非受信内容时的决策差异大于框架差异。
- 尝试率远高于完成率:全矩阵720次运行中确定性完成仅8次(1.11%,95% CI 0.6–2.2%),但评审团判定尝试攻击达92次(12.8%,95% CI 10.5–15.4%),包含72次部分执行与12次执行失败(Table I),作者称单一完成指标大幅低估了系统面临的风险。
- 失效模式的分化:Grok 4.3产生最多的6次完成,而Llama 4 Maverick尝试率相同但识别拒绝率最低(16.0%),作者指出Llama倾向于遗漏或忽略载荷而非主动防御,随着载体改进该模式缺乏安全保证。
载体与目标特征分析
- 载体差异(Table IV):OCR文本最为有效,尝试率为27.5%并贡献了8次完成中的7次(其余1次由混合载体产生);截图伪造与视觉叠加虽无完成,但尝试率分别达20.8%与18.3%;元数据与QR码尝试率为0.0%,约88%未达感知阶段。
- 目标差异(Table V):跨智能体传播(O4)尝试率达23.3%,记忆投毒(O3)为15.6%,工具滥用(O1)为10.6%,数据外传(O2)仅1.7%。所有8次完成均为O1单步删除,O2、O3、O4完成数均为0。
- 作者的解读:模型对外发机密数据表现出更强的内生防御;而元数据与QR码的失效主要源于模型缺乏内建解码感知能力,属于载体感知失败而非安全防御。
音频通道扩展评测
- 框架支持与交付情况:6个框架中仅LangGraph、OpenAI Agents SDK与LlamaIndex成功交付音频,CrewAI、Semantic Kernel与AutoGen均因格式或序列化问题未将音频送达模型(Table VIII)。
- 攻击完成表现(Table IX, X):在成功交付的72个单元中,完成35次(49%,95% CI 37–60%),且尝试与完成数量完全相同。gpt-audio完成率达75%(识别率22%),Gemini 3.1 Pro完成率22%(识别率50%)。
- 作者的解读:音频有效载荷目标明确且为单步指令,导致一旦尝试即告完成;前沿模型在音频感知通道上的安全对齐程度落后于视觉与文本通道。
其他消融与分析
- 各框架完成数:CrewAI为3/120,LangGraph、AutoGen、OpenAI Agents SDK、Semantic Kernel、LlamaIndex各为1/120(据 Table II)。
- 各框架尝试率:AutoGen、LlamaIndex、OpenAI Agents SDK均为10.0%,LangGraph为11.7%,Semantic Kernel为13.3%,CrewAI为21.7%(据 Table II)。
- 管线终止阶段分布:None为32.9%(237次),Perception为23.6%(170次),Planning为42.1%(303次),Tool invocation为0.3%(2次),Execution为1.11%(8次)(据 Table VI)。
- 音频隐蔽程度影响:中等隐蔽词句完成17/24单元,高隐蔽完成12/24单元,低隐蔽完成6/24单元(Section VII-D)。
- 单元重测与例外:159个单元重测中CrewAI在第二轮增加完成,1个O4案例因仅在摘要中复述豁免文本被排除在完成之外(Section VI-H)。
有什么可以进一步探索的点?
作者指出了单次测试随机性、框架配置与重测混淆、跨模态设定不一致等局限;实验覆盖了特定的模型、框架与模拟工具。
作者指出的局限与后续方向
- 单次运行与非确定性变异:协议在温度为0下每个单元运行一次,未固定采样种子,网关与框架引入了非确定性,少数边缘单元在重复运行时结果发生改变(Section VI-H, VIII-E)。
- 框架重测与配置混淆:初测后对159个单元进行了重测(全部属于CrewAI和LangGraph),且CrewAI适配器采用了角色、目标和背景故事配置而非统一系统提示词,导致框架间对比存在两项无法分离的混淆因素(Section VI-H, VIII-E)。
- 模态设定差异限制跨通道对比:图像和音频在任务形式(单良性任务对split-task)以及用户提示是否引导调用工具上不同,音频设定对攻击者更为宽松,两通道比率不可直接横向比较(Section VII-B, VIII-D, VIII-E)。
- 音频实验规模较小:音频仅涵盖2个模型、3个交付框架和12条载荷,且框架支持结论主要依赖Gemini模型运行(Section VIII-E)。
- 模拟工具与下游行为判定缺陷:工具环境均为mock模拟,仅度量调用行为而非真实系统受损;O4跨智能体成功判定依赖豁免文本匹配,可能将引用拒绝误判为传播(Section VI-H, VIII-E)。
- 未评测防御缓解措施:研究仅度量攻击面而非缓解机制,评估哪些防御手段能降低尝试率留待未来工作(Section II, VIII-E)。
实验覆盖范围
- 模型覆盖范围:视觉评测覆盖Claude Opus 4.8、GPT-5.4、Gemini 3.1 Pro、Grok 4.3、Llama 4 Maverick共5个模型;音频评测覆盖Gemini 3.1 Pro与gpt-audio共2个原生模型。
- 框架覆盖范围:评测覆盖LangGraph、CrewAI、AutoGen、OpenAI Agents SDK、Semantic Kernel、LlamaIndex Workflows共6个框架。
- 载荷与用例覆盖:视觉通道包含6种载体与4类目标交叉构成的24个用例;音频通道包含12条合成语音备忘录。
- 工具环境设置:工具操作固定为文件读取、文件删除、邮件发送与记忆写入4个模拟工具,以及1个二级智能体通信通道。
- 执行与统计设定:各单元以温度0执行1次(除159个重测单元),论文未报告其他温度设置或多次重复采样的统计方差。
总结一下论文的主要内容
论文提出MMPIBench评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
- 论文定位:论文提出了可复现基准 MMPIBench,系统评估多模态间接提示注入在6个主流智能体框架与5个前沿模型中的传播路径与阻断机制。
- 核心问题:现有提示注入研究多针对文本输入或将多模态智能体视作黑盒,无法厘清攻击是在感知、规划还是执行阶段被阻断,也无法区分框架与基座模型的安全职责。
- 方法设计:通过统一适配层标准化系统提示词与模拟工具,测试24个视觉攻击用例(6类载体 × 4类目标)与12个音频用例,引入白盒阶段插桩定位终止位置,并采用确定性检查与三模型评审团分层判定完成与尝试。
- 主实验发现:全矩阵720次视觉运行中完成率仅1.11%(8次),但尝试率达12.8%(92次);未完成攻击主要在规划阶段被模型阅读后放弃执行(占42.1%),显式识别拒绝占23.6%;模型是主导因素,Claude Opus 4.8尝试率为0.0%,Grok 4.3和Llama 4 Maverick达23.6%。
- 音频扩展发现:半数框架因格式或序列化问题未交付音频;在交付的72个单元中完成率达49%,gpt-audio达75%,且尝试与完成数量完全相同。
- 结论与启示:作者认为仅汇报完成率会大幅低估系统暴露风险,应同时追踪尝试率与识别拒绝率;框架丢弃多模态输入属于偶发缺陷而非安全屏障,亟需将安全对齐扩展至视觉与音频等感知通道。