论文提出 ARE 框架,在 VisualWebArena 上评估多模态 Agent 的对抗鲁棒性
Dissecting Adversarial Robustness of Multimodal LM Agents
作者评估多模态网页智能体,发现扰动单图可获最高 67% ASR,攻击推理计算组件使脆弱性上升。
攻击者作为平台合法用户,仅能修改自身内容(不可信部分),在单张图片上施加不超过 16/256 的 L-infinity 扰动(占网页像素不足 5%)或添加单段文本,目标为操控智能体达成定向恶意目标,无法修改用户指令或平台系统。
- 多模态大模型智能体在真实网络环境中易受环境输入的对抗攻击,但复合智能体包含多个组件和推理时计算,其系统级脆弱性及对抗信息在组件间的传播机制此前缺乏系统评估与分析。
- 提出 ARE 框架,将复合智能体建模为有向图,用中间输出在最坏情况下的下游攻击成功率上界定义边权重以衡量对抗影响传播;针对文本和图像访问设计黑盒提示注入、白盒图像 PGD 与黑盒多 CLIP 集成攻击。
- 在 VWA-Adv 200 个任务上,攻击黑盒模型最高达到 67% ASR;未受攻击的新组件能降低 ASR,但一旦被联合攻击,reflexion 和 tree search 智能体 ASR 反而分别上升至 36% 和 38%。
- 只测了 VWA 的 3 个网页环境,更广泛场景如操作系统未测;攻击方法仅为已有攻击的适配版本,代表风险下界;仅考察了 base、reflexion 和 tree search 架构;未报告黑盒 CLIP 攻击对抗白盒防御的实验。
- 被测模型
- GPT-4oGPT-4VClaude-3-OpusGemini-1.5-Pro
- 基准
- VisualWebArenaVWA-Adv
- 指标
- ASRBenign SR
论文提出 Agent Robustness Evaluation(ARE)框架,把多模态 Agent 建模为有向图,将鲁棒性分解为对抗信息在组件间的传播,并在 VisualWebArena 上手工构建 200 个定向对抗任务(VWA-Adv)进行评测。作者称,仅对单张图片施加幅度 16/256 的不可感知扰动(不足网页像素的 5%),即可劫持使用 GPT-4o 等黑盒前沿模型、并带有 reflexion 与树搜索的 Agent,攻击成功率最高达 67%。研究还发现,推理时计算带来的新组件会引入新漏洞:当 evaluator 与 policy model 同时被攻击时,reflexion Agent 的攻击成功率相对基线上升 20%;当 value function 被攻击时,树搜索 Agent 的攻击成功率从 31% 升至 38%。
推荐理由论文在 VisualWebArena 上构建 200 个对抗任务,量化了多模态 Agent 各组件被攻陷后攻击如何沿系统传播。
深度解读
这篇论文试图解决什么问题?
研究多模态智能体在受限环境扰动下的定向脆弱性与多组件系统级对抗信息传播。
多模态大语言模型智能体在真实网页环境中易受环境局部扰动劫持,且复合智能体组件间对抗信息传播规律尚不明确。
- 场景与重要性:基于多模态大语言模型构建的自主智能体正被部署到网页平台等真实环境中执行复杂动作,但面对来自环境的恶意操作时存在严重安全风险。
- 现有方法不足:现有安全评估主要针对单体聊天机器人或单步模型,忽略了智能体是由输入处理、策略模型、评估器和价值函数等多个组件构成的复合系统,攻击须跨多步推理与环境接地传播。
- 核心观察与假设:向复合系统引入新组件或推理时计算虽然能提升良性任务性能,但也引入了新的受攻击面;若新组件遭攻击,智能体的整体脆弱性可能不降反升。
- 论文提出方案:提出了智能体鲁棒性评估框架 ARE(Agent Robustness Evaluation),并在 VisualWebArena 之上人工构建了包含 200 个逼真对抗任务的基准 VWA-Adv。
- 威胁模型:
- 攻击者目标:促使智能体执行攻击者指定的定向对抗目标(如添加特定商品至购物车、发表指定评论或误导属性认知)。
- 攻击者知识:对目标大模型黑盒访问(仅通过平台交互),或对客户端输入处理器(如开源图像描述器)白盒访问。
- 攻击者能力:仅能修改环境中非可信部分(自身发布的商品或帖子),包括注入单段文本或对单张图片施加 L∞ ≤ 16/256 扰动(占网页不足 5% 像素),无法篡改用户指令、系统提示或平台界面。
- 受害系统:基于黑盒前沿多模态模型及其扩展组件(反射、树搜索)构建的网页自主导航智能体。
有哪些相关研究?
围绕自主智能体推理计算、大模型多模态对抗攻防及间接提示注入三类工作展开对比。
论文梳理了自主智能体、对抗鲁棒性以及间接提示注入三个维度的前人工作。
- 自主智能体与增强机制:
- 网页与具身智能体:WebGPT(Nakano 等,2021)、Mind2Web(Deng 等,2023)、WebArena(Zhou 等,2024)与 VisualWebArena(Koh 等,2024a)探索了网页环境中的智能体构建;ReAct(Yao 等,2023b)等研究了推理增强。
- 推理时搜索与反馈:Reflexion(Shinn 等,2024)通过评估器生成口头反馈促进自我纠错;Tree of Thoughts(Yao 等,2023a)与语言模型智能体树搜索(Koh 等,2024b)利用价值函数引导动作空间搜索。
- 多模态大模型对抗鲁棒性:
- 越狱与对抗样本:针对文本大模型的对抗提示(Zou 等,2023;Chao 等,2023)以及针对视觉多模态模型的对抗图像攻击(Carlini 等,2023;Zhao 等,2023;Li 等,2024)。
- 跨系统迁移攻击:Dong 等(2023)利用多替代模型黑盒攻击 Bard;Gu 等(2024)白盒攻击多模态 RAG。作者指出此前工作通常假设对模型输入拥有近乎完全的控制权,而智能体场景中攻击者仅能触碰环境局部切片。
- 间接提示注入攻击:
- 环境注入风险:Greshake 等(2023)提出间接提示注入;Debenedetti 等(2024,AgentDojo)与 Liao 等(2024,EIA)在智能体中评测了提示注入。作者指出本文更侧重图像与文本的多模态输入空间,并着重解析复合系统的系统级鲁棒性。
- 基线方法与基准:
- 对比基线与数据集:基于 VisualWebArena(Koh 等,2024a)构建的基线智能体,包括基础策略智能体、带描述器智能体、Reflexion 智能体和树搜索智能体;防御基线采用了安全提示词(Hines 等,2024)与文本改写(Jain 等,2023)。
- 与已有工作的定位区别:作者强调本文在逼真的网页威胁模型下,首次系统揭示多模态黑盒前沿智能体及推理时计算组件的极端脆弱性,并提出了量化组件间对抗影响传播的有向图框架。
- 自主智能体与增强机制:
论文如何解决这个问题?
建立 ARE 有向图框架量化对抗影响流动,并针对文本与图像设计梯度及多 CLIP 攻击。
作者提出 ARE 框架将智能体抽象为有向图以量化对抗影响传播,并针对不同攻击入口设计了三种攻击算法。
智能体有向图模型与 ARE 框架
- 图结构定义:将智能体建模为有向图 G = (V, E),其中 venv ∈ V 为环境观测节点,vfinish ∈ V 为终止叶节点,其余节点为输入处理器、策略模型、评估器和价值函数等组件。
- 对抗影响度量:若边 e 在祖先节点执行后取值 c,其中间输出的对抗影响 AdvIn(c) ∈ [0, 1] 定义为后继节点未受攻击时所能达到的最坏情况期望攻击成功率上界。
- 边权重形式化:边权重 λ(e) 定义为边缘分布 pe 下对抗影响的期望值:λ(e) := 𝔼c ∼ pe(AdvIn(c))该指标独立于具体下游组件,可在图遍历时计算并跨下游配置复用。
- 分支边缘处理:若某些分支未被执行(如 Reflexion 首次尝试成功则不执行第二次),定义未执行边 c = ∅ 且 AdvIn(∅) = 0。
攻击方法设计
- 黑盒提示注入(文本访问):攻击者直接将选取的对抗文本注入到目标商品的描述中,随环境观测与截图共同输入大模型。
- 白盒图像 PGD 攻击(客户端组件可访问):当系统使用开源客户端输入处理器(如图像描述模型 πcomp)时,利用投影梯度下降(PGD)优化扰动 δ(满足 ||δ||∞ ≤ ϵ):max||δ||∞ ≤ ϵ log πcomp(z ∣ x + δ)促使描述器输出预设的对抗指令文本 z。
- 黑盒多 CLIP 集成攻击(纯黑盒图像访问):当所有组件均为黑盒时,攻击者联合优化多个不同架构的 CLIP 图像编码器(ViT-B/32、ViT-B/16、ViT-L/14、ViT-L/14@336px),最大化图像嵌入与目标对抗文本 z 的余弦相似度,同时抑制负面文本 z− 的相似度。扰动在 180 像素低分辨率下优化以抑制过拟合。
复合智能体执行流
- Reflexion 智能体:策略模型首先尝试与环境交互;若评估器判定未达成目标并生成反思文本,策略模型则结合反思进行第 2 次尝试(实验设最大尝试次数为 2)。
- 树搜索智能体:策略模型在每一步采样多个去重候选动作,由价值函数打分并选择最高分动作执行(分支因子为 3,搜索深度为 1)。
论文做了哪些实验?
在 200 个任务上测得最高 67% ASR;复合组件受攻击使 ASR 相对上升 15%–20%。
实验设置
- 被测模型:GPT-4o(gpt-4o-2024-05-13)、GPT-4V(gpt-4-vision-preview)、Claude-3-Opus(claude-3-opus-20240229)、Gemini-1.5-Pro(gemini-1.5-pro-preview-0409)。所有模型解码温度均设为 0。
- 数据集与规模:VWA-Adv,包含基于 VisualWebArena 200 个良性成功任务人工构建的定向对抗任务,涵盖分类广告、Reddit 论坛和购物网站 3 个环境。
- 基线与智能体变体:基础智能体(仅 Policy)、带描述器智能体(加白盒 LLaVA 描述器或自描述)、Reflexion 智能体、树搜索智能体。
- 指标定义:良性任务成功率(Benign SR)和定向攻击成功率(ASR)。
- 评审与判定方式:采用基于环境终态和智能体输出的执行判定脚本(包含精确匹配、模糊匹配、URL 匹配及 GPT-4 模糊文本判定),输出二元判定(0 或 1)。
- 样本量与重复次数:200 个任务,采用贪婪解码(温度为 0),单次运行评测。
主结果
各模型与配置在 VWA-Adv 上的良性成功率与攻击成功率如下所示(据 Figure 4):
表格较宽,可左右滑动
模型 攻击设置与方法 Benign SR ASR 出处 GPT-4o Setting A:文本提示注入 78% 40% Figure 4 GPT-4o Setting B:白盒描述器图像攻击 78% 31% Figure 4 GPT-4o Setting C:黑盒 CLIP 自描述攻击 78% 19% Figure 4 GPT-4o Setting D:黑盒 CLIP 基础智能体攻击 78% 10% Figure 4 GPT-4V Setting B:白盒描述器图像攻击 65% 67% Figure 4 Claude-3-Opus Setting B:白盒描述器图像攻击 54% 48% Figure 4 Gemini-1.5-Pro Setting B:白盒描述器图像攻击 42% 23% Figure 4 - 多模型对比:在白盒描述器攻击下,GPT-4V 的 ASR 达到最高值 67%,GPT-4o 为 31%,Gemini-1.5-Pro 为 23%;作者称 GPT-4o 在高良性成功率和较低 ASR 之间展现出最好的权衡。
- 跨模态攻击效力:GPT-4o 受文本提示注入时 ASR 为 40%,受白盒描述器攻击时 ASR 为 31%;作者称白盒描述器会将图像级漏洞抬升至接近文本注入的水平。
- 黑盒图像攻击的难度:在不使用描述器的基础智能体上直接进行黑盒 CLIP 攻击时,GPT-4o 的 ASR 下降至 10%。
Reflexion 智能体与评估器脆弱性
- 未受攻击评估器的防护效果:当仅策略模型受攻击而评估器干净时,第一轮尝试产生 31% ASR,经评估器拦截后第 1 轮仅接受 18%,第 2 轮产生 7% ASR,最终整体 ASR 从 31% 降至 25%(Figure 5(A)(C))。
- 联合攻击的脆弱性加剧:当评估器与策略模型同时受攻击时,评估器对对抗动作的接受率上升至 21%,且更易误拒正常动作并生成对抗反思(对抗边权重增至 6%),最终整体 ASR 从 31% 升至 36%(Figure 5(D))。
- 仅攻击评估器:即使策略模型未受攻击,仅攻击评估器也能诱导其产生 9% 的对抗反思,最终诱导策略模型采取恶意动作达到 8% ASR(Figure 5(B))。
树搜索智能体与价值函数脆弱性
- 未受攻击价值函数的过滤作用:当价值函数干净时,能将策略模型候选动作的 31% ASR 过滤至 26% 最终 ASR(Figure 6(C))。
- 联合攻击导致漏洞放大:当价值函数与策略模型均受攻击时,被攻击的价值函数倾向于给对抗动作打高分,使最终 ASR 升至 38%(Figure 6(D))。
- 仅攻击价值函数:仅攻击价值函数时,智能体探索低概率动作并被赋予高分,导致 8% 的 ASR(Figure 6(B))。
防御方法评测
- 系统提示词防御:添加数据定界符并提示忽略恶意指令,ASR 仍接近 31%;更激进的中止提示同样未见明显改善(Figure 7)。
- 文本改写防御:利用 GPT-4o 改写不可信文本,将 ASR 从 31% 小幅降至 27.5%(Figure 7)。
- 自洽性检查与代价:由大模型对各图片单独生成描述并与文本比对,可将白盒描述器攻击 ASR 降至接近 0%;但测试网页中 70% 包含超过 10 张图片,API 成本剧增,且自描述组件本身面对黑盒 CLIP 攻击时存在 38% 的潜在脆弱性上界(Figure 7)。
其他消融与分析
- CLIP 攻击优化分辨率消融:在 180px 下优化时目标描述生成率为 71%,而更高分辨率效果明显更差(Figure 13、Table 7)。
- 去除负向文本:Table 7 显示去掉负向文本 y− 后目标描述生成率从 71% 降至 46%。
- CLIP 模型集成消融:Table 7 显示若仅用单个 CLIP 模型优化,成功率仅为 9% 至 31%。
- 图像相对尺寸与文本干扰:Table 3 显示当截图分辨率为 512 且图像为 256 时无干扰文本 ASR 为 55%,有干扰文本时为 38%;当截图为 2048 且图像为 128 时无干扰文本 ASR 仅 29%,有文本时为 13%。
有什么可以进一步探索的点?
作者指出攻击仅为风险下界且环境局限于网页;实验覆盖 4 个模型与 200 个任务。
作者指出的局限与后续方向
- 攻击基线代表性:论文所用攻击为已有攻击方法的工程适配,作者在附录 D 中指出它们仅构成安全风险的下界,未来需要更强的自适应攻击。
- 评测环境单一:论文仅在 VisualWebArena 的固定网页环境中评估,作者在附录 D 中指出在操作系统等更多样场景中的表现仍有待检验。
- 智能体架构覆盖:实验仅涵盖基础、Reflexion 和树搜索三种前沿框架,作者在附录 D 中指出随着新型智能体算法不断涌现,其鲁棒性仍需持续跟踪。
- 任务难度扩展:作者在第 6 节结论中指出,随着智能体能力增强,未来应针对智能体能够解决的新任务构建新的对抗版本。
实验覆盖范围
- 被测模型数量:主实验覆盖了 4 个前沿多模态模型(GPT-4o、GPT-4V、Claude-3-Opus、Gemini-1.5-Pro)。
- 基准与任务规模:评测基于 VisualWebArena 上的 3 个网页平台,人工构建并测试了 200 个对抗任务。
- 图像扰动参数:对抗扰动严格限定在单张图片上,范数界限为 L∞ ≤ 16/256 且像素面积占比小于 5%。
- 复合组件架构:仅评测了最大尝试次数为 2 的 Reflexion 智能体,以及分支因子为 3、深度为 1 的树搜索智能体。
- 未报告信息:论文未报告黑盒图像攻击在受防御系统上的实际表现,且未进行统计显著性检验。
总结一下论文的主要内容
系统评估多模态网页智能体的脆弱性,指出推理时计算组件被攻破会加剧系统风险。
- 定位与核心问题:论文针对真实网络环境下的多模态大模型智能体,研究其在受限环境输入扰动下的定向脆弱性,并分析复合智能体组件间的对抗信息传播机制。
- 方法创新:提出将智能体表示为有向图的 ARE 评估框架,量化中间输出在最坏情况下的对抗影响边权重;同时针对网页环境设计了黑盒提示注入、白盒描述器 PGD 攻击与多 CLIP 集成黑盒图像攻击。
- 核心主结果:在包含 200 个任务的 VWA-Adv 基准上,白盒描述器攻击使 GPT-4V 达到 67% ASR,GPT-4o 达到 31% ASR;文本提示注入对 GPT-4o 达成 40% ASR;纯黑盒图像攻击在基础智能体上对 GPT-4o 取得 10% ASR。
- 复合系统动态:未受攻击的评估器和价值函数能提供 23% 和 16% 的相对防护,但当与策略模型同时受攻击时,Reflexion 和树搜索智能体的 ASR 分别相对上升约 20%(至 36%)和 23%(至 38%);单独攻击辅助组件亦能产生 8% ASR。
- 防御与结论:安全提示词与文本改写防御收益微弱,一致性检查虽然有效但 API 开销高且自描述组件面对自适应攻击仍有 38% 的脆弱性上界;作者强调扩展推理时计算在最坏情况下会扩大受攻击面,呼吁针对复合系统关键薄弱链路进行深度防御。