WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作
Adversarial Images Hijack Web Agents from Visual Grounding to Browser Execution
WebMirage通过角色槽位重组与数据流分析生成局部对抗图像,在4种智能体与6种VLM上达到91.9%平均ASR-S。
白盒红队设定:攻击者离线拥有目标智能体代码及开权重VLM完全白盒权限,已知网站粗粒度属性;测试时仅能控制网页上渲染的一个局部第三方图像,不可修改DOM或注入文本指令,无法事先获知候选标识符。
- 多模态网络智能体依赖视觉定位执行浏览器操作。现有对抗攻击主要针对模型推理或假设网页上下文固定,未显式考虑结构化输入处理与动作后处理,导致模型层面的攻击成功无法转化为浏览器执行层面的控制。
- 提出 WebMirage 框架,将红队测试形式化为端到端“定位到执行”问题。通过角色槽位抽象与网页重组模拟元素竞争与位置偏移,并利用静态数据流分析将优化目标对齐至动作提取逻辑所保留的关键 token。
- 在 4 种智能体、6 种 VLM 及 2,250 个任务中,WebMirage 取得 91.9% 的平均 ASR-S,最强基线仅为 17.4%。在 SeeAct 上平均 ASR-M 达 86.9%;在同系列模型间迁移 ASR-S 达 81.2%–93.5%。
- 基于坐标的智能体不在研究范围内;攻击效果随扰动预算和目标渲染面积缩减而下降;动态标识符随机化可压低攻击成功率,但会导致干净任务准确率降至 15.9%;跨模型家族迁移的 ASR-S 会下降至 4.5%–23.8%。
- 模型
- LLaVA-v1.5-13BLLaVA-v1.6-34BMiniCPM-o-8BPhi-3-Vision-4BQwen2-VL-7BCogVLM
- 基准
- 13 public websites (Retail, Accommodation, Tutoring, Home Service)VisualWebArena (OneStopShop)Mind2Web
- 指标
- ASR-SASR-MMTRAcc.NLL
研究者提出 WebMirage,一个针对视觉网页 Agent 的端到端红队框架,通过在被控图像上施加局部视觉扰动,让 Agent 选中攻击者控制的内容并执行对应浏览器操作。该框架用角色槽抽象与网页重组建模候选元素之间的竞争,并用 dataflow 分析把优化目标对齐到动作后处理阶段,只保留决定浏览器命令的 token。在四种 Agent 配置、六种 VLM 主干、覆盖 13 个公开网站与沙箱基准的 2250 个任务上,WebMirage 平均攻击成功率为 91.9%,最强基线为 17.4%。三种现有 Agent 级防御下攻击成功率仍在 86.5% 至 91.9% 之间;让候选标识符随机化的自适应防御把成功率从 93.8% 降到 11.7%,但干净任务准确率也从 100% 降到 15.9%。
推荐理由论文把视觉红队建模为从视觉定位到浏览器执行的端到端过程,展示了该攻击在多种 Agent 配置下的成功率与现有防御的覆盖情况。
深度解读
这篇论文试图解决什么问题?
现有多模态网络智能体对抗攻击忽略了从视觉定位到浏览器执行的完整流水线,导致模型层攻击难以转化为执行控制。
多模态网络智能体在从视觉定位到浏览器执行的全流程中,面临对抗性图像劫持浏览器操作的安全脆弱性。
- 问题场景与重要性:基于大型视觉语言模型(VLM)的现代网络智能体能够处理屏幕截图、选择候选 UI 元素并将模型输出转换为浏览器操作。由于这些智能体需要执行购买、预订、表单提交等关键浏览器操作,不可信网页内容成为了直接的攻击面。
- 现有方法的不足:提示注入攻击(如 EIA、WIPI)依赖注入文本指令;而视觉扰动攻击中,VWA-Adv 假定网页上下文固定且仅针对中间文本表征,Chameleon 针对所有样本优化固定硬编码输出。现有攻击均围绕模型推理建模,忽略了结构化输入候选构建与动作后处理,导致实际执行层面的平均 ASR 不超过 17.4%。
- 核心观察与假设:作者认为关键问题在于对抗性视觉内容能否在覆盖结构化输入处理到浏览器最终执行的完整流水线中保持有效。网页动态性会导致候选元素重排、邻居置换及标识符变化,使得模型层输出与攻击者控制的元素在不同渲染中失去对齐。
- 威胁模型:
- 攻击者目标:促使智能体在不同渲染下选中攻击者控制的候选元素并执行对应的浏览器动作。
- 受害系统:协助用户完成购物、预订或雇佣等开放式网络任务的视觉定位网络智能体。
- 离线合成能力:拥有白盒访问权限,可获取目标智能体代码、开权重 VLM 参数、结构化输入构建、输出解析与动作执行逻辑,了解目标网站粗粒度属性,但未知测试时确切请求或页面实例。
- 测试时能力:仅能控制网页上渲染的一个局部第三方图像(如商品缩略图或头像),无法修改网站代码或 DOM,无法注入文本指令,无法更改智能体运行时,且扰动在渲染前已固定。
- 论文提出的方案:论文提出了 WebMirage 框架,采用角色槽位抽象建模元素竞争与位置偏移,并通过数据流分析将优化目标对齐至决定浏览器动作的模型输出 token。
有哪些相关研究?
相关研究涵盖提示注入与视觉对抗扰动,但现有工作未建模结构化候选构建与下游动作后处理。
网络智能体与通用系统
- WebGPT(2022)等:早期文本中心智能体展示了 LLM 借助工具浏览与收集网络证据的能力;WebShop(2022/2023)、Mind2Web(2023)和 WebArena(2024)主要通过 DOM 和可访问性树等结构化文本表征进行网络交互。
- SeeAct(2024)、WebVoyager(2024)等:近期通用多模态智能体与 VisualWebArena(2024)环境、Set-of-Mark 提示技术(2023)结合渲染截图捕获难以仅从 HTML 恢复的页面语义。
网络智能体中的提示注入
- WIPI(2024)、PopupAttack(2025)、AdInject(2025):分别通过 DOM 元素、弹窗叠加或在线广告注入隐藏或误导性内容来劫持任务。
- EIA(2024):在合法表单字段旁注入带有诱导性指令的 HTML 元素以窃取隐私。作者指出这些攻击依赖智能体遵循注入的文本指令,而非操纵其对候选元素的视觉定位。
- SecureWebArena(2025)与 BrowserART(2025):提供了对指令通道威胁向量的系统性安全评测基准。
针对网络智能体的视觉扰动攻击
- WebInject(2025):假设攻击者拥有白盒模型访问权且能控制整个渲染网页,通过优化整页扰动诱发指定动作。
- VWA-Adv(2025):在受限威胁模型下扰动局部图像,通过嵌入相似度或中间图像描述改变模型语义解释。
- Chameleon(2025):利用白盒优化使局部触发器对位置和周围视觉上下文变化具备鲁棒性。作者指出 Chameleon 针对所有上下文将触发器优化为相同的硬编码模型输出,未考虑动态候选映射和下游动作解析;且 VWA-Adv 与 Chameleon 均未建模推理前的结构化候选构建以及推理后的动作解析。
视觉输入的对抗样本
- 图像分类与多模态对抗样本(Goodfellow 等 2015、Madry 等 2018、Luo 等 2024、Schlarmann 与 Hein 2023、Shayegani 等 2023):通常假设完全控制输入图像并评估模型预测;EoT(1993/2018)通过几何变换优化提升鲁棒性。作者指出在网络智能体中,主要变异来源是组合性变化而非几何变化。
基线方法与基准
- 对比基线:包括指令注入攻击 EIA、文本中间表征攻击 VWA-Adv、以及直接动作预测攻击 Chameleon。
- 使用基准:包括从 Mind2Web 改编并部署于 13 个真实网站的任务集,以及 VisualWebArena 的 OneStopShop 沙箱基准。
作者将本文定位为端到端解决从视觉定位到浏览器执行全流程攻击的方法,通过显式建模候选集动态映射与动作后处理,弥补了先前工作仅针对孤立模型推理或文本中间表征的缺陷。
论文如何解决这个问题?
提出 WebMirage 框架,通过角色槽位抽象、网页重组与基于数据流分析的动作目标对齐实现端到端劫持。
WebMirage 是一个流水线感知的端到端红队攻击框架,通过角色槽位建模与网页重组模拟元素竞争,并利用静态数据流分析将优化目标对齐至可执行浏览器命令。
威胁驱动的观察建模与角色槽位
- 网页视觉分解与观察接口:将渲染网页表示为 N 个视觉连贯区域构成的集合 S = {(v_i, b_i)}_{i=1}^N。智能体接收的输入为截图与候选集 O = (I_screen, C_cand),其中 C_cand 包含可交互区域标签、边界框与文本描述。
- 角色槽位抽象:定义提供相同功能角色的可互换位置为角色槽位集合 K_slot。依据语义角色标签 r_i 与宽高相对差异阈值 ε_w, ε_h 判定兼容槽位:
Kslot(rt, st) = {k ∈ [N] ∣ rk = rt, |wk − wt|/wt ≤ εw, |hk − ht|/ht ≤ εh} 该公式定义了与目标元素具有相同语义角色且尺寸相对偏差在阈值内的槽位索引集合。角色标签通过人工标注或轻量级元素分类器获得。
网页重组与变异约束
- 同伴变化与位置偏移:固定攻击图像所在槽位,从良性图像池 Z 中采样填充其余 l-1 个槽位模拟同伴竞争;固定同伴图像,将攻击图像放置在不同兼容槽位 k 中,重建候选集 q_k 与目标输出 y_{t,k}。
- 局部重组范围:仅重组目标角色槽位集合内的区域,槽位外区域保持不变。
统一攻击目标与可微预处理
- 扰动约束与可微化:将扰动限制在半径为 ε 的 ℓ∞ 球内(默认 16/255)。针对智能体使用的不可微图像库(如 PIL),采用 PyTorch 张量操作重写调整大小与补丁提取,使梯度能够回传。
- 联合优化目标:在每一步联合采样槽位位置与同伴图像,统一优化期望损失:
minδ 𝔼k ∈ Kslot, z ∼ 𝒵l−1 [L(I(ϕδ(vt), bk, z), qk, yt,k)] 该目标函数表示在所有采样的角色槽位位置与同伴图像组合上,最小化模型输出对应候选标签的期望损失。
基于数据流分析的动作目标对齐
- 后处理对齐挑战:智能体执行前通过正则或规则解析过滤模型输出,丢弃解释性文本,仅保留动作命令;直接优化完整响应会稀释梯度且无法保证动作匹配。
- 静态数据流分析:以 VLM 原始响应为数据源,传递给执行接口的参数为数据汇,在 CodeQL 中实现上下文敏感与流敏感的过程间分析,通过字符串分析与字段敏感跟踪,识别出决定可执行动作的 token 位置。优化时仅对这些 token 计算动作级损失 L_action。附录 F 给出了具体的提示词模板和基线配置。
论文做了哪些实验?
在 4 种智能体、6 种 VLM 和 2,250 个任务上评测,WebMirage 取得 91.9% 平均 ASR-S。
实验设置
- 被测模型:公共网站实验使用 5 个 VLM 底座:LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B、Phi-3-Vision-4B、Qwen2-VL-7B;沙箱实验使用 CogVLM;迁移实验额外包含 MiniCPM-V 2.5/2.6、Phi-3.5 Vision、CogAgent、VILA、ShareGPT4V、OpenFlamingo、Mini-Gemini。
- 智能体框架与配置:4 种配置,包括真实网站上的 SeeAct 与 WebVoyager,以及 VisualWebArena 沙箱中的两类观察变体(截图 + 可访问性树,以及截图 + Set-of-Mark,均使用 BLIP-2 生成 alt-text)。
- 数据集与任务规模:涵盖 13 个真实网站的任务(改编自 Mind2Web,包含零售、住宿、家政服务、家教 4 个场景,共 1,710 个任务)与 VisualWebArena 的 OneStopShop 任务(540 个任务),总计 2,250 个任务。
- 对比基线:EIA(提示注入)、VWA-Adv(针对中间表征的视觉扰动)、Chameleon(直接动作预测视觉攻击)。
- 指标定义:步级攻击成功率(ASR-S,浏览器在攻击目标上执行动作的比例)、多步攻击成功率(ASR-M,成功选择并完成最终目标的比例)、错误触发率(MTR,无关决策点误选攻击目标的比例)、干净任务准确率(Acc.)、负对数似然(NLL)。
- 评审与样本构建:所有任务均要求干净运行成功且选中非攻击候选;由浏览器真实执行动作判定成功与否(非 LLM 评审打分);使用 GPT-4o 生成互不相交的优化集与测试集用户请求及动作历史;论文未报告多轮重复测试的次数。
主结果
表格较宽,可左右滑动
智能体配置 (样本量) EIA ASR-S VWA-Adv ASR-S Chameleon ASR-S WebMirage ASR-S WebMirage MTR SEEACT (N = 1,710) 6.2% 14.5% 16.7% 90.0% 1.8% WEBVOYAGER (N = 1,710) 5.0% 15.6% 17.9% 85.4% 3.0% VWA (AcTree) (N = 540) 9.6% 8.9% 18.4% 96.2% 2.8% VWA (SoM) (N = 540) 4.8% 9.3% 16.6% 95.8% 2.1% 注:数据源自 Table 1。SEEACT 和 WEBVOYAGER 为 5 个 VLM 底座的平均结果;VWA 两种变体使用 CogVLM。
- 攻击成功率大幅超越基线:作者报告 WebMirage 在四种智能体配置下取得 85.4%–96.2% 的 ASR-S,超出最强基线 Chameleon(16.6%–18.4%)达 67.5–79.2 个百分点。
- 错误触发率保持低位:WebMirage 的 MTR 在 1.8%–3.0% 之间,在所有配置下均低于 EIA 与 VWA-Adv,并在两种真实世界智能体上为所有方法中最低;Chameleon 在沙箱配置下 MTR 略低,但 ASR 大幅落后。
- 基线方法不足的原因:作者认为 EIA 与 VWA-Adv 难以通过注入文本或中间表征诱发实际 UI 操作;Chameleon 虽然直接针对动作预测,但其固定输出目标未适应变化的候选映射及后处理逻辑。
网页变异性与语义扰动鲁棒性
- 测试内容:评估在未见渲染(未见槽位或未见同伴竞争)及语义重写请求下的攻击表现(Table 4, Table 5, Figure 5)。
- 实验结果:在未见渲染下,Retail、Accomm.、Tutoring 场景中 ASR-S 仅比已见渲染下降 1.6–4.8 个百分点,Home Service 下降 5.2–8.1 个百分点(Table 4);在 GPT-5.5 生成的 30 种重写语义请求下,宏平均 ASR 从 94.1% 微降至 89.8%(Table 5);在 420 个零售任务中,即使同时经历 3 次位置偏移与同伴变动,5 个底座的平均 ASR-S 仍达 80.0%(Figure 5(c))。
- 作者解读:作者认为攻击有效性不依赖于固定的同伴集合、目标位置或特定提问用词。
跨模型底座迁移性
- 测试内容:将单一源模型上优化出的扰动冻结,在相同设置下测试向同系列及跨架构模型的迁移能力(Table 6)。
- 实验结果:在同系列模型间(如 MiniCPM-o 迁往 MiniCPM-V 2.5/2.6,CogVLM 迁往 CogAgent 等),目标模型 ASR-S 保持在 81.2%–93.5%,攻击意图命令的 NLL 相对下降 65.7%–93.4%;但在跨架构模型间,ASR-S 降至 4.5%–23.8%,NLL 相对下降 31.6%–70.0%。
- 作者解读:作者指出同系列间的高迁移性说明扰动利用了族系内共享的特征;而跨架构迁移虽然改变了模型置信度,但无法提供可靠的执行层控制。
防御对策评测
- 测试内容:评测图像级清洗(JPEG 压缩、高斯模糊、均匀噪声)、现有智能体级防御(WebSentinel、Consistency Check、WebGuard)及自适应防御(动态标识符随机化)(Table 8, Table 9)。
- 实验结果:高斯模糊下 ASR-S 仍有 82.5%(Acc. 100%),高强度均匀噪声将 ASR-S 降至 45.7% 但干净准确率也跌至 58.5%(Table 8);三种现有智能体级防御下的 ASR-S 仍在 86.5%–91.9%(Table 8);动态标识符随机化将 ASR-S 从 93.8% 降至 11.7%,但干净任务准确率从 100% 降至 15.9%(Table 9)。
- 作者解读:作者认为现有防御仅监测注入文本、不一致图像描述或高危动作,无法防御候选视觉定位攻击;自适应标识符随机化虽能压制固定扰动,但带来了巨大的效用代价。
其他消融与分析
- 动作级数据流监督消融:将监督对齐至执行 token 使平均 ASR-S 从 70.4% 提升至 91.9%,优化目标平均长度从 88.0 降至 9.5 个 token,收敛轮数从超过 1,500 轮缩减至 441 轮(Table 7)。
- 扰动预算影响:在零售任务中,平均 ASR-S 在 ε=8/255 时为 73.2%,16/255 时升至 93.8%,32/255 时升至 98.9%(Figure 6)。
- 多步执行任务失败分析:在多步执行失败的 265 次运行中,43.4% 归因于认证/登录,31.7% 归因于弹窗遮挡,15.5% 归因于网络故障,仅 9.4% 归因于上下文漂移(Table 11)。
- 目标视觉渲染面积影响:目标图像占截图面积从 2% 增至 5% 和 10% 时,5 个底座的平均 ASR-S 分别为 62.8%、85.3% 和 97.4%(Table 12)。
负面结果与例外
- 在 Home Service 场景中,SeeAct 的 ASR-S 在各模型上相对偏低(69.0%–80.1%,Table 2),作者解释称该场景列表通常在密集布局中使用较小的缩略图减少了视觉面积,且查询常依赖属性匹配而非视觉身份,削弱了攻击利用的视觉定位信号。
- 跨架构迁移实验中,ASR-S 出现大幅下降(4.5%–23.8%,Table 6),无法实现可靠的执行层接管。
有什么可以进一步探索的点?
作者指出未建模整页变异且不适用于基于坐标的智能体,未来需探索随机标识符训练下的防御有效性。
作者指出的局限与后续方向
- 未建模整页任意变异:论文在第 4.2 节指出,重组过程中目标角色槽位集之外的页面区域保持不变,未对任意整页变异进行建模。
- 跨架构迁移无法实现可靠控制:论文在第 5.3.3 节指出,跨模型家族迁移虽然改变了模型置信度,但无法提供可靠的执行层控制。
- 随机标识符训练下的防御安全性待验证:论文在第 5.5 节指出,训练 VLM 进行定位和生成随机标识符可能会恢复干净性能,但经过此类训练后安全性收益是否依然存在仍有待探索。
- 推动流水线执行阶段防御研究:论文在第 6 节指出,模型层评测低估了穿透至浏览器执行阶段的攻击风险,有必要在该流水线阶段激发新的防御手段。
- 基于坐标的智能体在研究范围之外:论文在附录 C 中明确说明,基于坐标的智能体采用不同的定位接口,不在本文的研究范围之内。
- 静态分析的保守设计:论文在第 4.4 节指出,数据流分析采取了优先保证完备性的保守设计,因此在保留影响可执行命令的 token 的同时,可能会保留少许额外的 token。
实验覆盖范围
- 被测智能体与模型:评测覆盖 4 种智能体配置(SeeAct、WebVoyager 及 VisualWebArena 的两类变体)与 6 种开权重 VLM 底座(LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B、Phi-3-Vision-4B、Qwen2-VL-7B、CogVLM)。
- 任务场景与数量:评测覆盖 13 个真实公共网站的 1,710 个购物类任务和 VisualWebArena 沙箱的 540 个任务,合计 2,250 个任务。
- 受控图像与预算:实验仅对单个包含渲染图像的候选目标施加扰动,良性候选保持原样,默认扰动预算固定为 ℓ∞ 范数 16/255。
- 评测防御方案:包含 4 种图像清洗设置(JPEG 压缩、高斯模糊、两种预算均匀噪声)、3 种智能体级防御(WebSentinel、Consistency Check、WebGuard)及自适应动态标识符随机化。
- 未报告信息:论文未报告多轮评估的随机重复次数与方差,未报告静态数据流分析的具体执行耗时,且测试样本均限定在干净运行能够成功的任务。
总结一下论文的主要内容
论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
- 核心问题:现有对抗攻击聚焦于操纵模型推理或假设上下文固定,忽略了网页动态性带来的候选重排以及动作后处理逻辑,导致模型层攻击难以转化为浏览器执行层的实际控制。
- 方法设计:通过角色槽位抽象建模同功能元素在渲染中的竞争,利用网页重组模拟同伴变异与位置偏移,并借助基于 CodeQL 的静态数据流分析将优化目标精确限定至动作抽取所依赖的 token。
- 主要实验结果:
- 在跨 4 种智能体配置和 6 个 VLM 底座的 2,250 个任务中,WebMirage 取得 91.9% 的平均 ASR-S,大幅高出最强基线 Chameleon 的 17.4%(Table 1)。
- 在 SeeAct 跨 13 个网站的多步任务中取得 86.9% 的平均 ASR-M,90.6% 的多步失败源于弹窗或登录等外部环境障碍而非脱离攻击目标(Table 3、Table 11)。
- 在同系列模型间实现了 81.2%–93.5% 的迁移 ASR-S,但在跨架构模型间 ASR-S 降至 4.5%–23.8%(Table 6)。
- 数据流分析监督将优化目标长度缩减 87.4%,使平均 ASR-S 提升 21.5 个百分点,且收敛速度快于原始输出优化(Table 7)。
- 防御与启示:现有文本检测与图像清洗防御难以防范视觉定位层面的劫持;动态标识符随机化虽能压低攻击率至 11.7%,但会严重损害正常任务性能(准确率降至 15.9%)。作者认为仅凭模型层评测会低估执行层攻击风险,智能体需要在动作执行阶段构建专门防御机制。