WebInject:通过网页像素扰动对多模态网页 Agent 实施提示注入
WebInject: Prompt Injection Attack to Web Agents
WebInject改网页像素诱导目标动作;Gemma-3的ASR为0.972,作者称高出基线0.910。
攻击者控制或已攻破目标网页,可修改源码并访问智能体MLLM参数,可自建目标提示词、显示器信息与shadow history。
- MLLM网页智能体凭截图与提示词生成动作。攻击者能改网页源码,却不能改用户设备上的截图;作者认为启发式HTML注入难以兼顾有效与隐蔽,直接改截图又不现实。
- WebInject在原始像素上优化ℓ∞受界的扰动,使经ICC映射的截图提高目标动作概率。U-Net近似不可微映射,可微缩放替代模型缩放,PGD在多显示器重叠区域求解,再把扰动写回源码。
- 十数据集平均后,Table 1中Phi-4的WebInject ASR为0.963,UI-TARS为0.975。作者称Gemma-3比best-performing baseline高0.910;截图基线为0.000。
- 作者指出源码修改假设未必适用于Amazon等站点,且未评测向闭源MLLM的迁移。实验覆盖五个可访问参数的开源MLLM和自建真实与合成网页,默认一台LG显示器,按动作字符串是否精确相等计算ASR。
- 威胁模型
- 攻击者控制或已攻破目标网页,可修改源码并访问智能体MLLM参数,可自建目标提示词、显示器信息与shadow history。不能取得真实交互历史,也不能直接修改截图。目标是:在目标提示词或其语义相近变体、以及目标显示器上,使智能体执行指定动作,且改动对普通用户不可见。
- 被测模型
- UI-TARS-7B-SFTPhi-4-multimodal-instructLlama-3.2-11B-Vision-InstructQwen2.5-VL-7B-InstructGemma-3-4b-it
- 基准
- Real webpages (blog, commerce, education, healthcare, portfolio)Synthetic webpages (blog, commerce, education, healthcare, portfolio)
- 指标
- ASR
研究者提出 WebInject,一种通过修改渲染网页原始像素值来诱导多模态网页 Agent 执行攻击者指定动作的提示注入攻击。攻击把寻找扰动建模为优化问题,由于原始像素到截图的映射不可微,作者训练神经网络近似该映射,再用投影梯度下降求解。在多个数据集上的评测显示 WebInject 效果显著,优于基线方法。该工作发表于 EMNLP 2025 主会。
深度解读
这篇论文试图解决什么问题?
攻击者只能改源码时,如何让网页智能体执行指定动作且改动难被看见。
如何在只能修改网页源码、不能修改用户端截图时,让 MLLM 网页智能体执行指定动作,并使人眼难以察觉改动。
- 场景:智能体以用户提示词、显示器截图和已执行动作为输入,输出 click、type 等动作(Section 2)。作者称,诱导点击指定坐标可能造成点击欺诈、恶意下载或敏感信息泄露。
- 已有做法:作者分为两类。改源码的网页类多靠启发式,有效性不理想,注入元素通常可见;直接改截图不现实,因为截图在用户设备本地生成,且未处理 webpage-to-screenshot 映射。
- 作者的观察:不同显示器的尺寸和 ICC profile 会使同一网页的截图不同,且该映射不可微。作者称,把针对截图优化的扰动直接加到原始像素上会完全失败。
- 本文方法:WebInject 在渲染后的原始像素上求扰动,经映射后提高目标动作概率;ℓ∞ 范数受界,扰动只位于多个目标显示器的重叠区域。
- 威胁模型:
- 目标:effectiveness 要求用户发出目标提示词或其语义相近变体,并用目标显示器时,智能体执行 target action;stealthiness 要求普通用户看不出修改。
- 能力:可改目标网页源码。没有真实交互历史,但可从动作空间随机采样,构造 shadow history。不能直接改截图。
- 知识:可访问智能体 MLLM 的参数;作者称据此做 worst-case 分析。可自建目标提示词,并收集目标显示器的尺寸与 ICC profile。
- 受害系统:攻击者控制或已攻破的网页,以及在该页上运行的 MLLM 网页智能体。
有哪些相关研究?
作者把已有工作分为启发式或优化式提示注入,以及网页注入和截图扰动。
论文主要在引言和第 6 节讨论两类工作:通用提示注入,以及针对网页智能体的注入。
通用提示注入
- 手工构造:Willison(2022, 2023)、Greshake 等(2023)、Liu 等(2024)讨论在不可信输入中嵌入提示,使模型偏离原任务、转向攻击者选定任务。
- 自动优化:Hui 等(2024)、Shi 等(2024, 2025)、Jia 等(2025)用优化生成注入提示。Shao 等(2024)报告,毒化对齐过程可以放大模型对提示注入的脆弱性。
- 已有用途:Hui 等(2024)的 PLeak 诱导模型输出系统提示;Shi 等(2024, 2025)影响工具选择;Zhan 等(2024)的 InjecAgent 与 Debenedetti 等(2024)的 AgentDojo 涉及工具返回被污染。
网页智能体上的注入
- 改源码:Zhang 等(2024)的 pop-up attack 注入误导弹窗;Liao 等(2025)的 EIA 注入与合法元素相似的 HTML。引言把 Xu 等(2024)的 AdvAgent 也列入网页类。作者称这类攻击多靠启发式,有效性次优,元素通常可见,或为隐蔽牺牲一部分有效性。
- 改截图:Aichberger 等(2025)、Zhao 等(2025)在截图上加视觉扰动,以提高目标动作概率。作者称其不实用:攻击者不能直接改本地截图,且这些工作未讨论 webpage-to-screenshot 映射。
实验基线与数据集
- 基线方法:网页类把 Naive Attack、Context Ignoring、Fake Completion(Willison, 2022, 2023)和 Combined Attack(Liu 等, 2024)做成弹窗,并参照 EIA 与 Pop-up Attack。截图类按 Aichberger 等(2025)、Zhao 等(2025)在截图上优化,再把扰动加到原始像素。
- 基准/数据集:评测用作者自建的十个网页集,类别为 blog、commerce、education、healthcare、portfolio,各含真实页与合成页。
作者在结论中称,WebInject 是 the first effective, stealthy, and practical prompt injection attack to web agents:扰动可由修改源码实现,并处理显示器映射。
论文如何解决这个问题?
用U-Net近似显示器映射,再以可微缩放和PGD在重叠区域求ℓ∞扰动。
WebInject 不直接改截图。它在网页原始像素上求扰动 δ,再改源码实现该扰动,使经过显示器映射的截图提高目标动作概率。
问题设定与优化目标
- 渲染与智能体:源码 ω 经浏览器在显示器 d 上得到原始像素 I(ω, d),再按 ICC profile 映射为截图。动作为提示词、缩放后的截图和历史动作的函数。历史只含已执行动作。动作名见 Table 2,如 click、drag、type、scroll、finished。
- 有效性:对目标提示词集、目标显示器集和 shadow history 集,最小化目标动作 a* 的交叉熵之和,从而最大化式 (1) 中各 token 条件概率的乘积。
- 隐蔽与通用性:δ 的 ℓ∞ 范数不超过 ε。重叠区域的宽、高分别取各目标显示器宽、高的最小值;只在该矩形内优化,区域外为 0。
- 求解形式:映射和缩放换成可微近似后,作者求解
minδ∑p,d,H−log Pr(a∗|[p,r′(Nd(I(ω,d)+δ)),H]),
并保留 ℓ∞ 约束与区域外为 0 的约束。
两个不可微环节
- 显示器映射:对每个目标显示器训练映射网络 N_d,输入加扰动后的原始像素,输出对应截图。结构为 U-Net。训练对由随机扰动再经 ICC 映射得到;作者写可用 ICC profile 模拟显示器,不必物理接触。
- 缩放:MLLM 的缩放通常是离散重采样。优化时改用可微缩放,正文举例为 PyTorch 的 interpolate 与 TensorFlow 的 resize。
PGD 与写回源码
- 迭代:δ 初始化为 0,共 T 次。每次从提示词集和 shadow history 集抽 mini-batch,按损失梯度更新。
- 投影:Clamp 把元素限制在 [−ε, ε];掩码再把重叠区域外置 0。步骤见 Algorithm 1。
- 正文给出的超参:ε = 16/255,学习率 α = 0.3,T = 2500。映射网络用全部目标网页上的 16,240 对样本、200 epochs、学习率 0.005、batch size 16。论文未写 PGD 的 mini-batch 大小。
- 写回:注入代码在重叠区域取出原始像素,加上 δ 后写回。原 HTML 元素放到顶层且 opacity 为 0,使用户操作仍指向原元素,截图则来自扰动像素的 ICC 变换。实现片段见 Fig. 7。
论文做了哪些实验?
Table 1中Gemma-3的WebInject ASR为0.972,截图基线为0.000。
实验设置
- 模型:UI-TARS-7B-SFT、Phi-4-multimodal-instruct、Llama-3.2-11B-Vision-Instruct、Qwen2.5-VL-7B-Instruct、Gemma-3-4b-it。表中简称 UI-TARS、Phi-4、Llama-3.2、Qwen-2.5、Gemma-3。攻击者可访问参数。
- 数据:真实页用 SingleFile 保存;合成页由 GPT-4-Turbo 按类各生成 100 页。Table 3 的真实页为 Blog 50、Commerce 26、Education 42、Healthcare 51、Portfolio 43。每页 10 条目标提示词。论文写生成器用 GPT-4-Turbo,Fig. 10 相关句又写 guide GPT-4o。
- 历史与默认动作:优化用 shadow history,评测用 user history,各随机 10 条、每条 3–5 个动作。默认目标动作是重叠区域内随机坐标的 click((x,y))。
- 指标:式 (5) 先对目标显示器求动作字符串精确相等的比例,再对网页、提示词和 user history 平均。论文未使用 LLM 评审,未报告独立重复次数。
- 基线:Naive、Context Ignoring、Fake Completion、Combined 被做成弹窗,含 attention hook、文本指令和放在目标坐标的 information banner,参照 EIA 与 Pop-up Attack;点击 banner 算成功。截图类先在截图上优化,再把扰动直接加到原始像素。
- 优化与显示器:ε = 16/255,α = 0.3,T = 2500。每台目标显示器的映射网络用 16,240 对、200 epochs、学习率 0.005、batch size 16。除非另作说明,目标显示器是 1 台 27-inch 4K UHD LG 27UL500-W。另有物理机 24-inch iMac M1、15-inch MacBook Air M3,以及模拟的 Dell S2722QC、ASUS XG27UCG。
主结果
下表是 Table 1 的十数据集平均 ASR,对应默认单台 LG 显示器。Combined 因列数未列入。
表格较宽,可左右滑动
智能体 WebInject 截图基线 Naive Context Ignoring Fake Completion UI-TARS 0.975 0.000 0.085 0.147 0.054 Phi-4 0.963 0.000 0.095 0.050 0.047 Llama-3.2 0.972 0.000 0.270 0.212 0.345 Qwen-2.5 0.970 0.000 0.100 0.095 0.067 Gemma-3 0.972 0.000 0.062 0.054 0.037 - 作者的比较:作者称 WebInject 高于这些基线。引言给出的差值是 0.910,对应 Gemma-3 相对该表 best-performing baseline。
- 作者的归因:作者称差距来自直接最大化目标动作概率,网页基线则是启发式注入。截图基线按本文威胁模型实现,扰动加在原始像素上;作者称它没有越过 webpage-to-screenshot 映射。
- Combined:Table 1 另报 UI-TARS 0.050、Phi-4 0.025、Llama-3.2 0.248、Qwen-2.5 0.063、Gemma-3 0.062。Llama-3.2 的网页基线高于其他智能体,仍低于该行 WebInject。
显示器数量与扰动界
- 测了什么:Fig. 2 给出五个智能体平均 ASR 随目标显示器数量和 ε 的变化。Fig. 11–14 分数据集绘制,正文没有逐点读数。
- 作者称:显示器增多时 ASR 略降,因为只在重叠区域优化;并称此时两类基线仍差于 WebInject。ε 从 4/255 增到 32/255 时,ASR 升至接近 1。
- 隐蔽性:作者称 ε≤16/255 在 Qi 等(2024)、Luo 等(2024)中一般被视为隐蔽。Fig. 5 只给不同 ε 的网页示例。论文未报告用户察觉率。
提示词变体与其他目标动作
- 语义变体:GPT-4-Turbo 按 Fig. 8 生成文本不同、语义等价的用户提示词,再代入式 (5)。作者举例:Gemma-3、合成 Blog 上,该 ASR 为 0.957,同设置的目标提示词为 0.988。作者称并未针对这些用户提示词优化。
- Table 11:正文未逐格解读。该表最低为 Qwen-2.5、真实 Portfolio 的 0.871;UI-TARS 合成 Blog 与 Llama-3.2 合成 Education 均为 0.959。
- 其他动作:Table 10 只报告合成 Blog、Phi-4。九个动作的 ASR 为 0.993、0.980、0.988、0.979、0.976、0.982、0.992、0.987、0.990。type(content) 使用一条有害搜索查询,表注给出原文,此处不引。作者称这些动作上同样成功。
其他消融与分析
- Table 4 中 WebInject 最低为 Gemma-3、真实 Education 的 0.929;0.999 出现在 Qwen-2.5 合成 Commerce,以及 Gemma-3 合成 Commerce 与 Education。
- Table 9 的截图基线在所列智能体和数据集上均为 0.000。网页基线并非都接近 0:Table 6 中 Llama-3.2 合成 Education 的 Fake Completion 为 0.459;Table 8 中 Llama-3.2 真实 Healthcare 的 Combined 为 0.440。
- Table 12 在单张 NVIDIA RTX A6000 上、按每个目标网页和每个目标显示器,把训练时间写成 Δ 加 1.92、2.18、2.57、2.07、1.70 分钟,显存写成 Ω 加 1.93、1.99、2.61、2.10、2.18 GB,顺序为 UI-TARS、Phi-4、Llama-3.2、Qwen-2.5、Gemma-3。论文未给 Δ、Ω 的绝对值。
- Section 4.1 写 24-inch iMac M1 为 4480×2520、15-inch MacBook Air 为 2880×1864;Fig. 6 把该 iMac 标为 3200×1556,把 LG 27UL500-W 标为 3840×1916。论文未说明差异。
- 论文未报告映射网络的像素误差、PGD mini-batch 大小,以及 Section 8 所写源码检查、对抗样本检测和对抗训练的评测数字。
有什么可以进一步探索的点?
作者指出源码修改假设不适用于高可信站点,且未评测闭源MLLM上的迁移。
作者指出的局限与后续方向
- 源码控制:Section 8 写,可修改目标网页源码的假设,可能不适用于 Amazon 这类高可信站点。
- 闭源迁移:同一节写,没有评测向闭源 MLLM 的可迁移性。作者认为,高迁移通常要在多个代理模型上优化扰动(Hu 等, 2025),因计算资源不足而没有做。
- 后续方向:作者写,处理上述局限是一个值得研究的方向。
实验覆盖范围
- 被测 MLLM 为 UI-TARS-7B-SFT、Phi-4-multimodal-instruct、Llama-3.2-11B-Vision-Instruct、Qwen2.5-VL-7B-Instruct、Gemma-3-4b-it,共 5 个;攻击设定为可访问其参数(Section 3、5.1)。
- 数据为 5 类真实网页和 5 类合成网页。真实页数量见 Table 3:Blog 50、Commerce 26、Education 42、Healthcare 51、Portfolio 43;合成每类 100。每页 10 条目标提示词,shadow history 与 user history 各 10 条、每条 3–5 个动作。
- 默认目标显示器为 1 台 27-inch 4K UHD LG 27UL500-W。显示器数量实验使用 3 台物理显示器和 2 台 ICC profile 模拟显示器(Section 5.1、Fig. 2)。
- 成功判定是动作字符串精确相等(式 5)。报告的 ε 为 4/255、8/255、16/255、32/255。其他目标动作的数字只出现在合成 Blog、Phi-4(Table 10)。
- 论文未报告独立重复次数、PGD mini-batch 大小和映射网络近似误差。Section 8 写出源码检查、对抗样本检测、对抗训练三类可能防御,并称 DataSentinel 不适用,因为攻击不注入显式文本提示;实验节没有这些防御的评测数字。
总结一下论文的主要内容
WebInject经源码扰动原始像素;Table 1中五个智能体的ASR高于网页与截图基线。
WebInject 是对 MLLM 网页智能体的环境提示注入:修改网页源码,使原始像素上的扰动经过显示器映射后,诱导智能体执行攻击者指定动作。
- 问题:智能体根据提示词、截图和历史动作操作网页。作者认为,启发式 HTML 注入难同时做到有效和隐蔽;直接改截图又不符合攻击者接触不到用户截图的设定。
- 方法:在多个目标显示器的重叠区域内最小化目标动作的交叉熵,并用 ℓ∞ 范数约束扰动。U-Net 近似 ICC 映射,可微缩放替代模型缩放,PGD 求解后把扰动写回源码;原页面元素以零透明度放在顶层。
- 主结果:据 Table 1,十个数据集平均后,Phi-4 的 WebInject ASR 为 0.963,UI-TARS 为 0.975。作者称 Gemma-3 上比 best-performing baseline 高 0.910。按本文实现,截图基线为 0.000。
- 其他结果:作者称目标显示器增多时 ASR 略降,ε 增至 32/255 时 ASR 接近 1。语义等价但文本不同的提示词上,Gemma-3、合成 Blog 的 ASR 为 0.957。Table 10 中,合成 Blog、Phi-4 的 type(content) 为 0.976,left_double 为 0.993。
- 作者结论:作者称该攻击有效、隐蔽且可实施,并在结论中称它是 the first effective, stealthy, and practical prompt injection attack to web agents。Section 8 同时写,源码修改假设不适用于高可信站点,向闭源 MLLM 的迁移留待后续。