LoginTrap:针对 LLM Web Agent 的任务无关钓鱼式间接提示注入攻击
LoginTrap: Uncovering Task-Agnostic Phishing-Style Indirect Prompt Injection Attacks against LLM-based Web Agents
研究者提出任务无关攻击LoginTrap,在80个网页与1175个任务测试中跨4个LLM骨干达到86%平均ASR。
黑盒钓鱼设定:攻击者控制克隆网页并在其中嵌入诱导登录弹窗,控制伪造入口跳转的登录页面;攻击者不知道用户任务、智能体架构、底层LLM、系统提示词或安全策略,无法修改运行时或观测内部推理;目标是诱导智能体将登录作为正当前提并向受控页面提交敏感信息。
- LLM网络智能体在执行日常任务时常遇到登录边界,现有操纵研究未充分考察恶意网页内容能否在未知晓用户任务与智能体内部机制的前提下,诱导智能体将登录视为前置步骤并泄露私密数据。
- 提出任务无关黑盒攻击LoginTrap,在克隆网页中放置弹窗诱导区域,结合网页上下文通过模糊测试启发流程生成页面特定话术,引导智能体进入受控登录页面并提交背景私密信息。
- 在基于Mind2Web构建的80个网页与1175个任务上,LoginTrap跨4个LLM骨干取得93%平均LER和86%平均ASR,在固定GPT-4o下跨3种智能体架构达到79%平均ASR与84%–94%的LER。
- 论文未设立独立局限章节,在结论中指出未来防御应推理登录与敏感输入对任务的必要性;实验在5步交互上限内覆盖了4个LLM骨干、3种智能体架构与5个领域的80个网页与1175个任务。
- 被测模型
- GPT-4oGemini 3 FlashClaude Sonnet 4DeepSeek-V3.2Browser-UseLiteWebAgentSkyvern
- 基准
- Mind2Web
- 指标
- LERASRPERAvg. Attempts Consumed
研究者提出 LoginTrap,一种针对 LLM Web Agent 的任务无关登录诱导攻击,通过网页上下文生成页面专属的间接注入,让登录看起来是继续任务的必要前提,并把 Agent 引向攻击者控制的登录页以窃取敏感信息。攻击者仅控制网页内容与登录流程,不知道用户任务、Agent 架构、底层模型或系统提示。在基于 Mind2Web 构建的 80 个克隆网页、1175 个任务实例上,攻击在 GPT-4o、Gemini 3 Flash、Claude Sonnet 4、DeepSeek-V3.2 四个模型上平均登录进入率 93%、端到端攻击成功率 86%;在 Browser-Use、LiteWebAgent、Skyvern 三种 Agent 架构上平均攻击成功率 79%。页面级结果显示所有测试网页在评估预算内均可被利用,现有任务指令、系统提示和动作监督层面的防御只能降低而无法消除敏感信息泄露。
推荐理由论文给出任务无关的登录诱导注入方法及跨模型、跨 Agent 架构的成功率数据,可帮助部署 Web Agent 的团队评估认证边界风险。
深度解读
这篇论文试图解决什么问题?
探索在未知晓用户任务的黑盒威胁模型下,通过网页内容诱导智能体执行伪造登录并泄露隐私的风险。
这篇论文试图解决攻击者能否在未知晓用户具体任务的情况下,通过受控网页诱导LLM网络智能体进入伪造登录流程并泄露敏感私密信息的问题。
- 登录边界的决策冲突:网络智能体代替用户浏览网页并执行操作,登录既是访问账户功能的常规通道,又是涉及凭据与敏感信息的安全边界;由于网页观测属于不可信输入,智能体难以判断登录是否为当前任务所必需。
- 现有操控研究的不足:现有关于提示注入、视觉注入与欺骗性界面的研究主要衡量智能体是否遵循注入指令并触发目标动作,未充分研究跨越敏感登录边界并导致端到端私密数据泄露的攻击;且现有攻击往往预先假定知晓用户任务或智能体内部配置。
- 核心观察与假设:现代网站广泛存在登录提示,但多数用户任务本身并不需要身份验证;注入的登录提示可能使智能体误将认证当成完成原始任务的正当预备步骤,进而主动进入敏感输入流程。
- 提出的攻击方案:作者提出了 LoginTrap,一种任务无关的诱导登录攻击,仅依靠网页上下文通过模糊测试启发流程生成针对特定页面的间接注入话术,诱导智能体访问受控登录页并提交敏感信息。
- 威胁模型:
- 攻击目标:诱导智能体将登录视为继续浏览的正当先决条件,进而将用户背景敏感信息填入受控登录流程。
- 攻击者知识:采用保守的黑盒设定,不知道分配给智能体的任务、智能体架构、底层LLM、系统提示词或任何安全策略,也无法修改运行时或观察内部推理。
- 攻击者能力:控制形似正常网页的克隆网页,能在页面插入包含诱导语句的弹窗,并控制由伪造入口跳转到的登录页面。
- 受害系统:代表用户执行日常任务、通过观察和操作(点击、输入、导航)与网页交互的LLM网络智能体。
有哪些相关研究?
梳理了智能体安全操纵、网络智能体注入与认证凭据钓鱼工作,指出本文聚焦无需任务先验的登录诱导路径。
LLM智能体的安全风险与操纵
- 多步智能体危害与环境操纵评估:AgentHarm (Andriushchenko et al., 2025) 与 AgentDojo (Debenedetti et al., 2024)、ASB (Zhang et al., 2025) 评估智能体完成有害多步任务或在多样攻击场景下的脆弱性。
- 工具使用与多源注入劫持:Shi et al. (2026)、ObliInjection (Wang et al., 2026) 与 Mind your server (Zhao et al., 2025) 研究了不可信工具输出、恶意工具描述及多源输入对工具选择决策与下游动作的操纵。
- 记忆与检索投毒:Topic-FlipRAG (Gong et al., 2025)、Les Dissonances (Li et al., 2026) 与 PoisonedRAG (Zou et al., 2025) 通过向持久记忆或检索库注入对抗记录,利用早期观测影响更长上下文中的后续动作。
网络智能体的提示注入与界面操纵
- 文本与结构化注入:Johnson et al. (2025)、EIA (Liao et al., 2025) 以及 Genesis (Zhang et al., 2025) 将对抗指令嵌入网页文本、HTML、DOM节点或无障碍树中进行操纵。
- 视觉与界面级注入:VPI-Bench (Cao et al., 2025)、Zhang et al. (2025) 与 AdInject (Wang et al., 2025) 将对抗内容置于弹窗、横幅、广告等渲染图像与界面区域;Decepticon (Cuvin et al., 2025) 与 Ersoy et al. (2025) 研究了暗模式等欺骗性界面设计对智能体的影响。
- 网络智能体基准评测:WASP (Evtimov et al., 2026) 与 WAInjectBench (Liu et al., 2025) 系统化评估了网络智能体在提示注入下的端到端安全与检测鲁棒性。
身份认证流程中的凭据泄露风险
- 密码登录与网络钓鱼:Tan et al. (2022) 将密码登录建模为钓鱼重定向的关键安全边界;Liu et al. (2022) 通过网页外观与动态行为推断钓鱼意图;Peng et al. (2019) 测量了提交至钓鱼站点的失窃凭据在生态中的传播。
- 自动填充与密码管理器风险:Silver et al. (2014) 分析了密码管理器在无需显式用户交互时的自动填充风险;Lin et al. (2020) 揭示了表单自动填充向隐藏或遮挡字段释放敏感数据的风险;Gautam et al. (2024) 发现填充后的密码可被恶意客户端脚本或扩展访问。
评测基准与实验环境
- 论文未引入外部现有攻击作为数值对比基线,主要在由 Mind2Web (Deng et al., 2023) 任务与克隆网页构建的受控测试环境中进行测量。
本文定位区别
- 作者指出,现有智能体攻击主要针对工具输出、记忆或需要已知任务的特定交互路径,而本文关注正常网页浏览中的委派执行;现有凭据安全研究关注登录界面出现后如何防范凭据泄露,而本文探讨攻击者如何在未进入认证界面前,利用网页上下文诱导智能体将登录视作必要前置步骤。
论文如何解决这个问题?
通过克隆网页弹窗呈现任务无关诱导话术,结合模糊测试迭代优化生成与受控登录流,诱使智能体泄露敏感信息。
LoginTrap 整体采用两阶段诱导攻击思路:首先在克隆网页中嵌入页面特定的任务无关诱导语句,促使智能体改变原有计划并优先点击伪造登录入口;随后将智能体引导至受控登录页面,诱使其提交背景敏感信息。
问题设定与形式化
- 智能体决策循环:智能体根据用户任务 T、背景信息 B 和历史记录 H_t 选择浏览器动作,其策略形式化为: at = Π(st, T, B, Ht) 其中动作包含操作类型、操作参数和目标元素三元组 (o_t, r_t, e_t)。
- 注入操纵目标:攻击者在固定任务、背景与历史的情况下,通过改变网页观测状态为 \tilde{s}_t 操纵下一步动作选取: ãt = Π(s̃t, T, B, Ht) 使智能体认为登录是继续当前任务的先决条件,从而触发登录入口点击并跳转至攻击者受控的登录页面。
受控攻击环境构建
- 网页克隆与注入表面:攻击者克隆原始网页以保持文本内容和视觉布局,将注入表面实现为网页上的受控弹窗容器。该容器包含诱导登录语句、伪造登录入口和关闭按钮,网页其余部分保持不变以隔离注入影响。
- 上下文对齐的受控登录流:智能体点击伪造入口后跳转至受控登录页。系统使用 LLM 总结克隆页面的主体内容和服务宗旨,结合登录模板生成与克隆页相符的说明描述,使登录请求看起来与当前页面服务一致。
- 标准化数据收集表单:受控登录页采用固定的分行分隔表单布局请求敏感字段,以便在不同网页、任务和智能体之间统一解析和对比敏感数据提交。
模糊测试启发的诱导话术生成
- 上下文构建与初始化:针对每个网页,利用 LLM(实验中采用 GPT-4o)提取页面紧凑摘要、潜在支持任务及一条不提及登录的良性探测任务。生成器基于多种语义策略为当前页面实例化候选诱导语句。
- 影子模型联合动作评估:每个候选语句嵌入网页后由两个影子 LLM 在良性探测任务下评估:一个作为基础评估器,另一个增加防范可疑网页指令的提示。仅当两者均预测出朝向登录入口的动作时,该候选语句才被接受;未通过者保留用于变异。
- 基于 MCTS 的种子选择与变异:若初始化未产生合格候选,未通过候选进入种子池。基于 MCTS 策略平衡探索与部分诱导信号以挑选种子(实验中选取奖励排名前 3 的候选),并应用交叉、扩展、重写或压缩进行变异。
- 攻击部署:在生成预算内一旦生成符合条件的语句,即输出并插入到克隆网页的弹窗容器中,随后在完整浏览器环境中接受测试。
论文做了哪些实验?
在5个领域80个网页与1175个任务上测试4个LLM骨干与3种架构,LoginTrap取得86%平均ASR。
实验设置
- 被测模型:测试了来自不同模型家族的 4 个 LLM 骨干:GPT-4o、Gemini 3 Flash、Claude Sonnet 4、DeepSeek-V3.2;以及 3 种网络智能体架构:Browser-Use、LiteWebAgent、Skyvern(均以 GPT-4o 为骨干)。诱导语句生成仅使用 GPT-4o。
- 数据集与规模:基于 Mind2Web 构建,涵盖 Travel(24 个网页,309 个任务)、Service(16 个网页,281 个任务)、Information(16 个网页,276 个任务)、Shopping(13 个网页,173 个任务)和 Entertainment(11 个网页,136 个任务)5 个领域,共计 80 个克隆网页和 1,175 个任务实例。
- 对比基线:论文未引入现有的外部攻击基线,主要在不同骨干模型、不同智能体架构之间进行横向对比评测。
- 指标定义:登录进入率(LER,点击伪造登录入口的任务比例)、端到端攻击成功率(ASR,进入受控登录流并输入背景敏感信息的任务比例)、页面可利用率(PER,在预算 C 内至少发生一次成功攻击的网页比例)以及平均尝试消耗次数(Avg. Attempts Consumed)。
- 执行与评审协议:每个任务从全新 Chrome 实例启动并重置浏览器状态;所有实验固定单任务最大交互步数为 5 步;基于可观测的浏览器操作日志进行动作标签化(点击入口记为进入,填入合成私密信息记为成功),无需人工打分模型或 LLM 评审打分。
- 样本量与重复次数:对于页面级可利用率,每个网页随机抽取 N=3 个良性任务,每个任务重复 K=3 次,共计 C=N×K=9 次尝试。
主结果
不同 LLM 骨干下各领域的页面可利用数(可利用数/总网页数)与平均尝试消耗次数(括号内,据 Figure 4):
表格较宽,可左右滑动
LLM 骨干 Travel (24页) Service (16页) Information (16页) Shopping (13页) Entertainment (11页) GPT-4o 24/24 (1.38) 16/16 (1.31) 16/16 (1.50) 13/13 (1.00) 11/11 (1.55) Gemini 3 Flash 24/24 (1.00) 16/16 (1.06) 16/16 (1.00) 13/13 (1.00) 11/11 (1.00) Claude Sonnet 4 24/24 (1.00) 16/16 (1.19) 16/16 (1.00) 13/13 (1.00) 11/11 (1.09) DeepSeek-V3.2 24/24 (1.12) 16/16 (1.00) 16/16 (1.19) 13/13 (1.08) 11/11 (1.00) - 总体有效性:作者报告,跨测试模型与领域,LoginTrap 取得 93% 的平均 LER 和 86% 的平均 ASR;在 C=9 预算下所有 80 个网页的可利用率 PER 均达 100%。
- 骨干模型的转化稳定性差异:Gemini 3 Flash 与 Claude Sonnet 4 展现出从 LER 到 ASR 最稳定的转化,多数网页在第 1 次尝试即被利用;作者认为更强的任务完成倾向会放大攻击效果,智能体更倾向于将受控表单填写视为流程的连贯继续。
- 中断现象与领域差异:GPT-4o 与 DeepSeek-V3.2 在高 LER 下存在更大的 LER-ASR 差距;作者指出这种差距主要由进入登录路径后的中断导致(未完成表单填写、提前终止、返回原任务),且购物、旅游与娱乐领域相比服务和信息领域更易使智能体接受登录理由。
跨网络智能体架构的泛化性评测
- 测了什么:在固定 GPT-4o 骨干下,评测 Browser-Use(直接工具循环)、LiteWebAgent(模块化接地分离)与 Skyvern(规划器/执行器/验证器多智能体工作流)3 种不同架构对 LoginTrap 的表现(Figure 5 与 Figure 6)。
- 实验结果:3 种架构的总体 LER 均保持在 84% 至 94%,总体 ASR 介于 68% 至 89%,平均 ASR 为 79%;在页面级利用上(据 Figure 6),Browser-Use 实现全部 80/80 网页可利用,Skyvern 在 80 个网页中利用 79 个(Service 域 15/16),LiteWebAgent 利用 75 个(Service 15/16、Information 15/16、Shopping 11/13、Entertainment 10/11),且 LiteWebAgent 平均消耗尝试次数更高(各域在 1.67 至 2.54 次)。
- 作者的解读:作者认为所有测试架构均能被诱导进入伪造登录路径,架构差异主要改变了智能体完成后续表单填写的稳定性而非消除诱导风险;LiteWebAgent 的动作生成与具体网页元素操作分离引入了更多执行失配可能,而 Skyvern 的工作流持久性机制有助于其在接受登录前提后继续完成表单。
其他消融与分析
- 变异阶段种子选择:对奖励排名前 3 的失败候选应用交叉、扩展、重写或压缩(Section 4.1)。
- 页面级预算参数:每个网页抽取 N=3 个任务、每个任务重复 K=3 次,总尝试预算 C=9 次(Section 4.1)。
- 交互步数上限:所有实验统一设置单次任务最大交互步数为 5 步(Section 4.1)。
- 失败案例与中断表现:进入登录路径后的失败表现为未完整填写表单、提前终止以及返回原始任务(Section 4.2)。
- 架构未利用网页情况:在 C=9 预算下,LiteWebAgent 共有 5 个网页未被成功利用,Skyvern 共有 1 个网页未被成功利用(Figure 6)。
有什么可以进一步探索的点?
论文未设立专门章节讨论局限,在结论中指出了未来防御方向,实验在80个网页与1175个任务上覆盖了4个LLM与3种架构。
作者指出的局限与后续方向
- 论文未专门设立独立小节讨论局限,仅在 Section 6 提出后续防御方向:未来网络智能体防御不仅应判断网页内容是否可疑,还应推理登录和敏感输入对于原始用户任务是否必要。
实验覆盖范围
- 被测模型与智能体架构:被测 LLM 骨干为 GPT-4o、Gemini 3 Flash、Claude Sonnet 4、DeepSeek-V3.2 共 4 个;智能体架构为 Browser-Use、LiteWebAgent、Skyvern 共 3 种(Section 4.2 与 4.3)。
- 基准与领域分布:测试基于 Mind2Web 数据集,包含 Travel(24个网页)、Service(16个)、Information(16个)、Shopping(13个)、Entertainment(11个)共 5 个领域、80 个克隆网页与 1,175 个任务实例(Table 1)。
- 交互步数与页面级预算:所有任务执行的最大交互步数统一设定为 5 步;页面级可利用率评测每个网页抽取 N=3 个任务、每个任务重复 K=3 次,总预算为 C=9 次尝试(Section 4.1)。
- 注入生成配置:仅使用 GPT-4o 负责网页上下文构建、初始候选生成、变异与候选评估;变异阶段从奖励排名前 3 的失败候选作为种子(Section 4.1)。
- 论文未报告信息:正文引言与结论提及现有防御降低但未消除泄露,但论文未在实验部分报告具体防御评测设置、基线与实验数据;论文未报告生成诱导语句的具体迭代预算与查询消耗。
总结一下论文的主要内容
揭示网络智能体在黑盒网页下的登录诱导风险,利用模糊测试生成话术并跨骨干和架构验证了隐私泄露威胁。
- 研究定位:针对大语言模型网络智能体在日常浏览中的身份认证边界,探讨任务无关的钓鱼式间接提示注入风险。
- 核心问题:现有攻击多关注指令执行或动作偏差,论文研究在黑盒且未知晓用户任务与智能体内部机制的严苛约束下,能否仅凭网页上下文诱导智能体将登录作为正当先决条件并提交敏感数据。
- 方法设计:提出 LoginTrap 攻击框架,在克隆网页中植入弹窗诱导区域,通过结合页面摘要与语义策略的模糊测试流程生成特定页面话术,并经双影子模型评估与变异筛选,最后利用 LLM 生成对齐的受控登录页面捕获敏感数据。
- 关键实验结果:在涵盖 5 个领域的 80 个克隆网页和 1,175 个任务实例评测中,LoginTrap 跨 4 个 LLM 骨干取得 93% 平均 LER 和 86% 平均 ASR;以 GPT-4o 为骨干跨 3 种智能体架构取得 79% 平均 ASR(LER 为 84%–94%);在 C=9 次尝试预算下,4 个骨干模型在所有 80 个网页上均实现 100% 页面利用率。
- 作者结论与启示:作者指出诱导登录构成了网络智能体的系统性认证边界风险,更强的任务完成倾向反而可能促使智能体连贯填表并加剧泄露;未来防御不能仅检测网页内容可疑性,而必须对登录与敏感输入的任务必要性进行推理判断。