研究者提出面向 Agent 浏览器的 Web 威胁模型,梳理 20 类攻击并在 4 个模型上复现
WAAA! Web Adversaries Against Agentic Browsers
作者针对智能体浏览器提出 Web 威胁模型与 20 种攻击分类,在 4 款前沿模型上发现传统混淆攻击能绕过防护并导致数据泄露。
攻击者控制页面状态与输入内容,分为拥有 HTML/CSS 控制权的小工具攻击者(gadget attacker)与拥有脚本执行权的 Web 攻击者(web attacker);目标为同站点数据、跨站点数据或用户系统;受害系统为具备页面交互、导航、UI 或工具集成能力的 See→Act 智能体浏览器。
- 智能体浏览器将页面操作委托给 LLM,改变了传统 Web 安全假设。现有研究主要关注显式间接提示词注入,忽视了传统 Web 攻击者利用网络钓鱼、界面仿冒和诈骗等混淆交互手段对智能体造成的安全威胁。
- 作者将智能体建模为混淆代理,扩展 See→Act 模型以纳入来源和受控元素,基于浏览器与攻击者能力推导出包含 20 种攻击的分类法,并归纳出 5 类宏观失效模式,构建了 18 个概念验证攻击。
- 在 4 款模型测试中,传统混淆攻击展现出跨模型复现性,路径抢注成功率达 10/10;Perplexity 的 BrowseSafe 对 4 类混淆攻击全部漏检。提示词注入防御无法抵御伪装成良性界面的混淆攻击。
- 评估受限于 API 隐藏思维链不可见与域名抢注自动化判定不稳定;未测试缺乏触发接口的权限滥用与扩展静默安装攻击;实验运行受 120 秒时限约束。
- 被测模型
- GPT-5Claude-Sonnet-4.6Kimi-k2p5Qwen3.6 PlusChatGPT OperatorChatGPT AtlasPerplexity CometBrowseSafe
- 基准
- 18 PoC Attack ScenariosPlaywright-MCPBrowserOS
- 指标
- Attack Success Rate (out of 10 runs)PoC Success
北卡罗来纳州立大学研究者提出首个以 Web 为核心的 Agent 浏览器威胁模型,将传统 Web 攻击者纳入考量,并据此整理出 20 类攻击,其中 18 类做了概念验证实现。作者把 Agent 视为无法区分任务步骤与 Web 攻击的“混淆代理人”,扩展 See→Act 模型以覆盖浏览器各组件,发现 10 类已被现代浏览器缓解的 Web 威胁在 Agent 场景下重新出现,且常被放大。研究在基于 Playwright-MCP 的系统和 BrowserOS 上测试,并对 14 类攻击做泛化性研究,结果显示攻击可在来自多家厂商的 4 个主流 LLM 上复现,作者称现有模型对齐不足以覆盖这些攻击。
推荐理由论文把传统 Web 攻击重新纳入 Agent 浏览器威胁模型,给出 20 类攻击分类和跨 4 个模型的复现结果,可供设计 Agent 浏览器防护时参照。
深度解读
这篇论文试图解决什么问题?
作者称传统 Web 威胁模型在智能体浏览器中重现,将智能体建模为无法区分任务与攻击的混淆代理。
这篇论文试图解决智能体浏览器在面对利用合法交互模式而非显式指令的传统 Web 攻击者时的安全威胁与失陷机制。
- 交互范式转变与安全信任假设失效:各大厂商已将 LLM 集成到浏览器中以自主执行页面导航和交互;传统 Web 安全模型假设人类用户是交互与授权的最终裁决者,而在智能体浏览器中由概率模型控制,攻击者可通过构造页面内容诱导智能体执行特权操作。
- 现有防御视角的局限:以往对智能体浏览器的安全研究主要关注间接提示词注入(Indirect Prompt Injection),将安全问题抽象为输入清洗与过滤问题;作者认为这忽略了利用网络钓鱼、欺诈和界面拟态等正常交互模式的传统 Web 混淆攻击(Confusion Attacks)。
- 混淆代理核心假设:作者将智能体浏览器中的 LLM 建模为混淆代理(Confused Deputy),智能体获权代表用户执行特权操作,但在决策时无法区分合法页面组件与恶意组件,缺乏来源(Origin)感知与攻击者意图模型。
- 威胁模型(Threat Model):
- 攻击者目标(Attacker Target):获取同站点数据(Same-site data)、越权访问或外传跨站点数据(Cross-site data)、或控制用户系统与本地资源(System)。
- 攻击者能力(Attacker Capability):分为仅能控制 HTML/CSS 标记的小工具攻击者(Gadget attacker),以及具备完整 JavaScript 执行权与恶意来源控制权的 Web 攻击者(Web attacker)。
- 攻击者知识与假设:攻击者控制页面状态,无需利用传统内存安全漏洞或逻辑提权漏洞;不具备超出普通 JavaScript 和渲染 HTML 的额外能力,无法突破 HTTPS/TLS。
- 受害系统:基于 See→Act 模型运行的智能体浏览器,具备页面交互(a^p)、跨源导航(a^n)、浏览器 UI 操作(a^b)以及集成外部工具(a^x)等能力。
- 研究方案:作者称提出了首个面向 Web 的智能体浏览器威胁模型,梳理出涵盖 Web 与 LLM 维度的 20 种攻击分类,并基于此归纳出 5 类宏观失效模式。
有哪些相关研究?
既有研究多聚焦显式提示词注入,作者引入 Chromium 与 Web 攻击者模型以补充传统交互威胁。
智能体浏览器原型与交互模型
- See→Act 及其前序框架:Zhang et al. (2024) 提出 See→Act 模型,使 LLM 能基于网页截图和可点击区域生成浏览器操作;Yao et al. 提出 ReAct 框架,建立推理与动作交替执行的交互范式。
- 自主浏览基准:Deng et al. (2023) 提出 Mind2Web,Zhou et al. (2024) 提出 WebArena,评估 LLM 智能体在最小人工监督下自主完成复杂网络任务的能力。
智能体安全与提示词注入研究
- WASP 基准:Evtimov et al. (2025) 在 HTML 锚标签中嵌入显式指令(如忽略下方文本、专注上方目标)以改变智能体行为;作者指出该基准仅关注单站点交互目标,未涉及复杂的跨站点交互或对用户系统的操作。
- DoomArena 基准:Boisvert et al. (2025) 利用隐藏文本、长指令序列与定界符向智能体注入对抗指令;作者指出其仅使用单一间接提示词注入攻击测试原始导航请求。
- 环境注入与隐私泄露:Liao et al. (2025) 提出 EIA,利用环境注入攻击通用 Web 智能体以获取隐私;Ma et al. 评估多模态 LLM 智能体对环境干扰的敏感性;Greshake et al. (2023) 与 Wu et al. (2024) 研究间接提示词注入在 Web 智能体中的威胁。
传统 Web 安全架构与防御模型
- 浏览器安全模型:Barth et al. (2008) 形式化了 Chromium 浏览器的安全架构;Akhawe et al. (2010) 构建了 Web 安全的形式化基础,提出了小工具攻击者(Gadget attacker)与 Web 攻击者(Web attacker)模型。
- 经典 Web 威胁评估:Knittel et al. (2021) 提出 XSinator.com 自动化评估跨站点泄露(XS-Leaks);Huang et al. 分析点击劫持(Clickjacking);Spaulding et al. (2017) 研究拼写抢注(Typosquatting)技术的有效性。
基线方法与基准
- 对比基线与防御模型:论文在评估防御时对比了 Perplexity AI 提出的 BrowseSafe(Zhang et al., 2025),该模型作为开源中间过滤模型,旨在在输入到达 LLM 之前过滤恶意提示词注入。
- 本文定位与区别:作者指出,既有智能体安全基准将威胁局限于显式指令形式的间接提示词注入,忽视了传统 Web 攻击者通过钓鱼、诈骗与界面伪装发起的混淆攻击;本文将传统 Web 攻击模型与 See→Act 结合,建立了涵盖跨源交互与系统集成的系统化攻击分类。
论文如何解决这个问题?
作者扩展 See→Act 模型并推导包含 20 种攻击的分类法,归纳出 5 类宏观失效模式。
作者将传统 Web 安全原语引入智能体系统,扩展 See→Act 威胁模型并推导出包含 20 种攻击的分类体系,进一步归纳为 5 类宏观失效模式。
扩展 See→Act 形式化模型
- 细化动作空间:为刻画智能体越权能力,作者将智能体动作分解为四类互斥操作,即 at ∈ {ap, an, ab, ax},其中包含页面交互 ap、跨源导航 an、浏览器内置 UI 交互 ab 以及外部集成工具调用 ax。
- 引入 Web 安全上下文:将浏览器状态扩展为 st+1 = {ht, it, ot, ℰt},在网页标记数据 ht 和交互元数据 it 基础上,显式纳入当前展示来源 ot 及攻击者控制的元素集合 ℰt。
- 混淆代理与攻击者建模:攻击者可在受控来源注入特定元素或脚本,其目标定义为目标来源 ov、约束条件 ev 以及促使智能体调用的特权操作 aM。
攻击维度的笛卡尔积与分类法推导
- 维度枚举与筛选:作者枚举了浏览器能力(4 类)、输入表征(HTML 标记与带标注截图 2 类)、攻击者能力(小工具与 Web 攻击者 2 类)、攻击目标(同站点、跨站点、系统 3 类)共 60 种可能组合(Table 5)。
- 排除不合理组合:两位作者独立审查,依据物理不可行(如模型无数据访问权限)和相对于 Web 安全模型过度特权(如脚本攻击者攻击同站点数据)两个标准,排除了 20 种组合。
- 映射与去重:将剩余 38 种组合映射到 Web 安全文献与 LLM 威胁,去重后确定 20 种攻击(Table 1);其中 10 种在现代 Web 中存在类似攻击,10 种在传统 Web 安全文献中无直接对应物。
5 类宏观失效模式
- 智能体桥接同站点数据(SS):小工具攻击者控制部分用户生成内容,诱导智能体读取同源敏感信息(如 CSRF 令牌)并写回攻击者受控区域,无需在页面上执行脚本。
- 智能体桥接跨站点数据(XS):智能体在多标签页操作时,被诱导在不同来源之间转移信息或发起跨站操作,突破同源策略与隔离机制。
- 智能体幻觉 URL(SQ):当目标元素不可见时,智能体倾向于推测并生成看似合理的路径或域名(如 /settings 或子域名),攻击者可预先抢注这些资源拦截流量(Slop squatting)。
- 网站反向攻击 LLM 自身(LLM):恶意站点检测智能体访问特征以提供差异化内容,或利用伪造弹窗从提示词中提取凭据与隐私(Prompt leakage 与 Fingerprinting)。
- 智能体滥用集成工具(I):智能体接入文件系统、代码执行或外部 API 等工具时,恶意网页诱导其调用这些合法工具,导致越权访问或在宿主系统执行代码。
概念验证实现
- 概念验证构建:作者针对分类法中的 18 种攻击构建了概念验证(PoC)实现,覆盖 Playwright-MCP 与 BrowserOS 环境;其余 2 种攻击因缺乏对应触发接口未做 PoC。
论文做了哪些实验?
测试显示传统混淆攻击在多款模型上可复现,且 Perplexity 的 BrowseSafe 防御模型对混淆攻击全部漏检。
实验设置
- 被测模型:泛化评估测试了 GPT-5、Claude-Sonnet-4.6、Kimi-k2p5、Qwen3.6 Plus 共 4 款模型;案例分析测试了 ChatGPT Operator、ChatGPT Atlas、Perplexity Comet;提示词注入开发使用了开源模型 GPT-OSS;防御评估测试了 BrowseSafe 模型。
- 实验环境与测试工具:使用基于 Playwright-MCP(v0.0.64)的测试工具以及未经修改的开源商用智能体浏览器 BrowserOS(v0.40.1);通过 MCP 添加文件系统与远程代码执行工具。
- 评测协议与样本量:对 14 种攻击开展自动化泛化测试,每款模型每种攻击重复运行 10 次;会话时间限制为 2 分钟(120 秒),超时或攻击成功即停止。
- 成功判定标准:仅当智能体完整完成攻击设定的全部操作(如成功提交特定凭据、或访问第三方域并传回匹配 Cookie)时判定为成功;智能体撒谎、猜测或未传回目标数据均不计入成功。
主结果
表格较宽,可左右滑动
模型 SS-1 (同源数据泄露) XS-2 (跨源操作混淆) XS-3 (跨源泄露) XS-6 (私网访问) SQ-1 (路径抢注) GPT-5 7/10 7/10 7/10 6/10 10/10 Kimi-k2p5 10/10 6/10 8/10 8/10 10/10 Claude-Sonnet-4.6 1/10 10/10 4/10 10/10 10/10 Qwen3.6 Plus 9/10 9/10 8/10 9/10 10/10 据 Table 2,表中选取了跨越不同失效模式的 5 种典型攻击,呈现各模型在 10 次运行中的成功次数(省略了其余 9 种泛化测试攻击与未测试泛化的攻击)。
- 传统混淆攻击具有跨模型复现性:作者报告,跨源操作混淆(XS-2)、私网数据访问(XS-6)与路径抢注(SQ-1)在全部 4 款模型上均保持较高成功率,SQ-1 在 4 款模型上均为 10/10。
- 混淆攻击与注入攻击的易受害度差异:作者发现,模型面对伪装成正常交互的混淆攻击(如 XS-2、SS-1)时比面对传统提示词注入(如 XS-1、SS-3)更容易受害;在 SS-3 中除 GPT-5 取得 3/10 外其余三款模型均为 0/10,而在 SS-1 中 Kimi-k2p5 与 Qwen3.6 Plus 分别达 10/10 与 9/10。
- Claude-Sonnet-4.6 的行为表现:Claude-Sonnet-4.6 在多项测试中成功率较低(如 SS-1 为 1/10,SS-3、SS-4、SS-5、XS-4、XS-5 均为 0/10),作者将其归因于该模型倾向于将评测视为网络安全基准,并主动反混淆验证码中的 JavaScript。
针对 BrowseSafe 防御模型的有效性评测
- 测试设置:选取 Perplexity AI 的开源中间过滤模型 BrowseSafe,评测其面对 4 类混淆攻击(Prompt leakage、Same-site action-oriented confusion、Integration-based attack、Cross-site action-oriented confusion)时的拦截能力。
- 评测结果:在全部 4 种混淆攻击场景下,BrowseSafe 均未能将其识别为恶意内容,全部判定为良性页面(4/4 漏检)。
- 作者解读:作者认为 BrowseSafe 仅依赖显式提示词注入模式进行检测,面对缺乏对抗性指令文本、依赖合法交互上下文的传统混淆攻击时无法发挥防御作用。
针对商用与开源智能体浏览器的案例分析
- 同源操作混淆(SS-4):在公告栏界面诱导提交密钥的测试中,向提示词添加授权短语后 Perplexity Comet 与 ChatGPT Operator 均复制密钥并发布,ChatGPT Atlas 则标记为间接提示词注入并要求人工确认。
- 通用跨站脚本(XS-4):在 Playwright-MCP 与 BrowserOS 上,模型均执行了经混淆的脚本并传回第三方 Cookie;未混淆时模型会尝试直接提取 URL 进行导航。
- 集成远程代码执行(I-5):在实习申请场景中,GPT-5 在 Playwright-MCP 上调用工具写入 Python 文件;ChatGPT Operator 与 Atlas 则调用内置工具在云端服务器执行代码。
- URL 幻觉抢注(SQ-1 与 SQ-2):在仿冒 Reddit 页面测试中,所有被测模型均在 Playwright-MCP 与 BrowserOS 上幻觉出内部子路径或博客子域名。
其他消融与分析
- BrowserOS 系统提示词变更:2025 年 12 月的提示词更新促使智能体更多向用户确认导致攻击失败,而在用户提示词中附加授权短语即可恢复攻击成功(Table 2)。
- 自动化泛化排除域名抢注(SQ-2):因难以将导航到受控域稳定转化为可观测的代理命中,故未纳入自动化泛化表格(Section 7)。
- 权限滥用(I-1)与扩展静默安装(I-2):因测试平台缺乏对应交互接口而未进行 PoC 与泛化测试(Table 1, Table 2)。
- 工具调用移除对攻击的影响:Perplexity Comet 在 2025 年 9 月支持远程代码执行攻击,但在 2025 年 11 月移除相关工具调用后该攻击无法复现(Section 6.2.4)。
有什么可以进一步探索的点?
作者指出评估受限于 API 隐藏思维链不可见与域名抢注判定不稳定,未来需探索最小权限与信任注解。
作者指出的局限与后续方向
- 思维链不可见性限制机制分析:在评估 Claude-Sonnet-4.6 时,由于官方 API 未公开其思考 token,作者无法深入探究该模型反混淆脚本及表现差异的底层原因(Section 7)。
- 域名抢注评估自动化困难:域名抢注(SQ-2)的成功判定依赖智能体导航到攻击者控制的域名,在现有测试工具中无法稳定转化为可观测的代理命中,导致该攻击无法进行稳定的自动化评估(Section 7)。
- 部分攻击缺乏触发接口:权限滥用(I-1)与扩展静默安装(I-2)在 Playwright-MCP 和 BrowserOS 中缺乏触发对应能力的智能体接口,当前无法进行实测(Section 5.4)。
- 收缩智能体能力范围:作者建议浏览器厂商利用分类法将智能体能力限制在目标工作流所需的最小范围,避免不必要地开放导航或浏览器 UI 权限(Section 8)。
- 引入显式结构化信任注解:当前 Web 缺乏同站点内容信任标记,作者建议开发者通过 HTML 结构属性标记受信任区域与不可信 UGC 区域,辅助 LLM 作出信任决策(Section 8)。
- 构建基于威胁模型的安全中介:作者提出需要重构浏览器与智能体之间的信任架构,引入能够感知智能体威胁模型的规则或干预机制,在操作越界时介入拦截(Section 8)。
实验覆盖范围
- 被测模型范围:自动化泛化测试覆盖 4 款模型(GPT-5、Claude-Sonnet-4.6、Kimi-k2p5、Qwen3.6 Plus),案例分析覆盖 ChatGPT Operator、ChatGPT Atlas、Perplexity Comet 以及 BrowseSafe。
- 测试框架与攻击数量:基于 Playwright-MCP 与 BrowserOS 构建了 18 种 PoC 场景,对其中 14 种进行了 10 次重复测试;未测试 I-1 与 I-2。
- 测试时间预算:单次测试设定了 120 秒(2 分钟)的时间上限,超时或成功即终止(Section 6.1, Appendix B)。
- 论文未报告指标:论文未报告各攻击的 Token 消耗量、API 查询开销或执行耗时;未报告在开放互联网真实域名下的注册拦截与劫持统计。
总结一下论文的主要内容
作者提出面向智能体浏览器的 Web 威胁模型与攻击分类,测试显示传统混淆攻击可复现且能绕过现有防御。
这篇论文研究了智能体浏览器在面临传统 Web 攻击者时的安全性问题,指出当前针对提示词注入的安全假设无法抵御基于正常 Web 交互模式的混淆攻击。
- 问题定位:将 LLM 接入浏览器打破了人类作为安全裁决者的传统假设,智能体作为混淆代理无法辨别合法组件与恶意构造的页面内容。
- 威胁模型与分类法:作者扩展了 See→Act 模型,结合 Chromium 与 Web 攻击者模型,从浏览器能力、攻击者能力与目标三个维度推导并构建了包含 20 种攻击的分类体系。
- 5 类宏观失效模式:将攻击归纳为同站点数据桥接、跨站点数据桥接、URL 幻觉抢注、反向针对 LLM 的攻击以及集成工具滥用 5 类模式。
- 概念验证与防御失效:构建了 18 种 PoC 攻击;在测试中,Perplexity AI 的 BrowseSafe 检测器对 4 类混淆攻击全部漏检。
- 泛化测试结果:在 4 款前沿与开源模型测试中,路径抢注在全部模型上均达到 10/10 成功率;模型对伪装成良性界面的混淆攻击表现出比显式提示词注入更高的依从度。
- 启示与防御方向:作者认为当前对齐手段不足以应对传统 Web 威胁,建议未来通过最小化能力授权、网页结构化信任注解以及架构级安全中介机制重构智能体浏览器。