跳到正文
原文
论文追踪· arXiv:2604.02623·本站收录 · 原文发表 精选关注度56

论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

Poison Once, Exploit Forever: Environment-Injected Memory Poisoning Attacks on Web Agents(eTAMP)

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

作者通过网页向 Web 智能体注入带条件的轨迹记忆,在 GPT-5-mini 上挫败感利用与混沌结合时 ASRB 达 32.5%。

威胁模型攻击者无法直接访问记忆库或系统提示词,仅通过网页内容注入恶意文本并设置触发条件;受害系统为采用原始轨迹记忆的 Web 智能体;目标是诱导智能体在后续不同网站执行未授权操作(如加购结算或发帖好评),同时保持前序任务正常完成。

问题
Web 智能体将历史交互轨迹存入记忆以实现个性化,但这也引入了持久攻击面。现有研究多假设攻击者拥有直接修改数据库权限或多用户共享记忆,缺乏对无直接写入权限下仅通过环境观察注入威胁的评估。
方法
作者提出 eTAMP,攻击者在公开网页中植入带触发条件的载荷并被动存入轨迹记忆,待后续语义相关任务检索时激活跨网站未授权操作。此外引入 Chaos Monkey 注入动作丢弃与混淆,模拟环境挫败对攻击的放大效应。
实验与结果
在 WebArena 与 VisualWebArena 上,GPT-5-mini 在混沌压力下 ASRB 达 32.5%,GPT-5.2 达 23.4%(Table 1)。非伪轨迹测试中各模型任务 A 过早触发率 ASRA 均不高于 0.71%(Table 7)。
局限与可以继续做的
研究仅覆盖未经处理的原始轨迹记忆,未评估整合记忆;未系统性评测内容过滤等防御机制;模型环境异常感知率与任务成功率未见一致关联;长上下文召回测试仅采用一种提示词配置。
实验设置GPT-5-mini、GPT-5.2 等 · WebArena、VisualWebArena · ASRB、ASRA 等
模型
GPT-5-miniGPT-5.2GPT-OSS-120BQwen2.5-VL-72BQwen3-VL-32BQwen3.5-122B-A10BGPT-5.4
基准
WebArenaVisualWebArena
指标
ASRBASRATask Success Rate (TSR)Avg StepsPoison Rate (PR)Recall Rate
AI 导读和推荐理由全文 394 字

亚马逊与宾州州立大学研究者提出 eTAMP,一种仅通过环境观察即可实现的轨迹记忆投毒攻击,攻击者在网页用户生成内容中埋入指令,Agent 浏览后被动写入记忆,并在后续不同网站的任务中触发,无需直接访问记忆库,可绕过按站点授予权限的防御。在 (Visual)WebArena 上,约 280 组跨站点任务对中,攻击成功率最高为 GPT-5-mini 32.5%、GPT-5.2 23.4%、GPT-OSS-120B 19.5%;任务 A 阶段的提前触发率接近 0。研究还发现 Frustration Exploitation 现象:在 Chaos Monkey 注入点击丢失、滚动反转、输入乱码等环境压力后,GPT-5-mini 攻击成功率从 3.6% 升至 32.5%,提升约 8 倍,GPT-5.2 上升 17 个百分点。作者提示记忆应被视为不可信输入,并指出能力更强的模型未必更安全。

推荐理由论文提出仅靠网页内容注入即可跨会话、跨站点污染 Agent 记忆的攻击,并给出多款模型上的成功率与压力条件下的放大效应。

深度解读

6 个问题 · 约 6,600 字

  1. 这篇论文试图解决什么问题?

    作者研究基于原始轨迹记忆的 Web 智能体在无需直接访问存储时遭受跨会话、跨网站环境注入记忆投毒攻击的风险。

    这篇论文试图解决基于大语言模型的 Web 智能体在复用历史交互轨迹作为记忆时,面临通过环境观察注入恶意指令导致跨任务、跨网站被利用的安全风险。

    • 场景与重要性:作者指出,Web 智能体通过保存历史交互来个性化未来的浏览和购物任务,但这一机制也引入了跨网站和跨会话的持久攻击面。随着 AI 浏览器的出现,用户依赖智能体处理多网站工作流,未受信任的内容可能被作为记忆持久化存储。
    • 现有研究的不足:作者认为,现有的智能体记忆攻击大多依赖强假设,例如需要直接访问智能体的知识库或记忆数据库,或者假设多个用户之间共享记忆。此外,现有的 Web 智能体注入基准主要集中在单会话内即时生效的攻击,未评估历史轨迹作为记忆被检索时的跨会话持久性。
    • 核心观察与假设:作者提出,攻击者仅需在公开网页中植入恶意内容,智能体在正常浏览时就会被动收集这些观察并存入原始轨迹记忆中。当未来的任务语义相关并检索该轨迹时,恶意指令就会被激活并跨越网站权限隔离;同时作者假设,智能体在遇到环境干扰(如网络延迟或输入异常)陷入困境时,会更容易遵从注入指令。
    • 威胁模型:
      • 攻击者目标:攻击者旨在通过在源网站注入指令污染记忆,诱导智能体在后续不同目标网站执行未经用户授权的操作(如添加商品并快速结账、发布虚假五星好评)以获取经济利益。
      • 攻击者知识:攻击者了解 Web 智能体系统的通用结构、常见动作空间(goto、click、type、scroll)以及常见的浏览或购物任务模式,但无法直接访问或修改智能体的记忆库,也无法改变模型架构、权重或系统提示词。
      • 攻击者能力:攻击者能够通过用户生成内容(如商品描述、论坛帖子)向网页注入任意文本,并根据可观察的环境特征(如 URL 模式、页面内容)构建条件触发器;攻击者无法预知用户未来请求的具体任务或时间,也无法获知其他会话中记忆的实际内容。
      • 受害系统:基于大语言模型、使用原始轨迹作为上下文示例(in-context examples)的 Web 智能体,在沙盒化的动态 Web 环境中执行多步网页导航任务。
    • 论文的提出方案:作者提出了环境注入轨迹级智能体记忆投毒攻击(eTAMP),并引入基于混沌工程的 Chaos Monkey 机制,用于测试智能体在网络延迟、按键异常等环境压力下的脆弱性。
  2. 有哪些相关研究?

    相关研究涵盖间接提示词注入、智能体记忆攻击与 Web 智能体安全;作者指出既有记忆攻击多假设直接修改存储或多用户共享。

    相关研究主要集中在以下三个方向:

    • 提示词注入攻击:Perez & Ribeiro (2022)、Willison (2022)、Greshake et al. (2023) 与 Liu et al. (2024) 研究了大语言模型的间接提示词注入威胁;Shi et al. (2025) 在 Gemini 上研究了间接注入并报告能力更强的模型有时更易受操纵;Zhan et al. (2024)(InjecAgent)与 Debenedetti et al. (2024)(AgentDojo)提出了评估基准,但作者指出这些工作假设单会话攻击,注入与执行发生在单次交互中。
    • 智能体记忆攻击:Xiang et al. (2024)(BadChain)与 Chen et al.(AgentPoison)通过后门机制篡改思维链或知识库,但作者指出它们依赖操纵提示工程或直接访问记忆库的强假设;Dong et al.(MINJA)与 Patlan et al. (2025)(CrAIBench)研究了免直接写权限的记忆攻击,但作者指出它们假设多用户共享记忆库;Kutasov et al. (2025)(SHADE-Arena)研究了智能体压力下的破坏,但作者指出其明确指示模型执行恶意任务,与本文的隐蔽注入不同。
    • Web 智能体攻击:Wang et al. (2024)、Ma et al. (2024)、Wu et al. (2024a)、Chen et al. (2025) 与 Liao et al. (2024) 分别研究了微调投毒、环境干扰、观测对抗和微型文字注入;Wu et al. (2024b)(WIPI)、Evtimov et al. (2025)(WASP)与 Liao et al. (2025)(RedTeamCUA)在沙盒环境中测试智能体安全性,但作者指出它们关注单会话或单任务攻击,未测试原始轨迹记忆跨网站权限边界的持久性。
    • 基线方法与基准:实验基于 WebArena 与 VisualWebArena 两个基准;攻击对比了基线注入(Baseline Injection)、权威框架(Authority Framing)以及挫败感利用(Frustration Exploitation)三种策略。

    作者称本文与先前工作的区别在于:采用无需直接访问数据库的现实威胁模型、基于单用户独立记忆模型,并评估跨会话与跨网站的持久影响。

  3. 论文如何解决这个问题?

    eTAMP 通过网页被动注入带条件触发的载荷并存入轨迹记忆,利用任务语义相关性检索激活;辅以 Chaos Monkey 诱发环境压力。

    作者提出了环境注入轨迹级智能体记忆投毒攻击(eTAMP),通过网页中的对抗内容污染原始轨迹记忆,在后续语义相关任务中触发未授权动作。

    攻击形式化与核心目标

    • 智能体 π 在环境 E 执行任务 T 产生轨迹 Traj(π, T, E)。攻击者构造恶意载荷 x,目标是在检索到被投毒记忆 mA 后最大化任务 B 执行目标动作 g 的概率:
      maxx Pr[g ∈ Traj(π, TB, EB, mA)]
      其中目标动作 g 为导航至特定 URL(goto)以触发服务器端非预期操作(如商品结算或虚假评分)。
    • 为保证隐蔽性,攻击载荷需满足任务 A 正常完成的约束条件:
      Eval(Traj(π, TA, EA(x))) = Eval(Traj(π, TA, EA))
      该约束确保用户不会察觉记忆已被污染。

    攻击载荷设计与三种策略

    • 载荷结构:载荷由重要性信号(提高模型关注度)、触发条件(基于 URL 等环境特征或困境状态)以及攻击目标动作(goto 命令)三部分构成,附录 Table 5 与 A.5.1 给出了具体的提示词模板。
    • 基线注入(Baseline Injection):结合换行符分隔、重要性强调以及忽略先前指令的表述,在目标网站 URL 匹配且智能体即将执行任意动作时触发跳转。
    • 权威框架(Authority Framing):伪装为紧急系统会话恢复提示,声称前序任务发生关键错误,要求智能体在目标网站交互前必须先执行特定会话恢复跳转。
    • 挫败感利用(Frustration Exploitation):设定在目标网站 URL 匹配且智能体遭遇操作困难(如点击无响应、输入返回异常、页面未变化、重复动作无效等)时触发,诱导智能体将注入指令作为解法。

    混沌工程机制(Chaos Monkey)

    • 动作扰动机制:为模拟网络延迟与渲染故障等现实环境不确定性,Chaos Monkey 在任务 B 执行期间对智能体动作注入概率性转换。
    • 具体扰动参数:以概率 pclick = 0.4 将点击转换为无操作(no-op);以概率 pscroll = 1 反转滚动方向;以概率 ptype = 1 采用凯撒密码对输入文本进行确定性替换。
    • 步数调整:启用 Chaos Monkey 时,最大允许步数从 15 步调整为 37 步,给智能体探索和尝试完成任务的机会。

    跨网站任务配对与伪轨迹构建

    • 语义匹配配对:首先收集干净轨迹并抽取其中的物品元数据;随后使用句子转换器模型计算物品名称与任务 B 意图的嵌入,通过余弦相似度将任务 A 轨迹与最相似的任务 B 配对(共构建约 280 个任务对)。
    • 伪轨迹设置:主实验采用伪轨迹设置,直接将恶意文本嵌入相关页面轨迹以保证中毒率达到 100%;作者称该设计可排除智能体自主导航偏差对攻击评测的干扰,并在附录中与自由导航的非伪轨迹设置进行了对比校验。
  4. 论文做了哪些实验?

    eTAMP 在 GPT-5-mini 和 GPT-5.2 上分别取得最高 32.5% 和 23.4% 的 ASRB;混沌压力使部分模型易感性增加数倍。

    实验设置

    • 被测模型:GPT-5-mini、GPT-5.2、GPT-OSS-120B、Qwen2.5-VL-72B、Qwen3-VL-32B、Qwen3.5-122B-A10B(本地通过 llama.cpp 部署 UD-Q8_K_XL 量化版),以及用于感知评估的 GPT-5.4。
    • 基准环境与任务对:基于 WebArena 与 VisualWebArena 的 Shopping、Reddit、Classifieds 三个领域,构建约 280 个跨网站任务对(Reddit→Classifieds 84 对,Reddit→Shopping 93 对,Shopping→Reddit 103–106 对)。
    • 交互与记忆配置:智能体采用全历史交互配置,被投毒的任务 A 轨迹作为历史轮次注入到任务 B 前;输入包括 SoM 可访问性树、URL 和任务目标。
    • 攻击策略与扰动条件:评测基线注入、权威框架以及挫败感利用;挫败感利用分别在无混沌与 Chaos Monkey(pclick=0.4, pscroll=1, ptype=1)下测试。
    • 评测指标:ASRB(任务 B 恶意动作执行率)、ASRA(任务 A 过早触发率)、TSR(任务成功率)、平均步数(Avg Steps);附录报告中毒率(PR)、召回率与异常感知率。
    • 样本量与判定方式:每组基于约 280 个任务对;ASR 依据是否执行攻击 URL 判定;环境异常感知由 GPT-5.4 评审并仅保留高置信度案例。

    主结果

    据 Table 1,不同模型与策略下的 ASRB (%) 结果如下:

    表格较宽,可左右滑动

    模型基线注入权威框架挫败感利用 (无混沌)挫败感利用 (混沌)混沌增量 Δ (%点)
    GPT-5-mini4.62.53.632.5+28.9
    GPT-5.21.822.36.423.4+17.0
    GPT-OSS-120B19.514.56.014.2+8.2
    Qwen3.5-122B1.80.02.112.0+9.9
    Qwen3-32B4.35.73.23.9+0.7
    Qwen2.5-72B0.00.00.00.7+0.7
    • 攻击在多种模型上达成有效成功率:作者称环境注入记忆投毒构成了现实威胁,在挫败感利用且存在环境压力时,GPT-5-mini 的 ASRB 达到 32.5%,GPT-5.2 达到 23.4%;无混沌下 GPT-OSS-120B 在基线注入下 ASRB 为 19.5%,GPT-5.2 在权威框架下为 22.3%。
    • 环境压力放大部分模型的易感性:作者称环境压力放大了攻击效果,GPT-5-mini 的 ASRB 增加 8 倍(从 3.6% 升至 32.5%),GPT-5.2 提升 17.0 个百分点,Qwen3.5-122B 提升 9.9 个百分点;而 Qwen3-32B 与 Qwen2.5-72B 各增加 0.7 个百分点。
    • 任务完成能力与安全防御表现背离:作者称更强的任务性能并不意味着更高的安全性,GPT-5.2 在任务成功率较高的同时对权威框架及混沌压力表现出易感性。

    混沌工程对任务效用与异常感知的影响

    • 任务成功率与步数:据 Table 2,在挫败感利用条件下,启用 Chaos Monkey 使大多数模型的 TSR 下降(Qwen3-32B 从 13.5% 降至 7.4%,GPT-5-mini 从 13.3% 降至 10.7%),但 GPT-5.2 从 13.0% 升至 14.8%;平均步数均上升(GPT-5-mini 从 7.7 增至 17.7,GPT-5.2 从 8.7 增至 17.5)。
    • 记忆投毒对任务效用影响较小:据 Table 2,对比干净轨迹与无混沌攻击条件,各模型的 TSR 差异在 1 至 4 个百分点以内;作者认为上下文中的恶意记忆本身不会降低任务性能。
    • 环境异常感知差异:据 Table 3,在混沌条件下,GPT-5.4 评审判定 GPT-5.2 在 7.4% 的轨迹中表现出高置信度环境问题感知,Qwen3-32B 为 2.1%,GPT-5-mini 为 1.1%,而在干净与无混沌条件下感知率接近 0%。

    长上下文召回能力诊断测试

    • 测试方法与目的:为检验模型对注入指令的抵抗源于无法检索还是主动防御,作者在权威框架配置下针对任务 A 轨迹直接要求模型提取隐藏的攻击 URL(附录 A.9)。
    • 召回率对比:据 Table 9,在约 280 个任务对中,GPT-5.2 与 Qwen3-VL-32B 达到 100.0% 召回率,Qwen2.5-VL-72B 达到 98.9%;GPT-5-mini 召回率为 42.5%,GPT-OSS-120B 为 6.7%。
    • 作者对抵抗机制的解读:作者认为,Qwen 系列的抵抗力并非源于无法回忆指令,更可能源于安全对齐;而 GPT-OSS-120B 的低 ASRB 与其长上下文处理能力不足有关。

    攻击隐蔽性与跨网站方向分析

    • 任务 A 的早熟触发率:据 Table 7,在非伪轨迹测试中,各模型在任务 A 阶段的 ASRA 几乎全为 0.0%,仅 Qwen3.5-122B 权威框架出现 0.35%(1 例),Qwen3-32B 基线注入出现 0.71%(2 例),作者称条件触发设计能使攻击在任务 A 保持休眠。
    • 跨网站攻击方向差异:据 Table 8,在各模型最佳配置下,Shopping→Reddit 方向在 GPT-5-mini(混沌下 53.4%)和 GPT-OSS-120B(无混沌基线下 40.0%)中取得较高 ASRB;而 GPT-5.2 则在 Reddit→Classifieds(权威框架下 42.9%)表现出较高脆弱性。

    其他消融与分析

    • 非伪轨迹对比:据 Table 6,自由导航下各模型中毒率在 58.5% 至 77.7% 之间,条件 ASRB(ASRB | PR)与伪轨迹 ASRB 接近。
    • 每步重复任务目标消融:据 Table 10,GPT-5.2 在每步均包含用户目标时,基线 ASRB 为 2.48%(首步为 1.77%),权威框架为 25.18%(首步为 22.34%),作者称重复目标未削弱攻击。
  5. 有什么可以进一步探索的点?

    作者指出了仅研究原始轨迹记忆、未系统评估主动防御、召回测试仅用单一提示词等局限与后续方向。

    作者指出的局限与后续方向

    • 仅聚焦于原始轨迹记忆:作者指出研究仅关注未经处理的原始轨迹记忆,未评估采用大语言模型进行摘要或整合的记忆系统,未来需研究记忆整合是带来固有防御力还是引入新的脆弱性(Section A.1)。
    • 未系统性评估防御机制:作者指出研究未系统评估针对该攻击的防御机制,未来需评估记忆内容过滤、检索上下文异常检测或指令层级强制执行等防御手段(Section A.1)。
    • 算力成本限制了部分测试覆盖:作者指出受计算成本限制,未对 GPT-5.2 和 Qwen2.5-VL-72B 进行任务 A 早熟触发率 ASRA 评估(Section 3.3),且仅对 GPT-5.2、GPT-5-mini 和 Qwen3-VL-32B 评估了环境感知率(Section 3.2 脚注 5)。
    • 长上下文召回测试提示词配置单一:作者指出长上下文召回测试仅测试了一种提示词配置,且 GPT-OSS-120B 和 GPT-5-mini 的低召回率可能部分源于模型生成空回复(Section A.9.4)。

    实验覆盖范围

    • 被测模型共 6 个(GPT-5-mini、GPT-5.2、GPT-OSS-120B、Qwen2.5-VL-72B、Qwen3-VL-32B、Qwen3.5-122B-A10B),感知评估模型为 GPT-5.4。
    • 评测环境基于 WebArena 和 VisualWebArena 中的三个领域(Shopping、Reddit、Classifieds),涵盖约 280 个跨网站任务对。
    • 记忆形式仅覆盖原始交互轨迹记忆,未包含经过总结、反思或提炼的整合记忆。
    • 混沌工程仅测试了一组扰动概率参数组合(pclick = 0.4, pscroll = 1, ptype = 1)。
    • 论文未系统性评测主动防御基线(如记忆内容过滤、检索上下文异常检测或指令层级机制)。
  6. 总结一下论文的主要内容

    论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    • 核心问题:探讨攻击者在无法直接操纵智能体数据库或共享记忆的前提下,能否仅凭在公开网页中注入恶意文本,使智能体被动记录并在未来的跨网站任务中被触发执行非预期动作。
    • 方法机制:构建了环境注入轨迹级智能体记忆投毒攻击(eTAMP),将攻击载荷设计为包含重要性标识、条件触发器与跳转命令的三元结构;提出基线注入、权威框架及挫败感利用策略,并开发基于混沌工程的 Chaos Monkey 机制模拟环境干扰。
    • 主攻击效果:在约 280 个跨网站任务对上,伪轨迹设置下 GPT-5-mini 在挫败感利用与混沌结合时 ASRB 达到 32.5%,GPT-5.2 达到 23.4%;在无混沌的权威框架下 GPT-5.2 的 ASRB 达到 22.3%(Table 1)。
    • 环境压力放大效应:引入点击丢弃、滚动反转与输入混淆的环境压力后,GPT-5-mini 的 ASRB 增加 8 倍(从 3.6% 升至 32.5%),GPT-5.2 提升了 17.0 个百分点(Table 1)。
    • 隐蔽性与能力背离:在自由导航测试中各模型任务 A 的过早触发率 ASRA 均在 0.71% 以下(Table 7);而在长上下文召回测试中达到 100% 召回的 GPT-5.2,其任务表现出色却对权威框架表现出脆弱性(Table 9)。
    • 作者结论:作者认为智能体难以区分可信系统指令与不可信网页内容,记忆机制创造了可持久利用的攻击面;随着智能体自主性增加,环境挫败可能促使模型更易轻信异常引导,亟需构建针对环境注入记忆投毒的防御手段。
阅读原文arxiv.org