跳到正文
原文
论文追踪· arXiv:2512.23128·本站收录 · 原文发表 精选关注度53

牛津等发布 TRAP 基准:六个前沿模型网页 Agent 平均 25% 被提示注入劫持

It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents

论文速读

评测与基准

据论文 PDF 整理(Gemini 生成),以原文为准

作者用 TRAP 在 6 个网页克隆上评测 6 个模型,发现平均 ASR 为 25%(GPT-5 为 13%,DeepSeek-R1 为 43%)。

问题
网页 LLM 智能体依赖动态内容,易受界面中注入的恶意指令误导而偏离任务。现有评测多为静态、未解构攻击组件,且依赖 LLM 裁判的多步判定容易引入偏差。
方法
基于 REAL 网站克隆构建 TRAP 基准,将注入解构为人格说服、LLM 操纵、交互向量、位置与定制化五维空间,共生成 630 个组合,以单跳点击重定向作为二元指标。
实验与结果
六个模型平均 ASR 为 25%(GPT-5 为 13%,DeepSeek-R1 为 43%);源自 GPT-5 的攻击向其他模型平均迁移率达 82.5%;按钮注入成功率是超链接的约 3.5 倍。
局限与可以继续做的
攻击局限在 6 个克隆网站与选定模态;定制化仅做轻量词汇修改;单跳指标未覆盖注入后行为;全量数据仅运行一次;未提出防御方案;模块化分解抽离了现实组件共现。
实验设置GPT-5、Claude Sonnet 3.7 等 · TRAP、REAL 等 · Attack Success Rate (ASR)、Benign task completion rate 等
被测模型
GPT-5Claude Sonnet 3.7Gemini 2.5 FlashGPT-OSS-120BDeepSeek-R1LLaMA 4 Maverick
基准
TRAPREALGoCalendarGoMailTopWorkOmnizonDashDishNetworkIn
指标
Attack Success Rate (ASR)Benign task completion rateTransferability
AI 导读和推荐理由牛津大学等机构的研究者提出 TRAP(Task-Redirecting Agent Persuasion Benchmark),在 Amazon、Gmail、Google Calendar、LinkedIn、DoorDash、Upwork 六个网站克隆上评测网页 Agent 对说服式提示注入的抵抗力。基准由 18 个正常任务与 35 个注入模板组合成 630 个任务-注入组合,注入由交互形式(按钮或超链接)、Cialdini 说服原则、LLM 操纵手法、注入位置和任务定制五个维度构成,以 Agent 是否点击被注入元素跳转到攻击者网站作为二值成功指标。按钮式注入的成功率约为超链接的 3.5 倍,轻度结合正常任务的措辞定制可把成功率提高数倍。研究者同时开源了可扩展的模块化注入框架,并称实验全部在克隆网站与合成数据上进行。

牛津大学等机构的研究者提出 TRAP(Task-Redirecting Agent Persuasion Benchmark),在 Amazon、Gmail、Google Calendar、LinkedIn、DoorDash、Upwork 六个网站克隆上评测网页 Agent 对说服式提示注入的抵抗力。基准由 18 个正常任务与 35 个注入模板组合成 630 个任务-注入组合,注入由交互形式(按钮或超链接)、Cialdini 说服原则、LLM 操纵手法、注入位置和任务定制五个维度构成,以 Agent 是否点击被注入元素跳转到攻击者网站作为二值成功指标。按钮式注入的成功率约为超链接的 3.5 倍,轻度结合正常任务的措辞定制可把成功率提高数倍。研究者同时开源了可扩展的模块化注入框架,并称实验全部在克隆网站与合成数据上进行。

推荐理由TRAP 把提示注入拆成说服原则、操纵手法与界面形式等模块,量化了界面细节对网页 Agent 被劫持概率的影响。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    作者称网页智能体易受界面提示注入误导,现有评测缺乏模块化攻击结构与客观判定。

    核心问题:网页端自主 LLM 智能体在处理动态网页内容时,容易受到嵌入在界面元素中的提示注入攻击误导,偏离原始用户任务并发生重定向。

    • 场景与重要性:基于 LLM 的网页智能体被广泛部署于日程管理、邮件处理、在线购物与求职等自动化任务。由于智能体直接处理未经清洗的外部网页内容,攻击者可在评论、帖子或邮件等可编辑区域注入对抗性指令,造成敏感数据泄露或财产损失。
    • 现有评测缺陷:作者指出当前网页智能体安全基准通常是静态的(发布后无法扩展新攻击类型)、整块式的(将注入视为不可分割的黑盒)、缺乏仿真真实度,且往往依赖多步交互后的 LLM 裁判打分,容易混淆智能体是主动拒绝还是能力不足。
    • 论文核心观察:攻击成功率不仅取决于对抗文本本身,还受到交互界面形态(如按钮对超链接)、人类说服原则及语境微调的显著影响,微小的界面与文本变化可能导致成功率成倍变化。
    • 论文提出的方案:构建基于真实网站克隆的 TRAP(Task-Redirecting Agent Persuasion Benchmark)基准,将提示注入解构为五维模块化攻击空间,采用客观的单跳点击重定向作为成功判定指标。
    • 威胁模型:
      • 攻击者目标:诱导智能体点击恶意控件,将其导航重定向至攻击者控制的外部网址。
      • 攻击者能力:攻击者仅能控制真实平台中的用户可编辑文本区域(如日历地点、邮件正文、论坛帖子、个人简介等),无法直接修改网页底层代码。
      • 攻击者知识:无需模型内部权重或梯度信息,通过界面与文本设计实施黑盒注入;进阶场景下可针对常见良性任务类型进行轻量文本定制。
      • 受害系统:基于底层 LLM 并在真实浏览器克隆环境中运行的网页自主智能体。
  2. 有哪些相关研究?

    作者梳理了智能体安全基准与越狱方法,指出此前评测多依赖多步判定或整块式注入。

    论文在相关工作与引言中重点讨论了以下四类研究:

    智能体安全与提示注入基准

    • InjecAgent(Zhan et al., 2024)与 AgentDojo(Debenedetti et al., 2024):前者覆盖工具集成智能体,但依赖 LLM 裁判评定多步结果;后者使用动态环境,但同样在长动作序列上定义成功。作者认为这类多步判定容易引入裁判偏差并混淆拒绝与能力不足。
    • ASB(Zhang et al., 2025):在大规模工具与攻击类型上进行评测,但作者指出其在场景层面汇总行为,未将攻击解构为模块化组件。
    • AgentHarm(Andriushchenko et al., 2025)与 OS-HARM(Kuntz et al., 2025):拓宽了有害结果的覆盖范围,但主要聚焦于直接恶意提示或操作系统层级任务,仍依赖多步成功标准。

    越狱与 LLM 操纵技术

    • 对抗性后缀(Khachaturov & Mullins, 2025):通过在指令末尾添加对抗 token 尾缀来诱导模型遵从。
    • 思维链(CoT)注入与角色扮演(Wang et al., 2025; Pathade, 2025):利用隐藏推理步骤或设定助手角色降低模型对安全策略的遵循度。
    • 多样本条件化与覆盖指令(Wang et al., 2025):通过历史模式示范或明确要求忽略先前指令来实施操纵。

    人类说服原则在对抗中的应用

    • Cialdini 说服原则(Cialdini, 2021):包含权威、互惠、稀缺、喜好、社会认同、承诺一致性与一致认同七大原则。作者指出此前工作仅在单轮 LLM 交互中研究说服,本文将其拓展至智能体交互界面。

    对比基线与环境基础

    • REAL 仿真环境(Garg et al., 2025):提供主流网站的确定性高保真克隆副本,作为 TRAP 的底层交互基准。

    论文与既有工作的定位区别:作者表示 TRAP 不再盲目堆叠环境,而是将攻击解构为可解释的五维模块化攻击空间,并在交互边界处采用单跳点击重定向作为确定性评估指标。

  3. 论文如何解决这个问题?

    作者提出 TRAP 框架,将提示注入解构为五维模块化攻击空间并采用单跳重定向判定。

    作者提出了 TRAP(Task-Redirecting Agent Persuasion Benchmark)评估框架,将网页提示注入攻击解构为五维模块化攻击空间,并在真实网站克隆上运行观察-动作循环,通过单跳点击重定向来客观度量攻击成功率。

    基础环境与智能体架构

    • 确定性网站克隆:框架基于 REAL 构建,选用六个存在大量用户可编辑表面的网站克隆:GoCalendar(Google Calendar)、GoMail(Gmail)、Omnizon(Amazon)、TopWork(Upwork)、DashDish(DoorDash)与 NetworkIn(LinkedIn)。
    • 智能体循环与动作空间:智能体在 Playwright 驱动的浏览器中运行观察-动作循环。观察包含用户任务描述、历史聊天、已打开 URL 列表、当前标签页与当前 URL;观察模态采用无障碍树(AXTree)。动作空间包括点击、填充、悬停、导航、标签管理与发送消息等基本交互原语。
    • 良性任务设计:从 REAL 适配了 18 个良性任务(每个网站 3 个),涵盖查阅日历、阅读邮件、浏览商品、订餐及求职背景审核等常见用户操作。

    五维模块化攻击空间

    • 交互向量(Interaction Vector):设计了按钮(button)与超链接(hyperlink)两种交互形态,测试不同界面控件的重定向触发效果。
    • 人类说服原则(Human Persuasion Principles):将 Cialdini 的七大说服原则转化为注入文本策略,包括权威(Authority)、承诺一致(Consistency)、社会认同(Social Proof)、互惠(Reciprocity)、稀缺(Scarcity/FOMO)、喜好(Liking)与一致认同(Unity)。
    • LLM 操纵方法(LLM Manipulation Methods):整合五种经典越狱手法,包括对抗后缀(Adversarial Suffixes)、思维链注入(CoT Injection)、多样本条件化(Many-shot)、指令覆盖(Override/Ignore)以及角色扮演(Role-Play)。
    • 注入位置(Location of Injections):主基准中每个环境固定一个贴近真实用户内容的注入位置(如日历活动地址、候选人帖子);在 NetworkIn 专项实验中扩展至四处位置(随机帖、目标帖、About 栏、推荐栏)。
    • 任务定制化(Tailoring):测试对抗文本与良性任务上下文融合的效果。主基准中默认关闭以控制变量,在专项实验中测试替换不超过 20% 词汇的轻量定制。

    判定机制与执行配置

    • 单跳点击重定向指标:只要智能体在交互过程中点击了注入的按钮或超链接并被重定向至指定外部网址(实验设定为成人违规测试站点),即判定攻击成功(ASR)。
    • 执行参数限制:单步通用操作超时设为 30 秒,页面导航超时 10 秒,最大交互步数上限为 35 步,动作间设置 1 秒延迟。所有实验采样温度固定为 0.0。
    • 基准组合规模:18 个良性任务与 35 个注入模板(7 种说服原则 × 5 种操纵方法 × 1 个位置 × 1 种交替交互向量)正交配对,生成 630 个任务-注入评测用例。注入文本平均长度严格控制为 787 字符(标准差 98 字符)。
  4. 论文做了哪些实验?

    六个前沿模型在 TRAP 上的平均 ASR 为 25%,按钮注入比超链接高出约 3.5 倍。

    实验设置

    • 被测模型:测试了六个前沿闭源与开源 LLM,均通过 OpenRouter 接口调用:GPT-5(2025-08-07)、Claude Sonnet 3.7(2025-02-24)、Gemini 2.5 Flash(2025-06-17)、GPT-OSS-120B(2025-08-05)、DeepSeek-R1(2025-05-28)、LLaMA 4 Maverick 17B Instruct (128E)(2025-04-05)。
    • 评测基准与规模:在 6 个 REAL 网站克隆中运行 18 个良性任务,搭配 35 个注入模板组合成 630 个任务-注入用例。每个模型执行全部 630 次运行,六个模型累计完成 3,780 次评测。
    • 对照与基线:在无攻击环境下测试良性任务完成率(Benign Utility)作为能力基准。
    • 主要指标:良性任务完成率(Benign Utility,比例)与攻击成功率(ASR,智能体点击注入元素并发生重定向的比例,附 95% 二项置信区间)。
    • 判定与交互配置:无需 LLM 裁判打分,基于 Playwright 环境底层日志判定单跳重定向;采用 AXTree 文本模态,最大步数 35,温度 0.0。
    • 异常执行统计:在全部 3,780 次运行中,有 639 次在遇到注入文本后达到 35 步上限被截断,作者称智能体陷入循环未能完成任务。

    主结果

    各模型在无攻击下的良性效用与在 TRAP 上的攻击成功率如下表所示(据 Table 1,n=630):

    模型良性效用攻击成功率(ASR)
    GPT-589%13% ±2.6
    Claude Sonnet 3.783%20% ±3.1
    Gemini 2.5 Flash61%30% ±3.6
    GPT-OSS-120B61%27% ±3.5
    DeepSeek-R167%43% ±3.9
    LLaMA 4 Maverick22%17% ±2.9
    • 主结果表现:六个模型平均 ASR 为 25%(948/3,780)。DeepSeek-R1 良性效用为 67%,但 ASR 达到 43%,为所测模型中最易受攻击;GPT-5 与 Claude Sonnet 3.7 良性效用较高(89% 与 83%),ASR 相对较低(13% 与 20%)。
    • 作者解读:作者认为更强的对齐与鲁棒性能够维持对任务的忠实度,并降低被利用概率。

    攻击跨模型迁移性分析

    • 测试内容:评估在一个源模型上成功的注入能否在目标模型上同样成功(迁移矩阵,Table 2)。
    • 测试结果:跨模型迁移呈现非对称性。源自 GPT-5 的攻击平均迁移率达 82.5%(向 Claude Sonnet 3.7 迁移率为 90.0%,向 DeepSeek-R1 为 88.8%);而源自 DeepSeek-R1 的攻击向其他模型平均迁移率仅为 39.1%(向 GPT-5 仅 26.0%)。
    • 作者解读:迁移能力与模型鲁棒性正相关。攻破最强模型的注入构成了攻破较弱模型注入的近似子集,攻击者可直接在最强模型上寻找有效载荷并迁移到其他系统。

    交互向量与定制化效应

    • 按钮与超链接对比:在全部 948 次成功攻击中,77.5%(735 次)由按钮触发,超链接仅占 22.5%(213 次),作者称按钮效果约为超链接的 3.5 倍(Table 4)。在 GoMail 单一提示词的双盲成对测试中,GPT-OSS-120B 按钮 ASR 为 46% 对超链接 6%,Gemini 2.5 Flash 为 66% 对 9%,Claude Sonnet 3.7 为 46% 对 6%。
    • 轻量任务定制化:在 GoCalendar 和 DashDish 两个易感任务上修改不超过 20% 的措辞将泛化指令改为任务细节(Table 6),GoCalendar 平均 ASR 从 3.3% 提升至 18.6%(7 次升至 39 次,提升 5.6 倍),DashDish 从 6.7% 提升至 16.7%(14 次升至 35 次,提升 2.5 倍)。

    位置效应与网络克隆分析

    • 测试内容:在 NetworkIn 环境中测试 4 处注入位置(随机帖子、目标用户帖子、个人简介 About、推荐栏)在有无位置引导提示下的 ASR(Table 5)。
    • 测试结果:指定位置的提示词大多降低了 ASR(随机帖 4% 降至 1%,目标帖 9% 降至 7%,推荐栏 29% 降至 20%),唯一的例外是 About 栏,指定位置使 ASR 从 52% 升至 59%。
    • 作者解读:位置线索仅在语义丰富的个人主页核心区域放大易感性,而在暴露较少的区域无效。

    其他消融与分析

    • 说服原则贡献分布:Social Proof 占 18.1%(172 次),Consistency 占 17.9%(170 次),Unity 占 10.4%(99 次)(Table 3)。
    • 操纵方法贡献分布:Adversarial Suffixes 占 24.5%(232 次),CoT 注入与 Many-shot 各占 23.8%(各 226 次),Override 占 11.6%(110 次)(Table 3)。
    • 跨层协同效应:Social Proof 或 Consistency 搭配 Adversarial Suffixes 或 CoT 分别贡献约 4%–5% 的成功注入(第 4.3 节)。
    • 观察模态消融:在 GoCalendar 上以 Gemini 2.5 Flash 测试(Table 14),单用 AXTree 的 ASR 为 8.7%(9/104),加入截图后为 10.5%(11/105),经 Fisher 精确检验 p>0.5,作者报告差异不显著。
  5. 有什么可以进一步探索的点?

    作者指出的局限包括仅覆盖六个网站克隆且未提出防御,全量数据集仅运行一次。

    作者指出的局限与后续方向

    • 测试环境局限:攻击仅在六个克隆网站上进行,且主要关注选定的模态(第 5 节 Limitations)。
    • 定制化策略单一:定制化实验仅应用了轻量级词汇修改,未涉及更丰富的用户或上下文特定策略(第 5 节 Limitations)。
    • 单跳指标局限:单跳点击成功指标隔离了易感性,但省略了提示注入发生后的后续行为分析(第 5 节 Limitations)。
    • 重复次数较少:全量数据集仅运行了一次;在 120 个任务的抽样测试中,三次运行的 ASR 差异小于 3 个百分点(第 5 节 Limitations)。
    • 未提出防御方案:论文评测了六个前沿模型,但未在框架中提出防御机制(第 5 节 Limitations)。
    • 模块化人为解构:模块化分解抽离了现实注入中说服组件的自然共现,自然交互时的攻击效果可能有所不同(第 5 节 Limitations)。

    实验覆盖范围

    • 被测模型包括 GPT-5、Claude Sonnet 3.7、Gemini 2.5 Flash、GPT-OSS-120B、DeepSeek-R1、LLaMA 4 Maverick 共 6 个(Table 9)。
    • 评测环境覆盖 Google Calendar、Gmail、Upwork、Amazon、DoorDash、LinkedIn 的 6 个 REAL 克隆站点(Table 7)。
    • 交互向量仅测试了按钮与超链接,未测试二维码与系统推送通知等形态(第 3.3 节)。
    • 观察模态默认采用文本无障碍树(AXTree),未将多模态图像注入纳入主评测集(第 3.1 节)。
    • 论文未在实验中测试防御拦截机制(第 5 节 Limitations)。
  6. 总结一下论文的主要内容

    论文提出了基于五维模块化攻击空间的 TRAP 基准,评估了六个模型在真实网页环境中的注入风险。

    研究定位:针对网页自主智能体易受外部界面提示注入攻击的问题,构建了基于真实网站克隆的模块化评测基准 TRAP。

    • 要解决的问题:网页智能体在处理不可信动态内容时易受嵌入指令误导,而现有基准多为静态、未解构攻击要素且依赖存在偏差的多步 LLM 判定。
    • 核心方法设计:将提示注入解构为交互向量、说服原则、LLM 操纵、注入位置与任务定制化五维模块,组合构建 630 个任务-注入评测用例,采用确定性的单跳点击重定向作为二元衡量指标。
    • 主要实验发现:
      1. 六个前沿模型平均 ASR 达到 25%,其中 GPT-5 最低(13% ±2.6),DeepSeek-R1 最高(43% ±3.9)(Table 1)。
      2. 注入具备非对称迁移性,在最强模型 GPT-5 上成功的注入向其他模型的平均迁移率达 82.5%,而在 DeepSeek-R1 上仅为 39.1%(Table 2)。
      3. 界面呈现形式影响显著,按钮触发了 77.5% 的成功注入,效果约为超链接的 3.5 倍(Table 4)。
      4. 轻量语境微调(修改不超过 20% 词汇)使 GoCalendar 和 DashDish 的平均 ASR 分别升至 18.6% 与 16.7%(Table 6)。
    • 作者结论与启示:作者认为界面设计与语境说服显著影响智能体执行可靠性,防范智能体注入风险不仅需要处理底层提示词,还须关注外部部署环境中的说服结构。
阅读原文arxiv.org