跳到正文
原文
论文追踪· arXiv:2609.34974·本站收录 · 原文发表

Veer:网页 Agent 运行时防御暗模式,WebDecept 上暗模式得逞率降至 0.3%

Before Acting, Change the State: Prospective State Intervention for Web Agents under Deceptive Interfaces

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

Veer在执行前改写会造成未授权后果的网页状态,TrickyArena-Single上STC为85.2%。

威胁模型black-box Web环境中的智能体侧运行时防御。

问题
LLM Web智能体执行任务合法动作时,当前网页状态仍可能带来用户未授权的后果。已有运行时防御主要决定下一步做不做、怎么做,作者认为应把任务相关网页状态本身当作控制对象。
方法
Veer留在智能体侧。先用固定的任务授权和当前及历史网页证据判断提议动作;若未授权,则在改动真实环境前规划浏览器级前瞻轨迹,执行时重新落地并核验,满足目标后再交还基座智能体。
实验与结果
Table 1中Veer在三种设置的STC为85.2%、67.6%、41.0%,WebDecept上DPSR为0.3%。12组智能体–模型–基准对比里,STC均高于匹配的无防御设置。作者称主动状态干预带来最大STC变化。
局限与可以继续做的
附录G写明:干预依赖可观察网页状态,纯隐藏服务端状态不在当前模型内;意图不足时后果可能不确定;干预后剩余任务仍依赖基座智能体。评测覆盖TrickyArena与WebDecept、两种智能体实现和两种模型;论文未报告重复次数。
实验设置GPT-5.6-Luna、DeepSeek-V4-Flash · TrickyArena-Single、TrickyArena-Multi 等 · DPSR、TSR 等
威胁模型
black-box Web环境中的智能体侧运行时防御。执行at前收到u、ot、τ<t与at;只能用基座智能体可用的浏览器操作,无源码、后端或内部状态访问,也无干净对照界面或dark-pattern标签。目标是改变会造成未授权后果的任务相关网页状态,并保留任务进展。
被测模型
GPT-5.6-LunaDeepSeek-V4-Flash
基准
TrickyArena-SingleTrickyArena-MultiWebDecept
指标
DPSRTSRSTC
AI 导读研究者提出 Veer,一种面向 LLM 网页 Agent 的运行时防御方法,把任务相关的网页状态本身作为控制目标,而不是只拦截或重规划 Agent 行为。Veer 在检测到某个动作会带来未授权后果时,先构造一条通往安全任务状态的预期干预轨迹,再借助运行时 grounding 与验证执行。在 TrickyArena 和 WebDecept 上,Veer 在三种评测设置中取得最高的安全任务完成率,在 TrickyArena-Single 和 TrickyArena-Multi 上分别比次优防御高出 15.9 和 25.0 个百分点,并把 WebDecept 上的暗模式得逞率降到 0.3%。消融实验显示,主动状态干预带来的增益最大,预期 rollout 与时序证据提供额外提升,结果在 12 种 Agent、模型与基准配置中保持一致。

研究者提出 Veer,一种面向 LLM 网页 Agent 的运行时防御方法,把任务相关的网页状态本身作为控制目标,而不是只拦截或重规划 Agent 行为。Veer 在检测到某个动作会带来未授权后果时,先构造一条通往安全任务状态的预期干预轨迹,再借助运行时 grounding 与验证执行。在 TrickyArena 和 WebDecept 上,Veer 在三种评测设置中取得最高的安全任务完成率,在 TrickyArena-Single 和 TrickyArena-Multi 上分别比次优防御高出 15.9 和 25.0 个百分点,并把 WebDecept 上的暗模式得逞率降到 0.3%。消融实验显示,主动状态干预带来的增益最大,预期 rollout 与时序证据提供额外提升,结果在 12 种 Agent、模型与基准配置中保持一致。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    任务合法动作仍可能因网页状态产生未授权后果,Veer在执行前干预该状态。

    任务合法的动作仍可能因当前网页状态实现用户未授权的后果。

    • 场景:LLM Web智能体代用户购物、预订和检索时会遇到dark patterns。作者称TrickyArena报告六个Web智能体对单个dark pattern的平均易感性为41%,DECEPTICON在超过70%的测试任务中出现不良结果,WebDecept在购物任务中也有类似失败。
    • 现有不足:已有防御主要通过提示、动作筛查、引导和重规划干预行为。作者称仅识别欺骗模式并不能稳定阻止不良行为;运行时保护主要围绕下一步动作是否执行、如何执行。
    • 核心观察:动作可以与用户任务一致,但预选保修、保留同意或已启用设置会改变后果。Figure 1中结账仍然可见,已选保修进入小计。作者把这类条件称为Web state。
    • 威胁模型:
      • 目标:执行前改变会造成未授权后果的网页状态,并保留任务进展。未授权指后果含用户任务不支持的结果。
      • 知识:black-box。从可观察网页证据推断St;没有干净对照界面,也没有显式dark-pattern标签。
      • 能力:位于基座智能体与环境之间。执行at前收到u、ot、τ<t和at;只能用基座智能体可用的浏览器操作,不能访问源码、后端逻辑或内部状态。
      • 受害系统:代用户做多步浏览器交互的LLM Web智能体;欺骗界面通过执行时的状态改变任务合法动作的后果。
    • 提出方法:作者提出Veer。任务规划仍由基座智能体完成;若提议动作会产生未授权后果,则先构造前瞻干预轨迹,再落地、核验后执行。
  2. 有哪些相关研究?

    相关工作分欺骗界面、运行时安全与前瞻规划;Veer改的是决定后果的网页状态。

    相关工作按欺骗界面、运行时安全和前瞻状态推理分组;实验对照另列于后。

    • 欺骗性界面
      • 分类与影响:Gray et al. (2018)、Mathur et al. (2019)、Nouwens et al. (2020)、Luguri and Strahilevitz (2021)研究dark pattern的分类、流行程度和效果。
      • 智能体场景:Ersoy et al. (2026)、Cuvin et al. (2026)、Shi et al. (2026)把问题扩展到组合dark pattern、轨迹操纵和电商任务失败。
      • 识别与引导:论文引用Tang et al. (2026)写识别欺骗模式并不能稳定阻止不良行为,并讨论Zhang et al. (2026)的欺骗感知引导。
    • 运行时安全
      • 输入隔离:Hines et al. (2024)分隔可信与不可信内容;Debenedetti et al. (2024)用AgentDojo评测提示注入攻击与防御。
      • 动作约束:Xiang et al. (2025)的GuardAgent与Lin et al. (2026)的VIGIL施加显式或意图落地的动作约束。
      • 后果预测:Zheng et al. (2025)的WebGuard、Chen et al. (2026)的SafePred、Yu et al. (2026)的SeerGuard预测后果,用于筛查、引导或重规划。论文称这类方法主要控制动作如何进行。
    • 规划与状态推理
      • 长程规划:Zhou et al. (2023)、Fu et al. (2024)、Zhang et al. (2025)、Agashe et al. (2025)、Wang et al. (2024)使用树搜索、分层规划、上下文引导、累积经验或可复用工作流。
      • 执行前预测状态:Chae et al. (2025)用世界模型预测动作引起的状态变化以选择策略;Gu et al. (2024)的WebDreamer在执行前对预测网页状态做规划。
    • 基线与基准:对照为无防御基座智能体,以及ICP、Guardrail(Cuvin et al., 2026)、DUDE-S2(Zhang et al., 2026)、Spotlighting(Hines et al., 2024)、VIGIL(Lin et al., 2026)、SafePred(Chen et al., 2026)。基准为TrickyArena(Tang et al., 2026)和WebDecept(Shi et al., 2026)。

    论文把Veer定位为:网页状态会使任务合法动作实现未授权后果时,干预该状态;前瞻推理用于运行时安全,在真实修改前导出转移并在执行中核验,而不是主要决定下一步动作如何进行。

  3. 论文如何解决这个问题?

    Veer固定干预目标,先规划前瞻轨迹,再在真实网页上落地、核验并必要时重规划。

    Veer在基座智能体提出动作之后、提交到网页环境之前介入,不改任务规划。三部分是任务落地的后果评估、前瞻状态干预和守护轨迹执行(Figure 2)。干预目标保持不变,浏览器级轨迹可按实时证据调整。

    问题设定

    • 执行:智能体按自然语言任务u做多步浏览器交互。第t步,基座策略根据u、观察ot和历史提出at。
    • 后果与状态:动作与完成任务一致时为任务合法。St表示选项、已存设置或流程等任务相关条件。后果含用户任务不支持的结果时为未授权。
    • 接口:执行at前收到u、ot、历史和at,只能用基座智能体可用的浏览器操作。附录G汇总适用范围。
    • 三个困难:后果相关状态稀疏且会跨步保留;安全干预可能依赖多步转移,不能在真实应用上试改;前瞻转移可能与真实执行不一致,每步都要落地并核验。

    后果评估

    • 两种表示:St由当前观察与仍有效的时间证据组装,Au只从原始用户指令得到。观察可把任务指称绑定到具体对象,不能扩大授权。附录B给出具体表示。
    • 判定:预测器给出预测后果和yt,取值为AUTHORIZED、UNAUTHORIZED或UNCERTAIN。已会实现的实质性效果计入当前动作;仍需独立未来动作的效果不记为at的后果。
    • 不确定:先做有界取证再复评。取证只更新可观察证据。界内不能确立足够证据时,不把不确定当成授权,并按运行时策略回退。AUTHORIZED则释放原动作。

    前瞻状态干预

    • 目标:yt为UNAUTHORIZED时构造It=(Rt,St⋆,Pt)。Rt是造成未授权后果的状态,St⋆是去掉该贡献后的目标条件,Pt是应保留的任务相关状态。
    • 轨迹:发出任何改变状态的干预动作之前,构造完整前瞻轨迹。每步含浏览器动作、预期任务相关效果和对前序步的依赖。附录B.5写明这不假设学习到的模拟器或潜在世界模型。
    • 准入:目标须能在当前界面落地,依赖成立,计划效果与目标一致。不能准入时,不把干预提交到真实环境。
    • 分离:目标只声明改变什么、到达什么、保留什么,不指定操作序列。附录B给出表示和构造提示词。

    守护执行

    • 逐步核验:执行前重新观察、落地目标并检查依赖。执行后比较观察到的任务相关变化与预期效果。只有被确认的转移才解锁依赖它的后续步。
    • 失配:停止剩余轨迹,重新落地真实状态,并在同一目标下构造新轨迹。
    • 成功条件:交还控制前须满足S_{t+}\models S_t^\star,\ S_{t+}\models P_t,\ \mathrm{Resolved}(R_t,S_{t+}),即到达目标状态、保留任务相关进展,且造成未授权后果的状态已被解决。
    • 失败:有界过程内不能建立这些条件时,不释放未解决的不安全执行,并按配置终止或重规划。

    运行配置

    • 模型:授权抽取、后果评估、取证复评、目标构造、轨迹生成和终态核验使用与对应基座智能体相同的模型,不另设planner或verifier(附录C.1)。
    • 预算:同一基准内普通任务动作额度相同:TrickyArena为30,WebDecept为15。Veer内部预算为8,只用于防御侧取证和状态干预,不能推进普通任务执行(Table 4)。
    • 上界:每个未解决证据主张最多2次尝试,合计8次;提案重规划5次;干预步尝试2次;纠正重规划1次;终态核验模型调用最多2次(Table 5)。
  4. 论文做了哪些实验?

    三种设置下Veer的STC均为表内最高,其在WebDecept上的DPSR为0.3%。

    实验设置

    • 基准:TrickyArena含156个任务–dark-pattern配置:Single 88,Multi 68(2–4个模式同时出现:46个两个、18个三个、4个四个)。域在正文中写为shopping、news、streaming、health,附录D.1列为Shopping、News、Music、Health。WebDecept为45个购物任务×7个场景,共315。
    • 被测系统:主实验用各基准默认智能体加GPT-5.6-Luna。RQ2另用Codex,以及DeepSeek-V4-Flash。Default在TrickyArena上为BrowserUse,在WebDecept上为WebArena风格的PromptAgent。
    • 基线:No-Defense、ICP、Guardrail、DUDE-S2、Spotlighting、VIGIL、SafePred。适配只映射到宿主观察与动作接口,不加入状态干预(附录D.4)。
    • 指标:Di表示至少一个被评欺骗结果发生,Ti表示任务成功。DPSR、TSR分别是二者比例;STC是回合级Ti(1−Di)的比例,不是两个总比例相乘。Multi中任一组成模式成功则Di=1。分母为88、68、315、225。
    • 判定:基准定义的评测器只在回合结束后计算。运行时不提供任务成功标签、dark-pattern标签、隐藏评测输出或后端状态。论文未写明另用某个LLM作裁判。
    • 协议:同一基准内各方法共用任务配置、基座智能体、actor模型和任务动作额度。RQ1与RQ3用Default加GPT-5.6-Luna。作者称评测覆盖471个配置。论文未报告重复次数。

    主结果

    据Table 1(%)。WD为全量WebDecept(N=315)。

    表格较宽,可左右滑动

    方法Single STCMulti STCWD DPSRWD TSRWD STC
    No-Defense60.238.237.547.628.6
    ICP69.339.726.743.831.7
    Guardrail62.542.612.435.229.5
    DUDE-S256.827.935.955.631.4
    Spotlighting62.526.535.644.827.3
    VIGIL59.138.29.510.25.4
    SafePred63.636.838.158.138.7
    Veer85.267.60.341.041.0
    • 安全完成:作者报告三种设置下Veer的STC都高于表内其他方法。Single上其TSR为86.4%,与SafePred、DUDE-S2相同,DPSR为4.5%;同TSR的SafePred DPSR为28.4%。作者称Single、Multi上分别比次高STC高15.9和25.0个百分点。
    • 效用并未一律更高:Multi上Veer的DPSR为14.7%、TSR为72.1%;SafePred的TSR为79.4%,高于Veer。作者称TrickyArena上的STC差距来自更多安全完成,而不是普遍抑制任务进展。
    • 例外:作者称两种基准的安全–效用形态不同,WebDecept还暴露安全完成是否仍可能这一基准层约束。Table 13中Veer的#D=1。若干基线DPSR高于No-Defense,例如Single上DUDE-S2为34.1%(No-Defense为29.5%)。

    WebDecept可行子集

    • 测了什么:redirection与price drift的ground truth在遇到欺骗条件后未指定安全完成路径。附录D.3去掉这两类,保留225个配置,标准只看场景,且对所有方法相同。这是补充分析,不替代全量315。
    • 结果:Table 2中Veer的DPSR为0.0%,TSR与STC均为57.3%。作者称相对No-Defense,TSR提高7.1个百分点,DPSR从17.8%降到0.0%。SafePred的TSR为64.4%、DPSR为19.6%、STC为54.2%。
    • 作者解读:作者称安全完成可用时,Veer相对无防御智能体提高了任务完成,并得到联合安全–效用上的最好表内结果。全量TSR低于No-Defense的47.6%和SafePred的58.1%,作者因此检查可行性。

    条件、多模式与配置

    • 分条件:作者称Single上Veer在22类中21类DPSR最低或并列最低,20类为0。未加权类别均值为5.7%,基线为15.5%–32.0%。Figure 3标注Veer的Avg.为5.7、Worst为100。Table 15中news/cf(N=3)各方法含Veer均为100.0%(3/3);shop/t2(N=4)Veer为25.0%(1/4),ICP与VIGIL为0.0%(0/4)。
    • WebDecept分场景:作者称315个配置中只有1次欺骗结果,场景均值DPSR为0.3%,最差为2.2%;基线对应范围为9.5%–38.1%与26.7%–86.7%。Table 16中该1次在Redirect(2.2%,1/45);Add-ons上Veer为0.0%(0/45),No-Defense为82.2%(37/45)。
    • 12组配置:Single与Multi的配置混合不同,作者只比较总体变化。从Single到Multi,Veer的DPSR增加10.2个百分点,基线增加19.8–33.0个百分点;STC下降17.6个百分点,基线下降19.9–36.0个百分点。Table 3中12组STC均高于匹配的No-Defense,增益为4.8–29.4个百分点。作者称12组中DPSR都下降,至少20.5个百分点;Table 17给出的是STC。

    核心设计消融

    • 测了什么:Figure 4与Table 18在TrickyArena-Single上按任务完成和dark-pattern分解回合,每变体N=88。Full Veer的STC为85.2%。
    • 状态干预:改为拦截后,TSR从86.4%降到51.1%,STC从85.2%降到50.0%(Table 18,−35.2个百分点)。既未完成任务也无dark-pattern的回合从10.2%升到38.6%。作者称拦截常以终止有用进展来避开未授权后果。
    • 前瞻与时间证据:Reactive Intervention的TSR为85.2%,DPSR从4.5%升到6.8%,STC为80.7%。去掉时间证据后TSR为80.7%,STC为77.3%;无dark-pattern的任务失败从10.2%升到17.0%,带dark-pattern的成功回合从1.1%升到3.4%。

    其他消融与分析

    • 一步干预:DPSR 14.8%,TSR 68.2%,STC 61.4%,ΔSTC −23.9个百分点(Table 19,N=88)。
    • 准入轨迹:21个回合、24条;计划长度均值1.88,中位数1,最大4;1步15个回合,4步6个回合(Table 20)。
    • 已执行操作:turn off 20,decline 12,save 6,click 4,合计42(Table 21)。
    • 附录F.4两例:干预并核验后均为T=1、D=0。
  5. 有什么可以进一步探索的点?

    附录G把范围限定在可观察、浏览器可达的状态,并指出评测扩展仍是后续工作。

    作者指出的局限与后续方向

    • 可观察状态:干预须落地在网页交互中有可观察表现的状态;完全由没有可观察证据的隐藏服务端状态决定的效果,不在当前干预模型内(附录G)。
    • 浏览器可达:状态干预需要从当前状态通向目标状态的浏览器级路径;动态界面、不可用控件或意外转移效果可使前瞻轨迹失效(附录G)。
    • 授权边界:授权来自原始用户指令,不用执行中遇到的网页内容扩大它;意图规定不足时,一些提议后果可能仍不确定(附录G)。
    • 保留范围:干预目标中的保留项只覆盖能从可用交互证据识别的任务相关状态和能力(附录G)。
    • 不替换规划器:Veer改变造成后果的网页状态后把控制交还基座智能体,不替换其普通任务规划;导航、检索和剩余任务仍依赖底层智能体(附录G)。
    • 评测扩展:作者写,把评测扩展到更多Web环境和交互设置仍是后续工作(附录G)。

    实验覆盖范围

    • 基准:TrickyArena-Single(88)、TrickyArena-Multi(68)和WebDecept(45个购物任务×7个场景=315);另有按场景划出的ground-truth可行子集225(附录D.3)。
    • 系统:智能体实现为Default(TrickyArena上BrowserUse,WebDecept上PromptAgent)和Codex;模型为GPT-5.6-Luna与DeepSeek-V4-Flash,共12组对比(附录C.4、Table 3)。
    • 对照:No-Defense、ICP、Guardrail、DUDE-S2、Spotlighting、VIGIL、SafePred(第4.1节)。
    • 实现:主配置中Veer与基座智能体用同一模型,不另设planner或verifier;任务动作预算为30和15,Veer内部预算为8(附录C)。成功与欺骗结果由基准评测器在回合结束后计算(附录E)。
    • 消融:设计消融与一步干预均在TrickyArena-Single上进行,每变体N=88(第4.4节、附录F)。论文未报告重复次数。
  6. 总结一下论文的主要内容

    Veer通过前瞻状态干预保护Web智能体,三种设置的STC为85.2%、67.6%与41.0%。
    • 定位:Veer是black-box网页环境中的智能体侧运行时防御,控制对象是会造成未授权后果的任务相关网页状态,而不是只决定下一步动作做不做。
    • 问题:购物、预订和检索中,结账等动作可以与用户任务一致,但预选项、保留同意或已启用设置会带入用户任务不支持的结果。
    • 做法:任务授权固定,网页状态由当前观察和时间证据组装。未授权时声明要改什么、到达什么、保留什么,先规划完整前瞻轨迹,再逐步落地和核验;失配则在同一目标下重规划。
    • 主结果:Table 1中Veer的STC在TrickyArena-Single、Multi和WebDecept上为85.2%、67.6%、41.0%,DPSR为4.5%、14.7%、0.3%。作者称前两处分别比次高STC高15.9和25.0个百分点。全量WebDecept上其TSR为41.0%,低于SafePred的58.1%。
    • 其他结果:可行子集(N=225)上DPSR为0.0%、STC为57.3%(Table 2)。12组智能体–模型–基准对比的STC增益为4.8–29.4个百分点。去掉主动状态干预后,Single上STC从85.2%降到50.0%(Table 18)。news/cf(N=3)上各方法DPSR均为100.0%。
    • 作者结论:作者称主动状态干预贡献最大,前瞻展开和时间证据另有增益,并把任务相关网页状态称为保护Web智能体的运行时控制目标。
阅读原文arxiv.org