跳到正文
原文
arXiv· arXiv:2610.11942· Jiaming Zhang, Xuan Wang, Fuyao Zhang, Yang Cao, Lingjuan Lyu, Wei Yang Bryan Lim·本站收录 · 原文发表

LGWM:用动作条件世界模型验证 GUI 智能体的屏幕转移

Right Screen, Wrong Transition: World Models as Verifiers for GUI Agents

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

LGWM免训练核验在RSWT-BENCH上RSWT AUC为0.987、17.1 ms(Table 1)。

威胁模型第三方应用、网页与广告可能在动作之后改道结果,屏幕仍可看似合理。

问题
GUI智能体经由第三方界面行动,攻击可在动作后改道结果,屏幕仍看似合理。同一凭证屏在合法转移下正常、在劫持转移下是攻击,只看屏幕的监控可被合法屏幕复用绕过。
方法
LGWM是无解码器的动作条件world model,把当前屏与结构化动作映射到下一屏表示,在1,845,659条真实转移上无语义标注训练。核验是余弦比较;残差大小检测违背,方向用线性头区分危害。
实验与结果
在222对上,LGWM免训练RSWT AUC为0.987,延迟17.1 ms(Table 1)。作者称与最强闭源VLM未检出差异,生成式模型约低十个AUC点。Harm AUC上残差头为0.953,提示词VLM为0.512至0.614。
局限与可以继续做的
作者在Discussion称,表示空间中伪造相符结果的难度尚未量化。评测为222个donor pair;消融为ViT-S、15k步、单seed。Table 1未报告闭源API延迟。
实验设置LGWM · RSWT-BENCH · RSWT AUC、Swap AUC 等
威胁模型
第三方应用、网页与广告可能在动作之后改道结果,屏幕仍可看似合理。监控看到当前屏、结构化动作和下一屏,检查结果是否相容于未受破坏界面的条件分布。只看结果屏的检测器,在RSWT上的期望AUC为1/2。
被测模型
LGWM
基准
RSWT-BENCH
指标
RSWT AUCSwap AUCCred AUCHarm AUCLatency
AI 导读论文提出 LGWM,一种无解码器、以动作为条件的世界模型,直接在观测编码空间中预测下一屏表示,把 GUI 智能体的安全验证简化为向量比较。作者认为 GUI 智能体的安全是转移的属性而非屏幕的属性,只检查屏幕的监控器可被复用合法界面绕过。模型在 185 万条真实 GUI 转移上训练,无需语义标注。在 RSWT-BENCH 上,每个凭证界面同时出现在合法与劫持转移下,免训练评分达到 0.987 AUC,每次判断 17 ms,与最强闭源 VLM 相当,比生成式 GUI 世界模型高约 10 个 AUC 点且延迟低三个数量级以上;残差方向在区分有害与良性违规上达到 0.953 AUC,而提示式 VLM 接近随机水平。作者称结果表明世界模型除模拟器和规划器之外还有第三种角色,即验证。

论文提出 LGWM,一种无解码器、以动作为条件的世界模型,直接在观测编码空间中预测下一屏表示,把 GUI 智能体的安全验证简化为向量比较。作者认为 GUI 智能体的安全是转移的属性而非屏幕的属性,只检查屏幕的监控器可被复用合法界面绕过。模型在 185 万条真实 GUI 转移上训练,无需语义标注。在 RSWT-BENCH 上,每个凭证界面同时出现在合法与劫持转移下,免训练评分达到 0.987 AUC,每次判断 17 ms,与最强闭源 VLM 相当,比生成式 GUI 世界模型高约 10 个 AUC 点且延迟低三个数量级以上;残差方向在区分有害与良性违规上达到 0.953 AUC,而提示式 VLM 接近随机水平。作者称结果表明世界模型除模拟器和规划器之外还有第三种角色,即验证。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    安全在于转移而非屏幕:合法屏幕被错误动作引出时即是攻击。

    同一张看似合理的屏幕,既可能来自合法转移,也可能来自被劫持的转移。

    • 场景:作者以 Figure 1 为例:Sign in 之后的登录屏是预期,同一像素的凭证屏出现在 View order 之后则是攻击。二者的差别在转移,不在屏幕内容。
    • 重要性:作者称 GUI 智能体经由第三方应用、网页和广告行动,诚实性不能默认;攻击会改道动作之后的结果,同时每张屏幕仍看似合理。作者认为环境可能对抗智能体。
    • 现有不足:作者称现有 GUI world model 输出文本、截图或代码,核对依赖第二个模型。作者称一次渲染要一到两分钟(§4.2),未计裁判。
    • 做法:作者主张核验应在观测编码空间中预测。给出无解码器的 LGWM,以及 RSWT-BENCH:只看结果屏的检测器,期望 RSWT AUC 恰为 1/2。
    • 威胁模型:
      • 受害方:经第三方界面行动的 GUI 智能体。核验发生在动作已执行、下一屏已被观测之后。
      • 攻击:使结果不再相容于未受破坏界面在该屏和该动作下的分布,但同一屏幕在别的上下文可以合法,且看起来合理。
      • 监控所见:当前屏、结构化动作、观测到的下一屏。期望来自对正常界面动态的 world model。
      • 完整性定义:结果与上述分布相容。Proposition 1:任何只依赖结果屏的检测器,期望 RSWT AUC 恰为 1/2。
  2. 有哪些相关研究?

    作者将本文置于渲染式GUI world model、潜空间预测与安全监控之间。

    作者把本文放在渲染式 GUI world model、潜空间预测和运行时监控之间,要求预测能不经裁判与观测比较。

    渲染式与潜空间模型

    • 渲染式 GUI world model:Related Work 将 Li 等(2025)、Luo 等(2025)、Liu 等(2026)、Koh 等(2026)、Zheng 等(2026)、Xu 等(2026a; 2026b)、Yang 等(2026)、Cao 等(2026)归为把未来写成文本、代码或渲染块的一类。作者称核验因此需要裁判,代价为秒到分钟;并称人要查看时渲染仍合适,两族互补。
    • 规划或不保留预测器:Schrittwieser 等(2020)、Grimm 等(2020)、Hansen 等(2022)的潜模型服务规划,不与观测对齐。Assran 等(2023)、Bardes 等(2024)、Fu 等(2025)训练编码器后丢弃预测器。作者称,以往不重建出于学习效率或规划是否够用,本文关心的是能否不靠第二个模型对照现实。
    • 与目标编码比较:Zhou 等(2024)、Assran 等(2025)比较预测表示和目标图像编码。作者称 LGWM 把同一几何对准实际观测,并要处理混合的离散—空间动作和稀疏转移。

    GUI 安全与预测误差

    • 标量预测误差:Pathak 等(2017)、Burda 等(2019)用预测误差做探索和分布外检测。作者称本文的误差以动作为条件、与编码观测同空间,并分大小与方向两次读取,以往停在标量。
    • 当前步风险与隐藏转移:Sun 等(2025; 2026)、Cuvin 等(2026)、Yang 等(2025)评测当前步可见的风险。Qian 等(2026)、Shi 等(2026)写的攻击在屏幕仍无害时改道结果。作者将这两类工作并列。
    • SeerGuard 与过程核验:Yu 等(2026)的 SeerGuard 在执行前预测后果,渲染成文本,并联合学习风险判断。作者称本文信号是几何的、事后的、免训练的,危害解释单独在线性头。Lightman 等(2024)核验智能体自己的推理;作者称本文核验的是环境响应。作者称 RSWT-BENCH 是首个让只看结果的检测按构造处于随机水平的 GUI 基准。

    基线方法

    • 对照与数据:闭源与开源 VLM 在同一 zero-shot 提示下判断转移是否一致;gWorld-8B、Code2World、SAWM、MobileWorld-HTML 预测语义或渲染未来。评测基准是 RSWT-BENCH,转移来自留出的 AITW 与 GUIOdyssey(Rawles 等,2023;Lu 等,2025)。作者称既有 GUI 安全基准的风险在屏幕或单步上可见(Sun 等,2025),检测器可以靠风险屏幕的样子得分。

    作者称,据其所知尚无 GUI world model 被做成把该比较对准观测结果;本文把核验定为 world model 在仿真、规划之外的第三种角色。

  3. 论文如何解决这个问题?

    LGWM在编码器空间预测下一屏,余弦差距检测违背,残差方向区分危害。

    LGWM 不渲染下一屏,而在观测编码器的空间里做动作条件预测,使核验变成向量比较。

    问题设定

    • 要比较的对象:未受破坏界面的结果分布写为 P⋆(st+1|st, at)。劫持结果与该条件分布不相容,但同一屏幕可在别的动作下合法,故只看 st+1 不够。
    • 架构角色:LGWM 是联合嵌入预测架构,角色反过来:预测表示在测试时保留,用来和观测比较,而不是学完编码器就丢弃。消费者是程序,因此不解码回像素。
    • GUI 上的三条约束:转移稀疏,均匀损失会被静止区域主导;点击与落点不可分;动作同时含离散类型、连续坐标和自由文本。

    网络与动作编码

    预测写成 ẑt+1=gϕ(zt,eψ(at)),含义是用当前屏的 patch 表示和动作 token,预测下一屏的整幅空间图。目标由 fθ 的指数滑动平均副本提供,并停止梯度。预测与目标都是 512 个 768 维 token。

    • 规模:fθ 为带逐层学习率衰减微调的 DINOv2 ViT-B/14;448×224 截图映成 32×16 网格。预测器为同宽 12 层 Transformer。推理只跑 fθ、动作编码器与预测器,172.86M 参数;训练图 261M,另含 EMA 编码器与逆动力学头。
    • 动作 token:可学习的类型 token、冻结 MiniLM 句向量,以及空间动作的坐标 token。坐标与视觉 patch 共用二维正弦位置基,使落点 (x, y) 与中心在 (x, y) 的 patch 使用同一位置编码。非空间动作用离散嵌入。

    训练

    • 变化加权:由图像对得到二值 patch 变化掩码,变化区域权重为 λchg=8,距离为 Smooth-L1,再按权重归一化。掩码没有语义标签,只避免静止区域淹没转移信号。
    • 辅助项:方差与协方差正则用来避免表示塌缩,否则对齐差距会饱和。逆动力学头从当前表示与下一目标表示恢复动作;作者称若丢掉动作相关区别,错误转移在原则上无法分开。系数 λcov=0.01,λinv=0.5。
    • 数据与日程:1,845,659 条真实转移(摘要写 1.85M;训练 1,824,824,验证 20,835),来自 AITW、MiniWoB++、GUIOdyssey、AndroidControl、AMEX,抽样比 55.0%、25.0%、9.8%、6.9%、3.3%,排除官方评测划分。120,000 次更新,全局 batch 512,AdamW,bfloat16,四张 A100-80GB。30,000 次更新后,部分 batch 改为二步或三步滚动,让预测器看到自身误差。端到端无人工语义标签。

    两种读出

    观测下一屏也由 fθ 编码,与预测同空间。完整性分数为 qint=1−cos(ẑt+1,zobst+1),即 1 减二者余弦。它不使用安全或不安全标签,不做攻击专用调节,参数只来自预训练 world model。

    • 方向头:残差与动作嵌入拼接,过单个线性层和 sigmoid。动作嵌入是条件项,不是危害特征。这是唯一监督分量,在不相交划分上拟合。Figure 2 将其标为第二阶段。
    • 作者给出的分工:残差大小问期望是否被违背,方向问违背由什么构成。作者称渲染界面给出的是判决,不是可供线性头重读的方向残差。

    诊断集如何使只看屏幕失效

    • 捐赠配对:每例是留出的 AITW 与 GUIOdyssey episode 中的完整转移。劫持例保留真实的屏和动作,把结果换成无关 episode 的凭证请求屏;该屏也像素级相同地作为自身合法转移的真结果出现,两处标签相反。
    • 对照与划分:配对安全转移复用同一屏和动作及其真结果;另有按高意外程度选出的真实良性转移,以及用无害捐赠屏做的错配。测试集为 222 对周围的 966 条转移。监督方法用 episode 不相交的 6,786 例。
    • 指标:RSWT 是 222 次劫持出现与 222 次合法出现的 pairwise AUC。Swap 比的是良性错配与配对安全转移,Cred 比的是良性错配与合法凭证转移。Proposition 1 的论证要点是:同对内结果屏相同,只看结果的分数相同,平局约定下每对贡献 1/2。
  4. 论文做了哪些实验?

    免训练RSWT AUC为0.987;残差头Harm AUC为0.953,提示词VLM为0.512至0.614。

    实验设置

    • 模型:被评测的是 LGWM(Table 1 参数列 261M;正文称训练图 261M、推理 172.86M)。对照为闭源 VLM:Gemini 3.7 Flash、GPT-5.6 Luna、Qwen3.7 Plus、Qwen3.7 Flash、Qwen3-VL-Plus、Claude Haiku 4.5、Qwen3-VL-Flash;开源 VLM:GLM-4.6V-Flash、Qwen3-VL-8B、Qwen3-VL-4B、Qwen3-VL-2B、Qwen2.5-VL-7B;GUI world model:gWorld-8B、SAWM、Code2World、MobileWorld-HTML。
    • 数据:预训练 1,845,659 条,来源与划分见 §4.1。RSWT-BENCH 有 966 条转移、222 个 donor pair。监督分量只用不相交的 6,786 例。
    • 协议:每个提示词基线收到同一前屏、结构化动作、后屏,以及询问结果是否与转移一致的共享 zero-shot 提示。§4.2 写生成式 world model 渲染期望后,由单独的 VLM(评估中为 Gemini 3.7 Flash)判断是否匹配观测,并点名 gWorld-8B 与 Code2World。延迟在单张 A100-80GB、batch size 1 上测量。
    • 指标:RSWT、Swap、Cred 均为 pairwise AUC,定义见 §3。Harm AUC 是劫持转移与良性错配之间的 pairwise AUC,二者都违背期望,仅前者被标为有害(§4.2)。
    • 人工与区间:72 条分层条目上,三人盲审与构造标签的一致率为 96.3±0.8%。三名盲标注者在 20 个劫持例与 20 个合法例上的 RSWT 等价 AUC 均值为 0.958(Table 1 注)。作者称领先系统的 donor-paired bootstrap 95% 区间半宽接近 0.01。论文未报告主 AUC 的独立重复次数。

    主结果

    据 Table 1。闭源延迟在表中为 “—”,下表写未报告。表内只列 8 行,含 RSWT 最低的 Qwen2.5-VL-7B。

    表格较宽,可左右滑动

    方法RSWTSwapCred延迟(ms)
    Gemini 3.7 Flash0.9950.9980.997未报告
    GPT-5.6 Luna0.9880.9710.979未报告
    LGWM0.9870.9700.98517.1
    Qwen3-VL-8B0.9070.9050.8591,097.8
    gWorld-8B0.8850.8970.837113,200.0
    Code2World0.8700.9010.85992,900.0
    MobileWorld-HTML0.5770.6910.568124,300.0
    Qwen2.5-VL-7B0.5740.5800.543819.4

    省略行的 RSWT(均据 Table 1):Qwen3.7 Plus 0.973,Qwen3.7 Flash 0.968,Qwen3-VL-Plus 0.918,Claude Haiku 4.5 0.880,Qwen3-VL-Flash 0.746,GLM-4.6V-Flash 0.909,Qwen3-VL-4B 0.905,Qwen3-VL-2B 0.688,SAWM 0.882。

    • 与闭源 VLM:免训练分数不用基准标签、攻击样本或任务提示,排对 222 对中的 219 对(§4.2)。作者报告,与 Gemini 3.7 Flash(p=0.07)、GPT-5.6 Luna(p=0.83)、Qwen3.7 Plus(p=0.07)的 donor-paired 比较未检出差异;Qwen3.7 Flash 低 1.9 个 AUC 点(p=0.02);其余系统更低,p<0.001。作者称 Swap 上仅次于 Gemini 与 GPT,Cred 上仅次于 Gemini。
    • 渲染式期望:作者称 gWorld-8B 与 Code2World 持有同类期望,但需渲染再裁判,约低十个 AUC 点(摘要与 §4.2),裁判之前至少 92.9 秒、至少 182 倍 FLOPs。摘要称延迟低三个数量级以上。摘要写 17 ms,Table 1 为 17.1 ms。
    • 人工参照:20+20 例上的均值为 0.958。作者称免训练分数与该人工参照相差在三个 AUC 点以内。

    代价、危害与对照探针

    • 代价:一次判定为 0.408 TFLOPs、峰值显存 1.09 GB、17.1 ms(正文与 Table 1)。作者称相对同一协议下的 Qwen3-VL-8B,FLOPs 少 27 倍、显存少 16 倍、延迟低 64 倍;将该 VLM 八路批处理仍有 10.9 倍延迟差距。作者称门控因此可以跑在每一步,而不是抽样子集。
    • 危害轴:免训练分数只看偏离大小,Harm AUC 为 0.513。同一转移一致性提示下,提示词 VLM 为 0.512 至 0.614;摘要称这些 VLM 接近随机。残差线性头为 0.953。该头在 RSWT 上为 0.930,低于免训练分数的 0.987。作者称两个读出量的不是同一件事;该头不增加可测到的运行时代价。
    • 信号从哪来:只看结果的检测器按构造为 0.500。汇合 zt 上的最强单帧探针为 0.796。收到两帧 fθ、fξ 表示和动作、但没有预测的监督分类器为 0.833。把预测配到另一转移,残差头从 0.930 降到 0.635。作者称屏幕外观或多一个向量解释不了结果,信号来自学到的转移先验。

    预测是否是可用的未来

    • 不是复制当前屏:预测与真下一状态编码的余弦为 0.618,与当前状态为 0.245;把当前表示当作预测的持续基线为 0.230。动作实际改变的 patch 上,copy score 为 −0.384。作者称预测的是将要改变的内容。
    • 不是回放训练集:在约 100 个同源留出候选中,macro R@1 为 68.3%,同动作类型最近训练转移的后继基线为 44.6%。作者称五个来源上都更高;论文未给分来源数字。
    • 随动作变、并可多步:反事实后原预测仍更接近真编码的胜率:换类型 0.891,同类型换目标 0.800,归一化坐标偏移 0.05 时 0.618(随机为 0.5)。十步递归预测的余弦为 0.562,持续基线 0.455,同批无关屏幕 0.092。作者称它仍是可用未来,不只是单步异常分。

    其他消融与分析

    • Table 2(ViT-S,15k steps,单 seed):去掉 rollout 训练,Cos@10 从 0.612 到 0.553(表中 −10%)。
    • 去掉 inverse dynamics,|Copy| 从 0.286 到 0.193(−32%)。
    • 去掉 VICReg,预测协方差有效秩从 43.7 到 22.5(−49%)。
    • 作者称表中各行是单 seed、规模小于主模型;对 control 的三 seed 复现里跨 seed 方差小,论文未给方差数值。
  5. 有什么可以进一步探索的点?

    作者称表示空间中伪造相符结果的难度尚未量化。

    作者指出的局限与后续方向

    • 伪造难度未量化:作者在 Discussion 写,基于期望的监控要求在智能体自身表示空间中伪造结果,这是更难的目标,但其难度尚未量化。
    • 专节:论文没有 Limitations 或 Future Work 专节;Conclusion 未再列出其他局限或后续实验。

    实验覆盖范围

    • 预训练:五个公开来源共 1,845,659 条转移,120,000 次更新,全局 batch 512,四张 A100-80GB(§4.1)。
    • 主检测:RSWT-BENCH 为 222 个 donor pair、966 条转移;监督头用不相交的 6,786 例(§3、Table 1)。
    • 对照系统:Table 1 含 7 个闭源 VLM、5 个开源 VLM、4 个 GUI world model 与 LGWM。闭源行的延迟、TFLOPs、VRAM 为 “—”。
    • 其余实验:§4.2 报告 Harm AUC 及单帧、无预测、错配预测三组对照;§4.3 报告复制、记忆、反事实动作和十步滚动。Table 2 为 ViT-S、15k updates、单 seed;作者称 control 另有三 seed 复现。
    • 人工与未写出的量:标签审计为 72 条、三人;RSWT 等价 AUC 为 20 个劫持例加 20 个合法例。论文未报告主 AUC 的独立重复次数,也未报告闭源 API 延迟。
  6. 总结一下论文的主要内容

    LGWM用表示预测核验GUI转移,RSWT AUC为0.987,作者称与最强闭源VLM相当。

    LGWM 把 GUI world model 用作转移核验器,而不是仿真器或规划器。

    • 问题:凭证屏本身看不出攻击。第三方界面可以改道动作之后的结果,同时让每张屏幕仍看似合理;只检查屏幕的监控会被一张合法屏幕绕过。
    • 方法:无解码器的动作条件模型把当前屏和结构化动作映射到下一屏表示,在 1,845,659 条真实转移上自监督训练。免训练分数是预测与观测的余弦差距;唯一监督分量是残差方向上的线性头。
    • 检测:在 RSWT-BENCH 的 222 对像素级相同结局上,免训练 RSWT AUC 为 0.987,排对 219 对,单次 17.1 ms、0.408 TFLOPs(Table 1)。作者报告与 Gemini 3.7 Flash(p=0.07)、GPT-5.6 Luna(p=0.83)、Qwen3.7 Plus(p=0.07)未检出差异。
    • 渲染式对照:gWorld-8B 与 Code2World 的 RSWT AUC 为 0.885 与 0.870。作者称约低十个 AUC 点,裁判之前至少 92.9 秒、至少 182 倍 FLOPs。表中最低 RSWT 为 Qwen2.5-VL-7B 的 0.574。
    • 危害与预测内容:残差大小的 Harm AUC 为 0.513,提示词 VLM 为 0.512 至 0.614,残差头为 0.953。预测与未来的余弦为 0.618,与当前屏为 0.245(§4.3)。
    • 作者的结论:作者认为,对转移完整性而言,难的是持有正确期望,而不是对期望做推理。作者称表示空间中的预测足以给程序做核验,且比渲染便宜三个数量级;潜空间门可每步运行,渲染器或 VLM 裁判只需用在被标记的少数转移上。
阅读原文arxiv.org