DURA:用扩散模型生成自然对抗补丁攻击 VLA 机器人模型
Hidden in Plain Sight: Diffusion-Based Unrestricted Robotic Attacks on Vision-Language-Action Models
DURA 沿扩散潜空间轨迹生成自然对抗补丁,在 OpenVLA 与 π0-FAST 上把机器人动作导向指定目标。
针对 VLA 的有目标物理对抗补丁攻击。
- VLA 控制机器人时对抗鲁棒性仍少被研究,现有视觉补丁攻击常有明显伪影、依赖白盒,且单补丁优化耗时长,难以在真实机器人上部署。
- DURA 把局部补丁当作不受限内容,从良性种子出发,沿冻结扩散模型的潜空间去噪轨迹优化;白盒反传目标动作损失,黑盒只用动作输出估计方向,并用干净锚点轨迹约束自然度。
- 在 OpenVLA-7B 与 π0-FAST 的 LIBERO 上,DURA 的白盒 ASR 达到 100%;黑盒在 OpenVLA 上模拟/物理平均 ASR 为 86.0%/79.3%,在 π0-FAST 上为 100%。打印补丁可在 Franka 上随贴上与移除切换目标行为。
- 作者指出优化仍按实例进行、跨机器人泛化与主动防御评估仍开放,并计划做跨机器人迁移与更广泛防御。实验覆盖 OpenVLA-7B 与 π0-FAST、LIBERO 四套件及一台 Franka;AP 为每套件单次 100 次试验。
- 威胁模型
- 针对 VLA 的有目标物理对抗补丁攻击。攻击者可在视野中放置一块局部、内容不受限的补丁,测试时不能改模型参数、训练数据、机器人状态或语言指令。白盒可反传梯度;黑盒仅能查询并观察预测动作序列。目标是补丁可见时把策略驱向攻击者指定动作。
- 模型
- OpenVLA-7Bπ0-FASTopenvla-7B
- 基准
- LIBEROBridgeData V2Franka robot arm
- 指标
- ASRAPNIQECLIP-NaturalDISTSSSIMBSEPatch TV
研究者提出 DURA,一种基于扩散模型的机器人攻击方法,通过沿预训练扩散模型的隐空间轨迹优化,生成视觉上自然的对抗补丁,诱导 VLA 模型输出攻击者指定的目标动作。该方法同时支持白盒与黑盒设置,黑盒场景下只需获取受害模型预测的动作。在仿真和真实物理环境中的实验显示,DURA 的表现持续优于现有攻击方法。作者指出,这一结果暴露了物理部署中 VLA 模型的安全风险,并呼吁加强防御。
深度解读
这篇论文试图解决什么问题?
现有 VLA 补丁攻击不自然、依赖白盒且慢,DURA 要做成可部署的自然补丁攻击。
如何在不依赖明显噪声或白盒权限的情况下,用视觉上自然的局部补丁把 VLA 机器人导向攻击者指定动作。
- 场景与风险:VLA 根据图像、机器人状态和语言指令直接输出动作。作者认为其对抗鲁棒性仍 largely underexplored,被利用后可能造成物理世界伤害。已有工作显示,精心制作的视觉补丁或恶意语言指令可使策略停住、偏离任务或跟随目标行为。
- 现有攻击不足:作者归纳三点。(1)视觉自然度:现有补丁常像无意义或显眼的伪影,容易在真实工作空间被发现。(2)黑盒可部署性:常见攻击依赖参数、梯度或 logits,闭源机器人系统很少提供。(3)时间效率:常需对单个补丁做长时间逐实例优化,查询或计算代价高。
- 核心观察:目标机器人动作没有与类别或文本概念对应的视觉形式,其与图像的关系取决于指令、场景和机器人状态;单帧成功也不够,因为这些因素在执行中变化。作者因此用一个受扩散约束的补丁,在多样帧上联合优化同一动作目标。
- 提出的方法:提出 DURA(diffusion-based unrestricted robotic attack)。补丁内容不受范数约束,沿预训练扩散模型的潜空间轨迹搜索,用扩散先验保持视觉自然,用 VLA 攻击目标把机器人导向指定动作。白盒与黑盒只在每步攻击方向的估计方式上不同。
- 威胁模型:
- 目标:补丁可见时,把受害策略驱向攻击者指定的目标动作序列。
- 知识:白盒可获得受害策略梯度;黑盒为 action-output access,只能提交观测和语言指令并观察预测动作序列,不能获得参数或梯度。
- 能力:可在机器人视野中放置一块物理可实现的局部补丁;内容除此之外不受限。测试时不能修改模型参数、训练数据、机器人状态或语言指令。同一块补丁在多样观测上优化,以改善跨场景和任务的迁移。
- 受害系统:接收图像观测、机器人状态和语言指令并预测动作序列的 VLA 策略。
有哪些相关研究?
相关工作分 VLA 视觉/语言攻击与用扩散先验做自然对抗样本两类。
论文把相关工作分成 VLA 攻击和扩散先验两类,并在引言中把本文与白盒、迁移类方法对照。
VLA 视觉通道攻击
- Wang et al. (2025a) 研究基于补丁的目标,用于扰乱或引导机器人动作;FreezeVLA(Wang et al. 2025c) 用双层优化诱导动作冻结。论文指出这些方法攻击表现强,但需要受害模型的白盒访问。
- 可迁移补丁:UPA-RFAS(Lu et al. 2026)、EDPA(Xu et al. 2025)、VLA-Hijack(Fu et al. 2026)、TRAP(Huang et al. 2026)。它们在部署时避开受害模型梯度,但效果依赖代理到受害模型的迁移,且可能在不同架构和动作表示之间下降。论文认为,相对攻击成功和可迁移性,补丁自然度受到的关注较少。
语言通道攻击
- Jones et al. (2025) 用对抗指令使机器人执行偏离;SABER(Wu et al. 2026) 通过对指令做有界编辑,进行智能体式黑盒攻击。论文此处只描述这两项工作。
扩散先验与自然对抗样本
- 扩散模型作为图像先验:Song, Meng, and Ermon (2021)、Rombach et al. (2022)、Song et al. (2020) 被用来生成超出范数约束扰动的自然对抗样本。后续工作把对抗引导放进反向扩散(Chen et al. 2023a; Gao et al. 2024; Lin et al. 2025; Chen et al. 2023b,c; Dai et al. 2025; Xue et al. 2023)。
- AdvDiffVLM(Guo et al. 2024) 把目标语义嵌入生成图像,以攻击视觉–语言模型。论文指出,类别或文本概念有对应视觉语义,而目标机器人动作没有类似视觉形式。
基线方法与基准
- 白盒基线:UMA、UPA、UADA、TMA、FreezeVLA。黑盒基线:把 TMA 改成 NES 变体 TMA-NES;对 π0-FAST 另报 UPA-RFAS。
- 基准:LIBERO(Liu et al. 2023)四个任务套件;物理设置用 BridgeData V2(Walke et al. 2023)训练的模型;真机为 Franka 机械臂。
作者把 DURA 定位为同时覆盖白盒和动作输出黑盒的视觉攻击框架:有梯度时用梯度,否则直接从预测动作估计攻击方向,并由扩散先验把优化引向看起来自然的补丁。
论文如何解决这个问题?
DURA 在扩散去噪轨迹上交替去噪与攻击转向,白盒反传、黑盒用动作查询估计方向。
DURA 不直接优化像素,而是从良性种子补丁出发,沿冻结预训练扩散模型的潜空间轨迹做攻击引导去噪:扩散先验保持自然外观,目标动作损失把解码后的补丁推向指定机器人动作。白盒与黑盒共用同一去噪轨迹,只是估计每步攻击方向的方式不同。
问题设定与形式化
- 策略与补丁:受害策略记为 πθ。给定视觉观测 x 和语言指令 ℓ,预测动作序列 a = (a1, …, aM)。攻击者指定目标序列 a⋆。补丁 p ∈ [0, 1]h×w×3。
- 合成:对一批干净帧 {ob},用同一补丁合成 x̃b(p) = C(ob, p; m, Tb),其中 m 为补丁掩码,Tb 为第 b 帧的几何变换,用来表示同一物理补丁在不同观测中姿态和位置可以不同。
- 目标:Lattack(p) 是批次上对受攻击动作维度或 token 的加权损失。白盒时 yb(p) 为可微动作 token 输出(如 logits),单维损失为交叉熵 CE;黑盒时 Qθ 返回解码后的连续机器人动作,损失为与目标动作的 MSE。权重 wi 在实现中对平移、旋转、夹爪分别为 1.0、0.5、0.2。
扩散引导的补丁优化
- 模型与初始化:使用潜空间扩散模型(Rombach et al. 2022),含 VAE 编码器 E、解码器 D 和冻结去噪器 ϵ̂ϕ。先把良性种子裁剪 pclean 编码为 z0clean = E(pclean),再部分加噪到中间时刻 tstart,而不是从纯高斯噪声开始。实现中 tstart = 0.5。
- 干净锚点:从同一种子做一次无扰动 DDIM,预计算锚点轨迹 {ztanc}。当前对抗潜变量与锚点软混合:ztmix = (1 − αw) ztadv + αw ztanc,αw ∈ [0, 1],实现取 0.2。作者称这避免攻击轨迹偏离原始去噪路径过远。
- 一步更新:先做一步 DDIM 得到 ut−1,再注入攻击更新 zt−1adv = ut−1 − s · gt。s 为攻击步长。优化共 200 个 DDIM 步,最后 padv = D(z0adv)。算法 1 给出完整流程。
白盒与黑盒的方向估计
- 白盒:解码当前去噪潜变量,把候选补丁渲染进观测批次,对 Lattack 关于 ut−1 求梯度,得到 gtWB。损失显式包含解码、补丁渲染、策略评估和目标动作损失。作者称这只估计当前去噪步的局部方向,不沿整条 DDIM 轨迹反传。
- 黑盒:梯度不可用,只观察动作输出。在当前 u = ut−1 周围,按一步前向加噪分布 qt(zt | u) = N(√αt u, (1 − αt)I) 采样 K 个扰动,解码、渲染并查询受害策略得到损失。用 score-function 估计(Williams 1992)得到 gtBB;b 为可选的方差缩减基线,不改变期望。附录 A 给出推导。实现中 K = 2048。为公平比较,DURA 与 TMA-NES 都用 100 次优化更新,默认预算为每块补丁 100 × K 次查询。
补丁如何被使用与成功判定
- 优化范围:同一块补丁在来自多次 rollout 的帧批次上优化,使它跨场景、机器人状态和指令泛化,而不是过拟合单次观测。
- 评测放置:仿真与物理两套生成设置。真机把优化后的补丁打印出来,放在 Franka 工作空间的相机视野内;任务指令和策略权重不变,唯一干预是打印补丁是否出现。
- 指标:ASR = Nfail / N,在 rollout 级计算,表示被攻击策略未能完成任务的比例。AP 在动作步级计算,为各轨迹中匹配目标动作的步数占比的平均,用于把“被导向目标动作”和“附带的任务失败”分开。AP 只对 target-only 攻击有定义。
论文做了哪些实验?
LIBERO 上 DURA 白盒 ASR 为 100%,黑盒在 OpenVLA 平均 86.0%/79.3%,在 π0-FAST 为 100%。
实验设置
- 模型:OpenVLA-7B,使用在 LIBERO 四个套件上微调的检查点;π0-FAST 使用其 LIBERO 微调检查点。物理生成设置使用在 BridgeData V2 真实数据上训练的 openvla-7B。
- 数据与场景:LIBERO 四个套件 Spatial、Object、Goal、Long。生成后的补丁再拿到在不同任务套件上训练的受害模型上评测,数据来源和任务目标都不同。真机为 7 自由度 Franka,平行夹爪,单台固定 RGB 相机;任务为把面包片放进篮子。
- 攻击设置:白盒与黑盒均为有目标攻击。补丁分模拟与物理两种评测外观。白盒基线分 label-supervised(使用动作 token 真值:UMA、UPA、UADA)和 target-only(TMA、FreezeVLA)。黑盒为 target-only:TMA-NES;π0-FAST 另有 UPA-RFAS。OpenVLA 没有直接可比的纯查询基线,故把 TMA 改成 TMA-NES。
- 指标:ASR 为未能完成任务的 rollout 比例;AP 为匹配目标动作的步数比例。自然度用 NIQE、CLIP-Natural、DISTS、SSIM、BSE、Patch TV,协议在附录 D。
- 优化超参:tstart = 0.5,200 个 DDIM 步,αw = 0.2;动作损失权重 1.0 / 0.5 / 0.2(平移 / 旋转 / 夹爪)。黑盒默认 K = 2048,与 TMA-NES 一样做 100 次更新。Figure 7 的计时在单张 H200、batch size 16 上测量。
- AP 的试验量:附录 C 写明每个套件单次运行、每套件 100 次试验(10 个任务 × 10 次 rollout)。主表 ASR 的 rollout 总数论文未另行写出。
主结果
OpenVLA-7B 在 LIBERO 上的 ASR(%,Table 1)。↑ 为相对组内次优的增益。FreezeVLA 的物理列论文标为 “−”。
表格较宽,可左右滑动
方法 设置 Sim 平均 Phys 平均 Benign(无补丁) — 23.5 23.5 Clean patch — 39.5 39.5 UADA 白盒 label-supervised 100.0 100.0 TMA 白盒 target-only 99.8 86.6 DURA 白盒 target-only 100.0 100.0 TMA-NES 黑盒 target-only 42.3 39.3 DURA 黑盒 target-only 86.0 79.3 - 白盒:作者称 DURA 虽是 target-only、不用动作 token 真值,仍在模拟与物理两种补丁上四个套件都达到 100% ASR,与最强 label-supervised 基线 UADA 持平,并高于此前的 target-only 攻击。Table 1 中 FreezeVLA 只报告模拟:Spatial 95.3、Object 98.4、Goal 95.7、Long 92.2,平均 95.4。
- 黑盒:作者称模拟补丁平均 ASR 86.0%、物理补丁 79.3%,相对 TMA-NES 分别高 43.7 和 40.0 个百分点。黑盒 DURA 并非每套件都到 100%:模拟为 Spatial 100.0、Object 96.0、Goal 68.0、Long 80.0;物理为 97.0、70.0、76.0、74.0。模拟 Goal 是该组最低。
- 对照:无补丁与干净补丁的平均 ASR 只有 23.5% 和 39.5%。作者称失败来自优化后的对抗补丁,而不是“放上一块补丁”本身。白盒 label-supervised 里,UMA / UPA 的物理平均为 78.8 / 70.7,低于其模拟平均 99.5 / 89.7。
π0-FAST 上的跨动作表示结果
- 测了什么:Table 2 在同一 LIBERO 四套件上攻击 π0-FAST。OpenVLA 预测离散动作 token,π0-FAST 使用 action chunks。只比较 target-only。
- 结果:DURA 在白盒和黑盒、四个套件上 ASR 均为 100.0,两组平均都是 100.0。白盒 TMA 平均 58.0(Spatial 55.0、Object 46.0、Goal 78.0、Long 53.0)。黑盒 TMA-NES 平均 31.3,UPA-RFAS 平均 26.0。无补丁与干净补丁平均为 14.5 和 20.8。
- 作者解读:作者称结果表明 DURA 能在不同 VLA 动作表述上诱导目标行为。Table 2 未区分模拟补丁与物理补丁。
真机、自然度与查询预算
- Franka:Figure 3 的面包入篮任务中,无补丁时手臂完成任务。打印补丁进入相机视野后,手臂进入攻击者指定行为,包括冻结和错误前移;移开补丁后恢复,再次放入又回到目标动作。作者称在策略、指令和机器人设置不变时,行为跟随补丁是否出现,因而攻击在真实硬件上可控、可重复。论文未给出该任务的 ASR 或试验次数。
- 自然度:Figure 4 在主实验配置下定性比较 UADA、UPA、TMA 与 DURA。作者称基线更像噪声或不规则纹理,DURA 外观更连贯并有可识别语义。Figure 5 用六个指标比较 DURA、TMA、UPA、UADA 和无补丁参考。坐标轴可见 NIQE 约到 8、CLIP-Natural 到 0.3、DISTS 到 0.20、SSIM 到 1.00、BSE 到 60、Patch TV 到 0.8;星标标在 DURA 上。正文未给出各指标精确读数。作者称 DURA 在攻击方法中最接近无补丁参考,像素空间攻击更容易带来高频纹理和可见边界缝。
- 查询预算:Figure 6 在 LIBERO 上扫描每步查询数 K,从 128 到 2048,两种方法使用同一批帧和相同迭代次数。DURA 的 ASR 从 K=128 的 49% 升到 K=2048 的 100%;图上还标有 K=256 为 54(+11)、K=512 为 88(+43)、K=1024 为 96(+51)、K=2048 为 +60。TMA-NES 在这些预算下大约维持在 40%–48%,图上可见 48、43、45、45、40。作者称 K=512 时 DURA 已有较高 ASR,因此实用攻击不必用到 100% ASR 所需的查询预算。
其他消融与分析
- 时间(Figure 7,OpenVLA,单卡 H200,batch 16):横轴为小时。作者称白盒下 DURA 在数分钟内达到高 ASR,TMA、UPA、UADA 需要数小时才接近可比成功率;黑盒下 DURA 随优化时间变长 ASR 更高,TMA-NES 即使延长运行仍然较低。图上标出的时间点包括 0.1、0.3、1、3、10 小时(白盒)和 2、5、10、20 小时(黑盒),正文未给出各点精确 ASR。
- 补丁面积(Figure 8,附录 B):OpenVLA、LIBERO、白盒,报告三个随机种子的平均 ASR,其余设置与实验节相同。作者称补丁面积至多 1% 时 ASR 仍较低,2% 时升到 77%,5% 时到 99%,更大比例饱和在 100%。种子间方差在约 2%–3% 的过渡区最大,饱和后三个种子都到 100%。图注写的是 LIBERO-Spatial。
- AP(附录 C):无补丁 Clean 的 AP 为 25.0%(套件间 19–32%)。白盒补丁把平均 AP 提到 82.0%(套件间 61–99%),黑盒提到 67.3%(48–84%),峰值出现在 Object 和 Spatial。每柱为单次运行、每套件 100 次试验。作者称冻结来自优化后的对抗补丁。
- 输入变换防御(Figure 10 的 ASR、Figure 11 的 AP):在 JPEG 压缩、降低位深和高斯噪声的多种强度下,对 OpenVLA 与 π0-FAST、LIBERO 四套件报告。图注称虚线为无防御攻击,各防御曲线靠近虚线。正文称 DURA 在常见输入变换防御下仍然有效。图中可读的强度包括 JPEG Q=50/30/10、位深 k=6/5/4/3、高斯 σ=0.01/0.02/0.05/0.1;转换文本未给出可核对的逐格百分比,故不抄具体 ASR/AP。
- Table 1 的套件级例外:黑盒模拟 Goal 为 68.0%,是 DURA 在 Table 1 黑盒中的最低套件;物理 Object 为 70.0%。白盒 DURA 四套件均为 100.0,表中 ↑ 相对次优分别为模拟 +4.7、+1.6、+4.3、+1.0(平均 +0.2)和物理 +3.6、+16.4、+25.6、+8.2(平均 +13.4)。
有什么可以进一步探索的点?
作者把逐实例优化、跨机器人泛化和主动防御评估列为开放问题。
作者指出的局限与后续方向
- 逐实例优化:Conclusion 写明,尽管有查询预算上的折中,攻击仍按实例优化;作者计划研究跨机器人、跨场景的迁移,使一块补丁能对抗未见过的策略。
- 泛化范围:Conclusion 称跨机器人泛化仍是开放问题,包括不同末端执行器、相机布置和动作空间。
- 防御:Conclusion 称论文评测了常见输入变换,更广泛的防御——包括针对自然外观补丁的检测,以及在自适应攻击者下的评测——仍然是未来工作。
- 物理条件:Conclusion 把打印补丁的 Franka 实验写成 suggest:攻击可以在物理执行条件下持续。作者同时把“评估并缓解当前 VLA 的可部署级脆弱性”写成需要做的事(引言与结论)。
实验覆盖范围
- 被测策略:实验节评测 OpenVLA-7B(四个 LIBERO 套件微调检查点)和 π0-FAST(LIBERO 微调检查点);物理补丁生成使用 BridgeData V2 上训练的 openvla-7B。真机为一台 7 自由度 Franka、一台固定 RGB 相机、面包入篮任务,Figure 3 未报告 ASR 或重复次数。
- 基准与分组:LIBERO 的 Spatial、Object、Goal、Long。Table 1 同时给模拟补丁和物理补丁;Table 2 只给 π0-FAST 的 target-only ASR,未分模拟/物理。白盒还包含 label-supervised 基线 UMA、UPA、UADA。
- 防御与分析:Figure 10–11 覆盖 JPEG、位深降低和高斯噪声多种强度下的 ASR 与 AP。另有补丁面积(附录 B,三随机种子)、黑盒 K(Figure 6)、单卡墙钟时间(Figure 7)和六项视觉质量指标(Figure 5,精确数值在正文中未列表)。
- AP 样本量:附录 C 写明每套件单次运行、100 次试验(10 任务 × 10 rollout)。主表 ASR 的 N、攻击步长 s 的取值、黑盒基线 b 是否使用,论文未报告。
- 语言侧攻击:Related Work 讨论了对抗指令和 SABER,实验只做视觉补丁,不包含语言通道攻击。
总结一下论文的主要内容
DURA 用扩散潜空间轨迹生成自然补丁,白盒与黑盒都能把 VLA 导向指定动作。
DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。
- 问题:已有 VLA 视觉攻击多用像素扰动或白盒访问,补丁显眼、闭源系统难部署,且单补丁优化慢。攻击者只能在视野里放一块局部补丁,不能改参数、训练数据、状态或指令,却希望补丁一出现就把动作导向指定目标。
- 方法:从良性种子编码进冻结扩散模型,加噪到 tstart = 0.5 后沿 200 步 DDIM 轨迹优化;每步用干净锚点(αw = 0.2)混合,再减去攻击方向。白盒反传目标损失;黑盒在潜变量附近采样并用动作查询的 score-function 估计方向。同一补丁在多样帧和指令上联合优化。
- 主结果:OpenVLA-7B 上,白盒 DURA 在 LIBERO 四套件的模拟与物理补丁 ASR 均为 100%(Table 1),与 UADA 持平。黑盒平均 ASR 为模拟 86.0%、物理 79.3%,高于 TMA-NES 的 42.3% 和 39.3%;其中模拟 Goal 为 68.0%。π0-FAST 上白盒与黑盒四套件均为 100%(Table 2),白盒 TMA 平均 58.0,黑盒 TMA-NES / UPA-RFAS 为 31.3 / 26.0。
- 其余证据:附录 C 中白盒平均 AP 82.0%、黑盒 67.3%,无补丁为 25.0%。Figure 6 中黑盒 ASR 从 K=128 的 49% 升到 K=2048 的 100%。Figure 3 中打印补丁使 Franka 在放入时进入冻结或错误前移、移开后恢复。Figure 5 作者称 DURA 在六项视觉指标上比像素空间基线更接近无补丁参考。
- 作者结论:对抗控制可以藏在看起来普通的工作空间内容里,补丁一旦进入相机视野,物理工作空间本身就会变成攻击面。作者认为需要针对自然外观、可物理放置的对抗内容来评估 VLA 防御,而不是默认攻击会呈现为显眼伪影。