AdvOF:用对抗物体融合攻击 VLM 驱动的视觉语言导航智能体
Disrupting Vision-Language Model-Driven Navigation Services via Adversarial Object Fusion
AdvOF生成对抗物体误导四个VLN智能体的感知;Vlmaps上targeted KPA为0.242。
攻击者向VLM场景感知模块放入对抗物体,使多视角下被标成指定对抗标签,从而扰乱定位与任务执行。
- VLM驱动的VLN智能体在服务导航里依赖场景感知。作者认为现有2D攻击难对齐3D与多视角,3D攻击又主要面向传统视觉模型,评不清VLM感知模块的稳健性。
- AdvOF先对齐受害物体的2D与3D位置并渲染多视角,再用颜色、Chamfer距离和带mask的视觉-文本损失做协同优化,最后按视角权重迭代融合。
- 四个智能体在Habitat、white-box的attacked设置下,AdvOF(Targeted)的KPA与SR低于Table 3同表基线。Table 4中ORION的Asr为0.94。作者称编码器迁移最大下降为25.0%。
- 论文未专门讨论局限。实验覆盖四个Habitat智能体、MP3D与HM3D、白盒主结果,以及编码器、数据集和架构迁移,还有五种图像噪声。论文未报告重复次数。
- 威胁模型
- 攻击者向VLM场景感知模块放入对抗物体,使多视角下被标成指定对抗标签,从而扰乱定位与任务执行。white-box可访问该VLM;black-box用proxy agents制作后迁移。攻击者可收集环境数据,并用Painting、3D printing修改目标物体。
- 被测模型
- LsegClipViT-L/16ViT-B/32ResNet101
- 基准
- HabitatMP3DHM3D
- 指标
- KPASPLSRAccAsr
研究者提出对抗物体融合(AdvOF),一种针对视觉语言导航(VLN)智能体的攻击框架,通过生成对抗性 3D 物体攻击其基于 VLM 的感知模块。AdvOF 先在 2D 和 3D 空间对齐受害物体位置并渲染对抗物体,再在物理属性与 VLM 感知上协同优化,并按视角分配重要性权重进行多视角迭代融合。评估显示该方法能有效降低智能体在对抗条件下的表现,同时对正常导航任务干扰极小。
深度解读
这篇论文试图解决什么问题?
作者提出AdvOF,用对抗3D物体误导VLM驱动的VLN场景感知。
VLM驱动的VLN智能体,会被放进环境的对抗3D物体误导场景感知,使服务导航任务执行失败。
- 场景:作者把VLN放在智慧城市、自主配送、辅助机器人等服务流程中,并称可靠性与QoS很重要。LLM做高层交互与任务规划,VLM做低层感知与场景识别。
- 现有不足:作者称2D攻击有attack misalignment与multi-view inefficiency;面向VGG、R-CNN、ResNet的3D攻击有cross-modal inefficiency,难适配VLM的跨模态特征。面向LLM智能体的攻击则多打在规划模块。
- 作者的设想:对抗物体应只作用于指定物体,在3D操作与2D相机视图之间保持欺骗,并在不同视角和指令下仍然有效。
- 本文做法:作者提出Adversarial Object Fusion(AdvOF),生成可多视角欺骗VLM的对抗物体。作者称它能在对抗条件下降低智能体表现,同时少干扰正常导航,并称在四个VLN智能体上达到SOTA攻击性能。
- 威胁模型:
- 受害系统与目标:连续环境中带LLM和VLM的VLN智能体。攻击场景感知模块,使VLM把对抗物体标成攻击者定义的标签,扭曲语义地图,使智能体到不了目标物体。
- 成功条件:Object-Specific Control、3D-2D Consistency、Multi-View Robustness。
- 知识:white-box可访问智能体的VLM;black-box不知该VLM,用proxy agents制作攻击再迁移到目标智能体。
- 能力:Environment Manipulation,可收集环境数据,并以Painting、3D printing等方式修改目标物体。
有哪些相关研究?
相关工作分VLN基础模型、2D攻击与3D攻击;作者称后两类都不适配该设定。
LLM用于VLN
- LEO(Huang等,2024)用大规模3D数据训练LLM,做3D感知、推理与动作。
- LLM-Planner(Song等,2023)先生成子目标高层计划,再由低层规划器细化为动作。
- NaviLLM(Zheng等,2024)用schema指令把具身导航写成生成问题。
VLM用于VLN
- Cows(Gadre等,2023)做语言驱动的zero-shot物体导航;实验表将该智能体写作Cow。CF(Shafiullah等,2023)经SLAM把基础模型的像素对齐特征写入3D地图。
- Vlmaps(Huang等,2023)把VLM特征与3D重建合成空间地图;ZSON(Majumdar等,2022)用CLIP视觉编码器加强化学习训练。
- 相关工作将Dai等(2024)写作ONION,实验节将同一引用写作ORION:用多个基础模型,经用户交互导航到个性化物体。
2D对抗攻击
- AdvClip(Zhou等,2023)为预训练VLM做下游无关的通用对抗补丁;实验节写作AdvCLIP。MF(Zhao等,2023)用黑盒查询的迁移攻击生成针对VLM的目标对抗样本。
- 面向LLM智能体:EIRAD(Liu等,2024)用GCG做具身攻击数据;POEX(Lu等,2024)向规划模块注入可执行对抗后缀;NPS(Wen等,2024)用对抗后缀误导户外导航方向。论文只作描述,未逐篇对比。
- 文本侧还提到token manipulation、基于梯度的优化和jailbreak prompting。
3D对抗攻击与基线
- ST(Liu等,2020)用时空扰动和轨迹注意力;TT3D(Huang等,2024)用纹理网格与NeRF空间优化做可迁移的目标3D样本。
- 其他路线包括梯度优化、模型生成和网格变换。论文举例Tsai等(2020)的点云对抗物体、Zhou等(2020)的标签引导攻击,以及Suryanto等(2023)的通用对抗伪装。
- 基线方法为MF、AdvCLIP、ST、TT3D。基准/数据集为仿真器Habitat;Vlmaps与Cow用MP3D,CF与ORION用HM3D(Table 1)。
作者称2D攻击不能扰动3D空间,多视角或未见视角效果有限;3D攻击主要面向PointNet、PointNet++以及Fast R-CNN、YOLO,难以适配具有跨模态特征的VLM。本文据此生成面向VLN智能体的多视角对抗物体。
论文如何解决这个问题?
AdvOF对齐受害物体后,联合优化物理与VLM特征,再按视角权重融合。
AdvOF分三步:对齐受害物体并渲染到多视角,再联合约束物理属性与VLM感知,最后按视角重要性做迭代融合(Fig. 3)。
问题设定与形式化
- 智能体在连续环境中执行前进、转向等原语。模块为指令交互、场景感知、物体定位和目标动作(Fig. 2)。
- 指令经LLM抽出地标与对应动作。RGB-D和点云建成语义地图M,维数为H×W×C。定位时用VLM文本编码器计算grounding label与地图的相似度,取得分最高的网格。
- 目标不在当前视角则做场景探索,按距离和角度执行动作,再判断是否到达。动作空间包括rotate、move、stop。
- Definition 1:受害物体O、标签Tv,生成Oadv,使视角集合V下被感知为对抗标签Tt。优化为 argminOadv L3D(Oadv,O)+Ev∈ VL2D(Oadvv,Tt,θ)。L3D约束O与Oadv的物理相似,L2D推动各2D视角误分成Tt,θ为智能体所用VLM的参数。
对齐物体渲染
- 用VLM做开放集检测,筛出含Tv的场景。Grounding DINO检测,SAM分割,得到MASK与SCORE。实现中该开放集VLM为LLaVA。
- MASK反投影到3D后用DBSCAN聚类,随机选一个簇作为受害物体O。
- Definition 2:δadv是与O同形状的点云噪声,Oadv由O加δadv得到,并满足扰动上界。相机内参、外参和深度把物体与扰动渲染到指定视角。
协同优化
- L3D由颜色的L2距离和Chamfer distance组成,分别约束颜色与几何。
- L2D在物体mask内比较VLM特征,相似度用余弦函数。无目标攻击把对抗视觉特征推离受害图像和文本Tv;背景项用来避免只约束mask时扰动背景。作者称Fig. 4(d)可见只约束mask会扰动背景预测。
- 目标攻击另保留一张目标图像及其mask,使特征靠近对抗标签。两项都用系数α、β平衡。Fig. 4以table到alarm为例,展示不同正则组合下的类别可视化;完整目标损失把预测从受害标签移向目标标签,并保持背景。
- 实现参数:α=0.5,β=0.01,扰动上界ε=32/255,优化器Adam,迭代200次。grounding的box阈值和text阈值均为0.40。
对抗物体融合
- 视角权重由grounding的SCORE和该视角中对抗物体的像素数相加,再对全部视角归一化。作者称不完整或远景权重更低,完整或近景权重更高。
- Algorithm 1对每个视角从三维扰动渲染二维扰动,按目标攻击的二维损失做局部更新,再按权重写回全局扰动。
- 一致性判定:与上一视角局部扰动的MSE不低于μ1则拒绝更新并降低权重。融合判定:两视角二维损失之差不低于μ2则丢弃并缩小扰动上界。μ1=0.01,μ2=0.05。在Max次内仍不满足则拒绝该视角的融合。论文未把Max与200次迭代写成同一个量。
- 攻击后用扰动数据替换受害物体的RGB-D,重建语义地图,再在新场景上评测。
成功如何判定
- SR是智能体在距目标物体1.0m内执行STOP的回合比例。SPL按最短路径加权、再按实际路径长度归一化。KPA是每个子目标上正确决策的比例。
- Acc是场景感知模块的预测准确率,Asr是误导该预测的攻击成功率。论文未写Asr的判定阈值,也未使用LLM评审。
论文做了哪些实验?
Table 3的attacked设置下,四智能体的AdvOF(Targeted) KPA与SR均低于同表基线。
实验设置
- 智能体:Vlmaps(ICRA’23,Habitat,MP3D,Lseg)、Cow(CVPR’23,Habitat,MP3D,Clip)、CF(RSS’23,Habitat,HM3D,Clip)、ORION(ICRA’24,Habitat,HM3D,Lseg)(Table 1)。前三者为非交互智能体,ORION为交互式个性化物体导航。
- 数据:每个智能体和数据集随机20个场景,每场景10个受害物体,每物体10条指令(Section 5.1)。MP3D有90个建筑级场景,HM3D有1,000个。指令样例见Table 2。论文未报告重复次数。
- 环境划分:另建不含对抗物体的验证集。Table 3上半为含攻击物体的attacked,下半为不含攻击物体的normal。主结果为white-box。
- 基线:MF、AdvCLIP、ST、TT3D。对两种VLM攻击,只选含受害物体的RGB图;对两种3D攻击,先做对齐渲染,再按原文流程攻击。
- 指标:SR、SPL、KPA、Acc、Asr。attacked表头为KPA↓、SPL↑、SR↓;normal表头方向相反。论文未写Asr阈值或评审模型。
- 实现:开放集检测用LLaVA;α=0.5,β=0.01,ε=32/255,Adam,迭代200,μ1=0.01,μ2=0.05。感知评测对每个受害物体从新视角采样20张图像。
主结果
据Table 3的attacked、white-box。AdvOF-T表示AdvOF(Targeted)。
表格较宽,可左右滑动
智能体 Base KPA TT3D KPA AdvOF-T KPA AdvOF-T SPL AdvOF-T SR Vlmaps 0.560 0.331 0.242 77.5 0.122 Cow 0.208 0.125 0.084 19.9 0.067 CF 0.275 0.163 0.116 27.0 0.087 ORION 0.215 0.125 0.089 15.6 0.064 - 同表attacked中,四个智能体的AdvOF(Targeted)在KPA和SR上都低于MF、AdvCLIP、ST、TT3D和AdvOF(Untargeted),SPL则更高。Untargeted的KPA依次为0.283、0.106、0.142、0.104。作者称在这四个智能体上达到SOTA攻击性能。
- 作者称attacked上会干扰导航,normal上接近无方法干扰的表现。normal中Vlmaps的AdvOF(Targeted)与Base同为KPA 0.480、SPL 58.0、SR 0.218。同块MF为KPA 0.404、SPL 67.1、SR 0.187。Cow、CF、ORION的normal targeted与各自Base接近,但并非逐项相同。
- Fig. 6标注无攻击时chair置信度0.44,MF为0.41,AdvCLIP为0.13;ST的table为0.33,TT3D为0.54,AdvOF为0.81。作者称AdvOF把该物体的感知从chair改到table。作者还称ST在轨迹相似时有效,指令导致异常轨迹时攻击变差;TT3D更关注物体本身,但仍受感知模块中VLM复杂度限制。
感知模块与多视角
- Table 4中AdvOF的Acc/Asr:Vlmaps 0.04/0.92,Cow 0.05/0.91,CF 0.02/0.93,ORION 0.05/0.94。Base的Asr均为0.00,Acc为0.89、0.83、0.81、0.91。
- 同表MF的Asr为0.15、0.06、0.12、0.08;AdvCLIP为0.34、0.32、0.35、0.26;ST为0.56、0.61、0.64、0.65;TT3D为0.70、0.76、0.78、0.71。作者称2D方法难以从新视角误导VLM,3D方法有攻击效果但不稳定,AdvOF在新视角上更稳定。
- Fig. 7给出TV到alarm的view1至view4,图中未标数值。作者称从远景到近景都能生成对抗物体,且效果限制在物体自身区域,不改变环境中其他物体的感知。
迁移与物理噪声
- 编码器(Table 5):每组第一行是同一骨干上生成并测试,第二行是迁到另一骨干,括号为下降比例。Clip的ViT-B/32迁到ViT-L/16,KPA从0.084到0.105(25.0%),SPL从19.9到19.0(4.5%),SR从0.067到0.076(13.4%)。作者称观察到的最大性能下降为25.0%。Lseg的ViT-L/16迁到ResNet101,KPA为0.287(18.6%)。
- 数据集(Table 6):HM3D1迁到HM3D2,KPA从0.089到0.096(7.9%)。作者称跨数据集几乎不降,最大下降为7.9%。MP3D1迁到MP3D2的KPA括号为5.0%。作者把同一物体的不同场景当作不同视角。
- 架构:Table 7给出两组三行。正文称第一行是同一VLM上生成并测试,第二行是该VLM上基线方法的最好结果,第三行是迁到另一VLM。转文本后方向标签与数字块的对齐不稳定,故不把某一组绑定到(Lseg)到(Clip)或反向。两组第三行为0.131(4.8%)/17.2(2.9%)/0.097(1.0%)与0.313(5.4%)/71.9(6.0%)/0.159(13.4%)。作者称相对白盒,黑盒效果下降,但仍与白盒基线相当。Table 8的Clean为0.560/49.0/0.297,AdvOF为0.242/77.5/0.122,数值与Table 3 attacked中Vlmaps的Base和AdvOF(Targeted)相同;论文未写明该表智能体。Shear为0.283/74.1/0.149,Gaussian为0.289/72.1/0.150,Scaling为0.255/76.5/0.132,Brightness+为0.243/75.2/0.138,Brightness-为0.241/75.0/0.129。参数为shear(-16, 16)、scaling(0.8)、Gaussian noise(0.1)、亮度增强1.5、亮度降低0.5。作者称剪切和高斯噪声影响更大,亮度变化影响更小。
其他消融与分析
- Table 9的AdvOF行为0.242/77.5/0.122,与Table 3 attacked中Vlmaps的AdvOF(Targeted)数值相同;论文未写明智能体。去掉Alignment后为0.450/59.6/0.233,去掉L2d后为0.512/53.5/0.267,去掉L3d后为0.310/70.1/0.169,去掉Fusion后为0.338/68.9/0.176。
- 作者称去掉Alignment后,SAM给出的2D位置紊乱,对不上真实3D位置;L2d直接作用于感知模块;L3d约束物理属性;Fusion按视角权重融合,并帮助优化收敛。
- Fig. 8横轴上界为8、16、32、64、128。作者称上界增大时攻击表现逐步提高,较低上界ε=32一般即可。正文未给出各点的KPA、SR或SPL。论文未说明图中刻度是否已除以255。
- Fig. 10按指令中的子目标顺序放置受害物体。作者称攻击靠前的物体会把智能体带到不太可能含后续目标的区域,从而影响后续目标;攻击最后一个时只扰乱该目标。正文未给出各点数值。
有什么可以进一步探索的点?
论文未专门讨论局限或后续工作。
作者指出的局限与后续方向
- 论文没有Limitations、Discussion或Future Work专节。第6节只重述对齐渲染、协同优化和物体融合,并称该方法对基础模型赋能的VLN智能体构成威胁,未把某项结果写成局限或后续工作(Conclusion)。
实验覆盖范围
- 被测智能体为Vlmaps、Cow、CF、ORION,共4个,仿真器均为Habitat;VLM为Lseg或Clip(Table 1)。
- 数据集为MP3D与HM3D。每个智能体和数据集随机20个场景、每场景10个物体、每物体10条指令(Section 5.1)。
- 主结果为white-box,基线为MF、AdvCLIP、ST、TT3D。感知评测对每个受害物体从新视角采样20张图像(Section 5.2)。
- 迁移包括图像编码器、场景数据集划分和VLM架构。black-box设定为不知目标VLM,用proxy agents制作后再迁移(Section 3.2、5.3)。
- 物理噪声为shearing、scaling、Gaussian noise、brightness enhancement和brightness reduction(Section 5.4)。论文未报告重复次数,也未报告Asr的判定阈值。
总结一下论文的主要内容
AdvOF以多视角融合生成对抗物体;作者称白盒下干扰导航且少影响正常任务。
AdvOF是针对VLM驱动VLN服务导航的对抗物体攻击。
- 问题:智能体在3D环境里用2D图像做场景感知。作者认为2D扰动难同时满足空间对齐和多视角,面向传统视觉模型的3D攻击又难跨到VLM,因而服务流程中的感知模块缺少对应评测。
- 做法:先检测、分割并对齐受害物体,再渲染到多个视角。优化同时约束颜色、Chamfer距离和mask内的视觉-文本特征,并按视角权重做一致性与融合判定。white-box可访问智能体VLM,black-box用proxy agents制作后迁移。
- 白盒任务指标:Table 3的attacked设置下,AdvOF(Targeted)在Vlmaps上KPA为0.242、SPL为77.5、SR为0.122;Cow、CF、ORION的KPA为0.084、0.116、0.089。四个智能体上,该变体的KPA和SR都低于同表的MF、AdvCLIP、ST和TT3D。
- 感知与正常导航:Table 4中AdvOF的Asr为0.92、0.91、0.93、0.94,其中ORION为0.94,CF的Acc为0.02。normal设置下,Vlmaps的AdvOF(Targeted)与Base同为KPA 0.480、SPL 58.0、SR 0.218。作者称正常任务受到的干扰小。
- 迁移与噪声:作者称编码器迁移的最大性能下降为25.0%(Table 5),数据集迁移最大为7.9%(Table 6)。作者称黑盒效果低于白盒,但仍与白盒基线相当。剪切和高斯噪声比两种亮度变换带动的指标变化更大(Table 8)。
- 作者结论:作者称AdvOF能在多视角下把受害物体感知成对抗标签,并少干扰正常导航,从而对基础模型赋能的VLN智能体构成威胁。论文未专门讨论局限。