研究者提出利用祖先 VLM 的黑盒对抗补丁攻击,可降低 VLA 任务成功率
提出利用祖先 VLM 优化对抗补丁,使已部署 VLA 任务失败
- arXiv
- 2610.09708
- 发表
- 层
- 提示层
- 场景
- 具身与机器人
- 被测模型
- OpenVLA、UniVLA、π0.5
提出利用祖先 VLM 优化对抗补丁,使已部署 VLA 任务失败
TAPDreamer 用公开编码器做固定补丁。
提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动
摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。
提出条件特征抑制防御,检出对抗补丁后抑制 VLA 内部特征
摘要条件抑制与 patch 相关的 SAE 特征,间歇攻击下可提高 SR,持续攻击下则不能。
提出 imMRAG 攻击,从多模态 RAG 私有图像库提取内容
提出 RECAST,本地改写图表与语音并做可逆数值映射以保护远程推理隐私
提出 Mind2Web-Injection 评测网页 Agent 视觉注入护栏
Mind2Web-Injection 用来检查网页截图护栏的判决是否对齐到该用的画面证据。。
提出 DURA,用扩散模型生成自然对抗补丁操控 VLA 机器人动作
DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
提出 VPH 与 VTH,只改视频帧劫持世界模型并投毒下游策略
只改看似安全的视频帧,经世界模型之后才改变下游机器人策略。 问题在于世界模型进入数据生成后,数据集检查看到的仍是安全演示,合成轨迹却可以变危险。
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示
提出 RA-Det,利用鲁棒性不对称检测 AI 生成图像
RA-Det 是合成图像检测器,用扰动下的表示稳定性差异代替外观痕迹。
提出 AdvOF,生成对抗物体误导视觉语言导航智能体的场景感知
AdvOF 是针对 VLM 驱动 VLN 服务导航的对抗物体攻击。