研究者提出利用祖先 VLM 的黑盒对抗补丁攻击,可降低 VLA 任务成功率
提出利用祖先 VLM 优化对抗补丁,使已部署 VLA 任务失败
- arXiv
- 2610.09708
- 发表
- 层
- 提示层
- 场景
- 具身与机器人
- 被测模型
- OpenVLA、UniVLA、π0.5
提出利用祖先 VLM 优化对抗补丁,使已部署 VLA 任务失败
TAPDreamer 用公开编码器做固定补丁。
提出 IAU-FOA,构造可迁移图像扰动以诱导多模态模型输出目标语义
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
提出 DURA,用扩散模型生成自然对抗补丁操控 VLA 机器人动作
DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。
提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
提出 FRA-Attack,用频域对齐与梯度正则做可迁移定向视觉攻击
FRA-Attack 是面向闭源 MLLM 的迁移式定向图像攻击。作者要解决的是:空间域局部对齐重复全局低频,代理梯度的高频成分又把更新拉向代理自身。
提出多图越狱框架 DMN,把有害意图拆进图像序列绕过安全护栏
提出 GPO-V,用全局概率优化的视觉扰动越狱扩散视觉语言模型
GPO-V 把越狱从“开头必须顺从”改成“整段去噪概率朝肯定方向走”。。
提出删字变体越狱方法,利用重构与隐藏权衡绕过多模态模型安全过滤
提出 CoTTA 隐蔽视觉提示注入,使多模态模型输出指定指令
摘要CoTTA 以隐蔽触发和双目标对齐诱导指定句子。
提出 VMI,用扰动图像在多轮对话中潜伏并仅在触发话题输出预定消息
VMI 是面向多轮 LVLM 的定向图像攻击:第三方发布带小扰动的图像,良性用户把它当作普通输入。
提出 MM-Plan 多模态越狱框架,自动规划多轮图像编辑以越狱视觉独占目标
MM-Plan 是面向 Visual Exclusivity 的 black-box 多模态红队方法,并配有人工基准 VE-Safety。
提出 Text-DJ,用拆分文本图网格越狱视觉语言模型
提出多轮多模态越狱,并用 FragGuard 拦截有害响应
提出视觉推理序列攻击 VRSA,以图像序列越狱多模态大模型