研究者提出利用祖先 VLM 的黑盒对抗补丁攻击,可降低 VLA 任务成功率
提出利用祖先 VLM 优化对抗补丁,使已部署 VLA 任务失败
- arXiv
- 2610.09708
- 发表
- 层
- 提示层
- 场景
- 具身与机器人
- 被测模型
- OpenVLA、UniVLA、π0.5
另有 232 篇论文还没打上分类标签,暂不在筛选结果里。
提出利用祖先 VLM 优化对抗补丁,使已部署 VLA 任务失败
提出 WebMirage,用局部对抗图像劫持视觉网页 Agent 的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
提出 STCA,对驾驶视频 VLM 构造可迁移的时空对抗扰动
TAPDreamer 用公开编码器做固定补丁。
提出轨迹级可迁移对抗攻击,降低深度强化学习策略的期望回报
这项工作研究 DRL 上的迁移式黑盒观测攻击:受害参数不可访问时,在白盒代理上造扰动再迁移。
提出 IAU-FOA,构造可迁移图像扰动以诱导多模态模型输出目标语义
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。
提出 imMRAG 攻击,从多模态 RAG 私有图像库提取内容
提出 Bi-QSTO,优化能穿过质量筛选并在微调中削弱安全对齐的投毒样本
Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。
提出只训练或篡改多智能体潜在通信链路来提高有害遵从
学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。
用 MMPIBench 评测多模态提示注入对 Agent 框架的影响
摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
提出 Repeat-After-Me 自适应视觉提示注入,诱导 VLM 智能体执行指定任务
摘要论文提出了针对黑盒 VLM 的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
提出 ARENA 音频红队框架,自动构造文本安全且音频接地的越狱输入
提出 DURA,用扩散模型生成自然对抗补丁操控 VLA 机器人动作
DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。