TAPDreamer:可跨任务迁移的世界动作模型对抗补丁
TAPDreamer 用公开编码器做固定补丁。
- arXiv
- 2610.06814
- 发表
- 层
- 提示层
- 场景
- 具身与机器人
- 被测模型
- FastWAM、DreamWAM-uncond、DreamWAM-joint 等 4 个
TAPDreamer 用公开编码器做固定补丁。
提出 IAU-FOA,构造可迁移图像扰动以诱导多模态模型输出目标语义
提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性
SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
提出 ARENA 音频红队框架,自动构造文本安全且音频接地的越狱输入
提出 DURA,用扩散模型生成自然对抗补丁操控 VLA 机器人动作
DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。
提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出
提出 SpeechJBB,评测语码转换语音下音频语言模型的越狱稳健性
SpeechJBB 用合成语音测量 LALM 在五语、语码转换和局部伪词混淆下的安全对齐,并另设口语理解对照。
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
提出 FRA-Attack,用频域对齐与梯度正则做可迁移定向视觉攻击
FRA-Attack 是面向闭源 MLLM 的迁移式定向图像攻击。作者要解决的是:空间域局部对齐重复全局低频,代理梯度的高频成分又把更新拉向代理自身。
提出多图越狱框架 DMN,把有害意图拆进图像序列绕过安全护栏
提出 GPO-V,用全局概率优化的视觉扰动越狱扩散视觉语言模型
GPO-V 把越狱从“开头必须顺从”改成“整段去噪概率朝肯定方向走”。。
提出删字变体越狱方法,利用重构与隐藏权衡绕过多模态模型安全过滤
提出 AudioHijack,用不可感知对抗音频对语音模型做上下文无关提示注入
摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。
提出 CoTTA 隐蔽视觉提示注入,使多模态模型输出指定指令
摘要CoTTA 以隐蔽触发和双目标对齐诱导指定句子。
提出 VMI,用扰动图像在多轮对话中潜伏并仅在触发话题输出预定消息
VMI 是面向多轮 LVLM 的定向图像攻击:第三方发布带小扰动的图像,良性用户把它当作普通输入。
提出 Text-DJ,用拆分文本图网格越狱视觉语言模型
提出音频叙事越狱,以嗓音投递风格绕过端到端语音模型拒答
提出多轮多模态越狱,并用 FragGuard 拦截有害响应