研究者提出视觉中心越狱攻击 VJA
提出纯视觉越狱攻击 VJA,把有害编辑指令编码进图像
- arXiv
- 2602.10179
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 测试
- Nano Banana Pro、GPT Image 1.5、Qwen-Image-Edit 等 9 个
另有 441 篇论文还没打上分类标签,暂不在筛选结果里。
提出纯视觉越狱攻击 VJA,把有害编辑指令编码进图像
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
提出 AudioHijack,用不可感知对抗音频对语音模型实施听觉提示注入
摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。
提出 LogInject 框架,评测日志分析中的被动提示注入及缓解
摘要论文评估了 LLM 日志分析中的上下文污染风险,提出分片拼接等攻击与三层防御,指出必须结合架构隔离与人工介入。
提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
提出 DIBench,评测界面注入对移动智能体选择决策的操纵
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
提出 imMRAG 攻击,从多模态 RAG 私有图像库提取内容
用 MMPIBench 评测智能体框架的多模态提示注入
摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出
提出 DURA,沿扩散潜空间生成自然对抗补丁,把机器人动作导向指定目标
DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。
提出控制标记注入,清空工具智能体推理链以绕过思维链监控
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出 Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私
摘要论文提出了针对黑盒 VLM 的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
检验结构越狱 IICL 能否跨厂商泛化并与语言约束叠加
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
提出推理通道预填与输出前缀组合攻击以越狱推理模型