攻击arXiv 2602.15927
研究者提出面向多轮对话的视觉记忆注入攻击 VMI
提出 VMI,用扰动图像在多轮对话中潜伏并仅在触发话题输出预定消息
- arXiv
- 2602.15927
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Qwen2.5-VL-7B-Instruct、Qwen3-VL-8B-Instruct、LLaVA-OneVision-1.5-8B-Instruct 等 5 个
摘要VMI 让扰动图像在多轮 LVLM 中潜伏,作者称触发话题出现后仍可输出预定消息。
VMI 是面向多轮 LVLM 的定向图像攻击:第三方发布带小扰动的图像,良性用户把它当作普通输入。