P-VMI:对抗图像经 KV cache 持续影响多轮对话
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
- 一句话定位:本文研究了多模态模型中对抗输入在被从上下文中移除或掩蔽后,其攻击影响能否通过后续 token 的 KV 缓存持久存在。
- 要解决的核心问题:现有智能体安全部署假定攻击严格依赖恶意输入在提示词中的实时呈现,上下文管理或安全过滤将其移除后即可消除风险;作者质疑了该假设在保留 KV 状态机制下的有效性。
- 方法要点:提出了持久性攻击概念及 P-VMI 方法,通过结合首轮良性锚点监督与掩蔽后经由保留 KV 缓存反向传播的目标损失,使用 APGD 直接优化输入以将恶意指令隐蔽写入后续缓存。
- 核心实验结果:
- 在 Qwen3-VL-8B-Instruct 上,P-VMI 在注意力掩蔽下仍能达成最高约 90% 的目标成功率(Figure 4 中 party 达 0.92),而未优化的原始 VMI 成功率为 0%。
- 在上下文压缩保留摘要 KV 缓存的设定下,即使图像仅在首轮出现且后续对话被丢弃,平均成功率仍达 70% 至 89%(Figure 7)。
- 缓存交换因果消融显示固定文本时仅对抗缓存能触发攻击,且残差流单一线性方向能以 0.91 的合并 AUC 预测攻击成败(Figure 8)。
- 作者的结论与启示:作者认为仅从提示词中移除不可信输入是不充分的,保留的 KV 状态构成了可被利用的攻击面;完全重新计算 KV 缓存虽能阻断该通道,但会牺牲保留缓存的效率收益,亟需针对保留状态安全性的新型防御机制。