P-VMI:对抗图像经 KV cache 持续影响多轮对话
ServiceNow AI Research 等机构的研究者提出 Persistent Visual Memory Injection(P-VMI)攻击,可将对抗图像的隐藏后门写入后续 token 的 KV cache,使图像被遮蔽后仍能影响模型输出。在 Qwen3-VL-8B-Instruct 上,P-VMI 最强配置的目标成功率约 90%,即使只在第一轮暴露图像也能在更严格设置下生效;原始 VMI 攻击在触发时遮蔽图像后成功率为 0%,说明持久性需要专门优化。研究还显示攻击能穿过保留摘要 KV cache 的上下文压缩,且在 Gemma-4-12B 上触发成功率超过 90%(三轮对话内)、六轮后为 73%。cache-swap 消融把持续影响定位到 KV cache,残差流中单一线性方向预测攻击成功的 AUC 达 0.90 至 0.95。
推荐理由论文证明对抗图像的影响可在图像被遮蔽后仍留在 KV cache 中,为评估缓存复用与上下文压缩的安全性提供了新的攻击面。