跳到正文
原文
论文追踪· arXiv:2610.09027·本站收录 · 原文发表 精选关注度57

P-VMI:对抗图像经 KV cache 持续影响多轮对话

Visual Memory Attacks Can Persist Through The KV Cache

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

作者优化图像使攻击在移出上下文后经KV缓存持久传播,在Qwen3-VL-8B-Instruct上SR∧达约90%。

威胁模型攻击者寻求延迟效果,使模型在良性轮次正常但在触发词处输出选定目标。

问题
长上下文智能体在摄入不受信输入后,现有防御和上下文管理机制假设移除或掩蔽恶意输入即可消除危害,但保留的KV缓存可能成为攻击隐蔽持久传播的载体。
方法
提出持久性视觉记忆注入(P-VMI),将优化目标分为图像可见时的良性锚点项和掩蔽后经由KV缓存反向传播的目标项,利用APGD进行端到端优化。
实验与结果
在Qwen3-VL-8B-Instruct上掩蔽后SR∧最高约90%,在上下文压缩保留摘要KV缓存下平均达89%成功率;残差流单一方向能以0.91合并AUC预测成功。
局限与可以继续做的
攻击需要白盒梯度访问,未测试向黑盒模型迁移;评估未覆盖新问题泛化;报告的多为三种子选优最佳情况;重新计算KV缓存可消除该攻击通道。
实验设置Qwen3-8B、Qwen3-VL-8B-Instruct 等 · LMARKS、COCO 等 · SR∧、Benign Score (min) 等
威胁模型
攻击者寻求延迟效果,使模型在良性轮次正常但在触发词处输出选定目标。攻击者拥有白盒访问权限,仅控制clean输入周围ℓ∞半径ϵ球内的输入(软提示或图像)。攻击者不掌握后续对话,须在未见对话中泛化。受害系统为处理长上下文并保留KV状态的LM与VLM。
模型
Qwen3-8BQwen3-VL-8B-InstructGemma-4-12BQwen2.5-32B
基准
LMARKSCOCODIVERSE-TESTHOLIDAY
指标
SR∧Benign Score (min)Benign Score (mean)AUC
AI 导读和推荐理由全文 376 字

ServiceNow AI Research 等机构的研究者提出 Persistent Visual Memory Injection(P-VMI)攻击,可将对抗图像的隐藏后门写入后续 token 的 KV cache,使图像被遮蔽后仍能影响模型输出。在 Qwen3-VL-8B-Instruct 上,P-VMI 最强配置的目标成功率约 90%,即使只在第一轮暴露图像也能在更严格设置下生效;原始 VMI 攻击在触发时遮蔽图像后成功率为 0%,说明持久性需要专门优化。研究还显示攻击能穿过保留摘要 KV cache 的上下文压缩,且在 Gemma-4-12B 上触发成功率超过 90%(三轮对话内)、六轮后为 73%。cache-swap 消融把持续影响定位到 KV cache,残差流中单一线性方向预测攻击成功的 AUC 达 0.90 至 0.95。

推荐理由论文证明对抗图像的影响可在图像被遮蔽后仍留在 KV cache 中,为评估缓存复用与上下文压缩的安全性提供了新的攻击面。

深度解读

6 个问题 · 约 6,800 字

  1. 这篇论文试图解决什么问题?

    探究对抗输入被从上下文移除或掩蔽后,能否通过后续token的KV缓存持久操控模型。

    这篇论文试图解决的核心问题是:对抗性输入被从上下文移除或注意力掩蔽后,是否仍能通过后续 token 的 KV 缓存持久控制模型行为。

    • 场景与重要性:现代语言模型与多模态智能体在日益增长的长上下文中自主运行,频繁接触网页、文档等不可信文本与图像。现有部署广泛假设攻击效果严格绑定在对抗输入本身,一旦通过安全过滤、上下文淘汰或压缩将恶意 token 移除,其攻击影响便随之消失。
    • 现有防御与上下文管理的潜在盲区:许多长上下文管理机制(如缓存逐出、丢弃图像 token、保留摘要 KV 缓存)为了节省重算计算量和延迟,会保留早期输入计算得到的键值状态。作者指出这些保留状态可能成为攻击传播的隐蔽通道。
    • 核心观察与假设:作者提出,对抗样本在被移除后失效并非不可逾越的本质属性,攻击者可以通过专门的目标函数,优化输入以使其在后续 token 的保留 KV 缓存中写入持久化控制信号。
    • 论文提出的方法:论文提出了持久性攻击(Persistent Attacks)概念,并通过针对软提示(soft prompts)以及图像的持久性视觉记忆注入(Persistent Visual Memory Injection, P-VMI)予以实现。
    • 威胁模型:
      • 攻击目标:模型在良性交互轮次中保持正常行为,但在后续出现特定触发提示词时,输出攻击者指定的目标响应。
      • 攻击者知识:攻击者对目标模型具有白盒(white-box)访问权限。
      • 攻击者能力:攻击者仅控制位于 clean 输入周围 ℓ∞ 半径 ϵ 球内的对抗输入(软提示嵌入或图像像素),无法获知或控制后续的具体对话内容。
      • 受害系统:运行在长上下文、具备 KV 缓存复用或上下文压缩机制的多模态智能体系统。
  2. 有哪些相关研究?

    梳理了连续空间对抗攻击、智能体投毒与KV缓存压缩,指出既有攻击均要求载荷实时留在上下文中。

    论文在对抗样本、智能体攻击与上下文管理三个方面梳理并对比了相关研究:

    对抗样本生成

    • Szegedy 等人(2014)、Goodfellow 等人(2015)——早期在图像分类器上发现对抗样本;Madry 等人(2018)提出 PGD,Croce & Hein(2020)提出 Auto-PGD(APGD)。
    • Zou 等人(2023)——通过基于梯度的离散搜索在语言模型上寻找越狱提示词。
    • Schwinn 等人(2024)、Lester 等人(2021)——通过在连续嵌入空间优化软提示越狱,但攻击无法直接映射回网页等实际输入介质。
    • Carlini 等人(2023)、Schlarmann & Hein(2023)、Qi 等人(2024)、Bailey 等人(2024)——利用视觉语言模型的连续输入通道通过梯度优化实现越狱或运行时劫持。论文指出,上述攻击均要求对抗输入在起效时持续留在上下文中。

    智能体攻击与记忆投毒

    • Greshake 等人(2023)——间接提示注入(indirect prompt injection),将指令隐藏在外部内容中供智能体读取。
    • Chen 等人(2024b)、Yang 等人(2026)、Bouzidi 等人(2026)——针对智能体长期记忆库的投毒攻击,恶意内容后续被检索回上下文。
    • Hubinger 等人(2024)——休眠智能体(sleeper agents),将后门行为直接植入模型权重中。
    • Schlarmann & Hein(2026)——视觉记忆注入(VMI),优化单张图像使多轮对话在触发词出现前保持正常、触发时输出目标响应。论文指出 VMI 在图像被掩蔽后完全失效(成功率为 0%)。
    • Zhang 等人(2026)——同步工作 HijackKV,通过优化文本前缀使良性文本缓存编码攻击目标,并在不依赖位置的缓存复用系统中生效。

    上下文压缩与 KV 缓存管理

    • Packer 等人(2023)、Wang 等人(2025)——通过离散文本对上下文进行递归摘要压缩。
    • Zhang 等人(2023)、Li 等人(2024)、Xiao 等人(2024)、Chen 等人(2024a)、Huang 等人(2025)、Liu 等人(2026)——通过缓存逐出(如 H2O、SnapKV、StreamingLLM)或丢弃图像 token 压缩上下文。
    • Penaloza 等人(2026)、Eyuboglu 等人(2026)、Kontonis 等人(2026)——通过保留摘要的 KV 缓存或紧凑隐空间缓存避免从文本重新计算带来的精度损失。

    基线方法与基准

    • 基线方法:原始 VMI(Schlarmann & Hein, 2026)。
    • 基准与数据集:LMARKS(著名但较少为人知的地标图像集)、COCO 图像集;评估提示词集合包含 DIVERSE-TEST 与 HOLIDAY。

    与既有工作的定位区别 作者指出,以往攻击均依赖载荷在生效时存在于提示词、记忆检索文本或模型权重中,而本文展示的攻击完全不依赖上述三者,载荷是在输入被掩蔽后仅通过后续 token 的缓存状态持久留存。

  3. 论文如何解决这个问题?

    提出P-VMI框架,通过两阶段损失函数与多程反向传播使扰动写入后续token的保留KV缓存。

    作者通过直接针对移除后状态优化输入,提出了持久性攻击框架与图像攻击方法 P-VMI。

    移除设定形式化

    论文将移除机制建模为二元组 (T, R),其中 T 为模型失去对对抗输入访问权的时间点,R 为后续保留的早期位置集合:

    • mask@trigger:模型在锚点轮及所有良性轮均能注意到对抗输入,仅在最终触发词处将其掩蔽。
    • mask@anchor:模型仅在回答首轮锚点问题时看到对抗输入,随后的所有良性轮次和触发词均将对抗输入从注意力中掩蔽。
    • mask@postsummaryC:上下文在 k 轮良性对话后执行摘要压缩,对抗输入在摘要生成前保持可见,压缩后仅保留系统提示词和摘要的 KV 缓存。
    • mask@anchorC:对抗输入仅在首轮锚点可见,随后的良性轮、摘要生成及后续轮次均对其掩蔽。

    优化目标与损失函数

    优化目标包含输入可见时的良性锚点项和掩蔽后的触发词目标项:

    ℒbase(x̃) = −log P(ya ∣ x̃, ta) + 𝔼c ∼ 𝒟 [−log P(y⋆ ∣ mask(x̃), c, t⋆; KV<T(x̃, c))]

    其中第一项监督首轮良性回答 ya,第二项在对抗输入被掩蔽后评估目标输出 y⋆。因为触发词无法直接注意到输入,目标项的梯度必须完全通过输入在可见期写入保留缓存的状态进行反向传播。

    为了平衡攻击成功率与良性轮对话质量,作者进一步引入隐蔽性正则化损失:

    ℒtrain = ℒbase + λkl KL(pclean ∥ padv)

    其中 KL 散度项约束对抗对话在每个良性回复的前 30 个 token 上的分布逼近 clean 模型,权重设为 λkl = 0.3。在摘要压缩设定下,还增加权重为 0.1 的摘要事实性开语句交叉熵项。

    多程优化算法与实现细节

    优化过程使用多程前向传播:

    • 第一程处理至输入移除点,保留全量缓存并计算锚点损失。
    • 后续各程在受限的保留位置集合上继续前向传播,最终程在触发词处计算交叉熵。
    • 使用 ℓ∞ Auto-PGD(APGD)更新扰动,步长初始化为 0.1 ϵ,遭遇停滞时步长减半并回滚到历史最优。
    • 图像像素扰动预算 ϵ = 8/255,软提示坐标扰动预算 ϵ = 0.005。
    • 引入上下文循环(Context Cycling),每 5 步随机抽取对话轮数(K 在 0 至 6 之间轮换)与截断长度(64 至 1024 字符),并在触发词同义改写池中重采样,以提升对未见对话的泛化能力。
  4. 论文做了哪些实验?

    主实验中P-VMI在掩蔽后达成最高92%的SR∧,因果交换证实影响仅源于KV缓存。

    实验设置

    • 被测模型:Qwen3-8B(用于软提示实验)、Qwen3-VL-8B-Instruct(主实验)、Gemma-4-12B(复现泛化实验);评审模型采用 Qwen2.5-32B。
    • 数据集与规模:20 张 LMARKS 地标图像、20 张 COCO 图像;良性对话池包含 64 个训练问题,评测采用未参与训练的 DIVERSE-TEST(16 个问题)与 HOLIDAY 数据集。
    • 目标与基线:4 个目标场景(stock/GameStop、party/NFP、car/Apple iCar、phone/Moto G56);基线对比原始 VMI、clean 图像及全局掩蔽(masked_everywhere)。
    • 指标定义:联合关键词成功率(SR∧),要求触发轮包含全部目标关键词且无拒绝词,且所有良性轮均无目标词泄漏;良性质量评分采用 Qwen2.5-32B 评判,以最弱单轮得分(min)为主、均值(mean)为辅。
    • 生成与评估设置:贪婪解码,触发轮与单轮上限 2,048 token;主实验每张图像评估 3 个随机种子,长对话与压缩实验基于验证集或评测集选取最佳种子。

    主结果

    下表汇总 Qwen3-VL-8B-Instruct 在四种目标及两种掩蔽设定下的主结果(据 Figure 4):

    表格较宽,可左右滑动

    模型方法变体移除设定Stock SR∧Party SR∧Car SR∧Phone SR∧
    Qwen3-VL-8B-Instructbasemask@trigger0.820.920.570.45
    Qwen3-VL-8B-Instructbasemask@anchor0.670.850.620.50
    Qwen3-VL-8B-Instructregularizedmask@trigger0.800.920.570.40
    Qwen3-VL-8B-Instructregularizedmask@anchor0.800.770.320.18
    Qwen3-VL-8B-Instruct原始 VMImask@trigger0%0%0%0%
    • 原始 VMI 在掩蔽下失效:原始 VMI 在触发时掩蔽图像后 SR∧ 降为 0%,模型连贯拒答;而经过持久性优化的 P-VMI 在两种掩蔽设定下均能高频触发目标。
    • 数据集间表现差异:LMARKS(stock/party)上的 SR∧(约 80%–92%)明显高于 COCO(car/phone,约 18%–62%),作者指出图像类型与目标在此处存在混淆。
    • 正则化变体的影响:在 mask@trigger 下,regularized 变体在维持相当 SR∧ 的同时改善了良性回复质量(如 phone 良性分从 0.46 升至 0.92);但在 mask@anchor 下降低了 car 和 phone 的成功率。

    上下文长度与长轮次训练实验

    • 评测内容:测试攻击在不同对话长度下的衰减趋势,并将训练对话轮数从 K=6 扩展至 K=12 和 K=20,在长达 100 轮(最高 40,676 token)对话中进行评估。
    • 实验结果:随着良性 token 增多,base 攻击成功率逐渐衰减(Figure 5);但增加训练轮数能大幅延缓衰减,经 100 轮评估后,K=12 的攻击在 85% 的图像上依然成功,而 K=6 仅为 50%(Figure 6a)。
    • 作者解读:短轮次训练模型的衰减主要源于训练视野受限而非 KV 缓存通道的物理极限;K=20 未进一步提升可能受限于具体优化实现。

    Gemma-4-12B 架构泛化实验

    • 评测内容:在具备 40 层滑动窗口注意力(窗口大小 1,024 token)和 8 层全局注意力的 Gemma-4-12B 上测试 mask@trigger。
    • 实验结果:在 3 轮良性对话下 SR∧ 超过 90%,在 6 轮后达 73%(Figure 6b、Table 9);clean 图像与全掩蔽图像 SR∧ 均为 0%。
    • 作者解读:尽管大部分层无法直接跨窗口注意到图像,攻击影响依然能够通过局部窗口中介或 8 个全局注意力层持久传递到触发词。

    上下文摘要压缩实验

    • 评测内容:在模型生成摘要后仅保留系统提示词和摘要 KV 缓存的设定下,评估攻击存活率。
    • 实验结果:在 mask@postsummaryC 下,平均 SR∧ 为 89%(Figure 7a);在更严格的 mask@anchorC 下(摘要生成时图像已掩蔽),平均 SR∧ 达到 70%(Figure 7c)。
    • 作者解读:即便图像仅在首轮出现且后续对话被丢弃替换为摘要缓存,对抗影响依然能跨越摘要边界操纵后续推荐。

    KV 缓存因果交换与残差流探针

    • 因果交换消融:固定对话文本,仅使用 clean 图像构建缓存时触发词完全不响应(0%);使用对抗图像构建缓存但在 clean 文本上解码时成功率达 57%(mask@trigger)和 92%(mask@anchor)(Table 2),证实影响严格保存在 KV 缓存中。
    • 残差流线性方向:在触发轮助手头部最后一个 token 的残差流中提取差分方向,留一交叉验证显示在超过 2,800 token 的各长度下 AUC 均在 0.90–0.95 之间,合并 AUC 为 0.91(Figure 8)。

    其他消融与分析

    • mask@anchor 下 anchor-turn 缓存块单独置换使目标触发率达 0.76,而 benign-turn 缓存为 0.00(Table 2)。
    • mask@trigger 下 anchor-only 触发率为 0.07,benign-only 为 0.20(Table 2)。
    • 摘要压缩设定下要求攻击成功、回复连贯且摘要完全连贯的联合比例在 mask@postsummaryC 下为 64.4%,在 mask@anchorC 下为 56.8%(第4.6节)。
    • 软提示在 Qwen3-8B 上经 6 轮良性对话后,18 个提示中有 12 个保持 clean 质量,4 个产生评分为 0 的回复(第 A.6 节)。
    • Gemma-4-12B 在 6 轮良性对话后,party 成功比例为 23/40,stock 为 35/39(Table 9)。

    负面结果与例外

    • 在 mask@anchor 下,添加良性正则化导致 car 的 SR∧ 从 0.62 降至 0.32,phone 从 0.50 降至 0.18(Figure 4)。
    • 个别长对话案例中模型生成陷入退化,例如生成“the photograph of the photograph of the...”直至 2,048 token 上限(第 A.7 节)。
  5. 有什么可以进一步探索的点?

    作者指出依赖白盒权限、未测黑盒迁移及未完全解决良性质量权衡,重算缓存可作为缓解手段。

    作者指出的局限与后续方向

    • 白盒访问限制与黑盒迁移性:攻击需要白盒梯度访问,限制了直接针对闭源模型的滥用;作者明确指出未测试攻击是否能迁移到攻击者无法访问的模型(第 5 节、Ethics Statement)。
    • 良性对话质量的权衡未完全解决:在优化过程中使良性轮次同时保持清洁、丰富且紧扣目标是一项权衡,论文并未完全解决这一问题(第 A.5 节)。
    • 训练扩展边界的具体原因:训练轮数超出 K=12 后未能进一步提高持久性,作者认为这可能反映了攻击的具体实现限制,而非持久性本身的物理极限(第 4.4 节)。
    • 线性方向的因果验证留待未来:尽管提取的残差流方向具有高 AUC,但通过沿该方向进行表征引导或消融以进行因果测试是未来工作(第 4.7 节)。
    • 多种子选优偏差:报告的压缩与长对话成功率采用在评测对话上选取三个种子中的最佳者,代表能部署多个候选图像的攻击者视角,而非单次训练图像的表现(第 4.4 节、第 A.7 节)。
    • 未研究新会话文本重新编码:论文未研究在全新会话中将摘要文本重新编码(re-encode)的系统(第 4.6 节)。

    实验覆盖范围

    • 被测模型范围:实验覆盖 Qwen3-8B、Qwen3-VL-8B-Instruct 和 Gemma-4-12B 共 3 个开源权重模型,未测试商业闭源模型。
    • 图像与目标规模:图像实验覆盖 20 张 LMARKS 图像与 20 张 COCO 图像,配对 4 组预设推荐目标(股票、政党、汽车、手机)。
    • 上下文问题规模:良性训练问题池为 64 个,评估使用固定划分的 DIVERSE-TEST(16 个问题)与 HOLIDAY 数据集,作者在开发阶段查看过评估问题,未测量针对新问题的泛化能力。
    • 种子数量:图像实验运行 1 至 3 个随机种子,论文未报告更大规模种子采样的方差分布。
    • 防御机制覆盖:论文测试了注意力掩蔽、缓存逐出消融和摘要 KV 缓存压缩,未测试其他主动防御或在线监控方法。
  6. 总结一下论文的主要内容

    论文提出P-VMI,证实对抗输入被掩蔽后仍可经KV缓存持久控制模型,强调了保留状态的安全风险。
    • 一句话定位:本文研究了多模态模型中对抗输入在被从上下文中移除或掩蔽后,其攻击影响能否通过后续 token 的 KV 缓存持久存在。
    • 要解决的核心问题:现有智能体安全部署假定攻击严格依赖恶意输入在提示词中的实时呈现,上下文管理或安全过滤将其移除后即可消除风险;作者质疑了该假设在保留 KV 状态机制下的有效性。
    • 方法要点:提出了持久性攻击概念及 P-VMI 方法,通过结合首轮良性锚点监督与掩蔽后经由保留 KV 缓存反向传播的目标损失,使用 APGD 直接优化输入以将恶意指令隐蔽写入后续缓存。
    • 核心实验结果:
      • 在 Qwen3-VL-8B-Instruct 上,P-VMI 在注意力掩蔽下仍能达成最高约 90% 的目标成功率(Figure 4 中 party 达 0.92),而未优化的原始 VMI 成功率为 0%。
      • 在上下文压缩保留摘要 KV 缓存的设定下,即使图像仅在首轮出现且后续对话被丢弃,平均成功率仍达 70% 至 89%(Figure 7)。
      • 缓存交换因果消融显示固定文本时仅对抗缓存能触发攻击,且残差流单一线性方向能以 0.91 的合并 AUC 预测攻击成败(Figure 8)。
    • 作者的结论与启示:作者认为仅从提示词中移除不可信输入是不充分的,保留的 KV 状态构成了可被利用的攻击面;完全重新计算 KV 缓存虽能阻断该通道,但会牺牲保留缓存的效率收益,亟需针对保留状态安全性的新型防御机制。
阅读原文arxiv.org