跳到正文
原文
论文追踪· arXiv:2602.15927· Christian Schlarmann, Matthias Hein·本站收录 · 原文发表

研究者提出面向多轮对话的视觉记忆注入攻击 VMI

Visual Memory Injection Attacks for Multi-Turn Conversations

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

VMI用小扰动图像在多轮LVLM中潜伏,作者称超过10,000 token后触发仍可输出预定消息。

威胁模型攻击者将ℓ∞半径8/255的扰动写入图像,发布到社交平台或图库。

问题
图像一旦进入多轮LVLM对话就会留在上下文中,后续轮次仍会处理它。既有视觉定向攻击多限单轮:无关提示也可能吐出目标,或要求用户上传后立刻使用特定提示。作者要在长对话里保持名义行为,只在选定话题被问到时输出预定消息。
方法
VMI用APGD在ℓ∞半径8/255内联合优化首轮良性锚点与触发目标,并按τ=5在2到8轮上下文间切换。中间回复固定为名义输出,默认2000次迭代。测试自回归重写历史至多27轮,以关键词要求命中且不泄露。
实验与结果
作者称三个开源LVLM和四类目标都有成功实例,留出的上下文与释义提示仍有效,对话可超过10,000 token。作者称Qwen3-VL总体比Qwen2.5-VL更抗攻击;股票扰动迁到两个微调模型后与源模型相近。逐点SR∧正文未给。
局限与可以继续做的
作者在Limitations写明:需要基座的white-box访问,仅API可用的模型是开放问题,且对话只含一张输入图。实验覆盖三个开源LVLM与两个微调变体。正文未给出逐点SR∧,也未报告随机重复次数。
实验设置Qwen2.5-VL-7B-Instruct、Qwen3-VL-8B-Instruct 等 · COCO、LMARKS 等 · SR∧、SR_target 等
威胁模型
攻击者将ℓ∞半径8/255的扰动写入图像,发布到社交平台或图库。良性用户下载后作为LVLM首轮输入并多轮对话。构造攻击为white-box;对微调模型的迁移按gray-box评估。图像留在上下文中,仅当用户问到对手选定的触发话题时输出预定消息,其余轮次保持名义行为。攻击者不控制训练或用户如何提问。
被测模型
Qwen2.5-VL-7B-InstructQwen3-VL-8B-InstructLLaVA-OneVision-1.5-8B-InstructQwen-SEA-LION-v4-8B-VLQoQ-Med3-VL-8B
基准
COCOLMARKSDiverse⋆DiverseHoliday
指标
SR∧SR_targetSR_context
AI 导读研究者提出一种名为 Visual Memory Injection(VMI)的隐蔽攻击,针对生成式大型视觉语言模型(LVLM)在多轮长上下文场景下的安全弱点。攻击场景设定为攻击者将篡改后的图片上传至网络或社交媒体,普通用户下载该图片并作为输入交给 LVLM。在正常提示下模型表现如常,一旦用户给出触发提示,模型就会输出预先设定的目标信息,用于对抗性营销或政治说服等操纵目的。与以往聚焦单轮攻击的工作相比,VMI 在与用户进行长时间多轮对话后仍然有效。研究者在多个近期开源权重 LVLM 上验证了该攻击,并公开了源代码,指出用扰动图片对用户进行大规模操纵在多轮对话场景下是可行的,呼吁提升 LVLM 对此类攻击的鲁棒性。

研究者提出一种名为 Visual Memory Injection(VMI)的隐蔽攻击,针对生成式大型视觉语言模型(LVLM)在多轮长上下文场景下的安全弱点。攻击场景设定为攻击者将篡改后的图片上传至网络或社交媒体,普通用户下载该图片并作为输入交给 LVLM。在正常提示下模型表现如常,一旦用户给出触发提示,模型就会输出预先设定的目标信息,用于对抗性营销或政治说服等操纵目的。与以往聚焦单轮攻击的工作相比,VMI 在与用户进行长时间多轮对话后仍然有效。研究者在多个近期开源权重 LVLM 上验证了该攻击,并公开了源代码,指出用扰动图片对用户进行大规模操纵在多轮对话场景下是可行的,呼吁提升 LVLM 对此类攻击的鲁棒性。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    作者要让多轮LVLM只在触发话题输出预定消息,其余轮次保持名义行为。

    多轮对话里,第三方要用小扰动图像让LVLM在长上下文之后只对触发话题输出预定消息,无关轮次不泄露。

    • 场景:作者称长上下文多轮设定下的LVLM安全很大程度上尚未充分研究。图像通常留在整段上下文中;作为在线聊天机器人,每天有数百万用户交互。作者认为可被用于对抗营销、选举中的政治说服和欺诈性金融建议,且一张图可影响许多用户。
    • 现有不足:作者称先前视觉定向攻击限于单轮。无关提示也会输出目标而引起怀疑,或要求用户上传后立刻说出特定提示。作者认为后者不现实,因为攻击者控制不了良性用户如何交互。
    • 观察与做法:作者指出图像会持续被处理,形成可影响后续回复的visual memory。本文提出Visual Memory Injection(VMI):良性锚点维持非触发时的正常输出,上下文循环使攻击跨对话长度保持。
    • 威胁模型:
      • 目标:触发话题上输出对手规定的消息,其余提示保持名义行为,使用户较难发现。
      • 知识:构造攻击为white-box;对基于公开检查点的微调模型,按gray-box评估迁移。
      • 能力:加入ℓ∞半径8/255的扰动并发布到社交平台或图库。不控制训练过程或训练数据,也不控制用户后续提问。设定为单张图像,与首个提示一起输入。
      • 受害方:下载该图并与LVLM多轮交谈的良性用户。
  2. 有哪些相关研究?

    作者把VMI放在多轮第三方定向攻击,以区别于单轮视觉攻击、越狱和训练期投毒。
    • 经典对抗样本:Szegedy et al. (2014)与Goodfellow et al. (2015)研究模型对对抗攻击的脆弱性。后续改进攻击算法的工作包括Carlini and Wagner (2017)与Croce and Hein (2020)。
    • LVLM视觉攻击:Qi et al. (2024)、Carlini et al. (2023)、Shayegani et al. (2024)用视觉输入做越狱。单轮定向攻击包括Schlarmann and Hein (2023)、Zhao et al. (2023)、Bagdasaryan et al. (2023)、Bailey et al. (2024)、Miao et al. (2025)。Luo et al. (2024)研究单轮设定下定向攻击跨提示的可迁移性。Lu et al. (2024)提出由恶意用户植入的测试时视觉后门,并在单轮中评估;论文对比称本文关注恶意第三方在多轮对话中伤害良性用户。
    • 提示注入与多轮越狱:Greshake et al. (2023)、Zhan et al. (2024)、Patlan et al. (2025)研究LLM智能体提示注入,对手经输入通道、记忆模块和外部数据改写外部记忆库。论文对比称本文只用视觉输入,不假设外部记忆库。多轮越狱方面,Russinovich et al. (2025)、Yang et al. (2025b)针对LLM,Jindal and Deshpande (2025)、Das et al. (2026)、Huang et al. (2025)被论文列入LVLM多轮越狱研究。论文称这些工作里恶意方是用户本人,目的是绕过防护得到不被允许的输出;本文的对手是伤害诚实用户的第三方,做的是定向攻击。
    • 训练期投毒:Biggio et al. (2012)、Gu et al. (2019)、Schwarzschild et al. (2021)、Carlini and Terzis (2022),以及LVLM上的Lyu et al. (2024)、Xu et al. (2024)、Liu and Zhang (2025),在训练阶段植入后门。论文称该设定与本文不同,因为不假设对手能控制训练过程或训练数据。
    • 基线与数据:算法对照为single target(对Schlarmann and Hein, 2023的直接改编)、加上良性锚点、再加上固定上下文,以及完整VMI(Section 5.3)。图像为COCO(Lin et al., 2014)与作者收集的LMARKS;上下文提示集为Diverse⋆、Diverse、Holiday。

    作者把本文放在多轮、第三方、视觉输入的定向攻击上:不依赖用户自越狱,不控制训练,也不使用智能体外部记忆库。

  3. 论文如何解决这个问题?

    VMI用良性锚点与上下文循环,在扰动球内联合优化名义首轮和触发目标。

    VMI在小的ℓ∞球内优化图像,使首轮锚点提示产生良性回复,并在不同长度的上下文之后,仅当触发提示出现时提高目标回复的概率。

    问题设定

    • 图像x与首个提示一起输入,之后各轮只有文本。第i轮上下文是此前全部提示与输出的拼接。作者引用Yang et al. (2024; 2025a)与An et al. (2025),说明图像会留在整个对话中。
    • 朴素目标是在某一上下文下最大化触发回复的对数概率。作者称只做这一项时,模型可能在非触发提示上也输出目标,从而被发现。
    • 最终同时约束首轮锚点与触发目标。k从2循环到n:

    maxlog p(y|t,x̃)+log p(yi|c(k)⊕ ti,x̃)

    式中y、t为锚点回复与锚点提示,y^{i}、t^{i}对应论文的目标回复与触发提示。另要求无穷范数不超过ε,且像素落在图像空间I。

    良性锚点与四类目标

    • 锚点:COCO图像要求短描述,目标为该模型未扰动时的回复。LMARKS要求识别地点,目标为图中地标的正确名称与城市。占位符按图像填充。
    • 触发:用户询问对手选定话题时输出注入内容。Table 1的四类为手机、汽车、政党、股票;手机与汽车用COCO,政党与股票用LMARKS。汽车目标含一个不存在的物体。Table 1给出提示与目标原文。
    • 优化时,中间轮回复固定为名义模型输出,而不是对抗图像上新生成的文本。

    上下文循环与优化

    • 循环:从只含锚点与其回复的短上下文开始,每τ步追加一对提示–回复,到最长上下文后再回到短上下文。作者称这是为了让攻击在更长、结构不同的历史上仍然成立。
    • Algorithm 1先建好各长度上下文,迭代中按周期切换索引,再对当前上下文做一步APGD。作者称APGD有自动步长,并优于标准PGD。
    • Table 2:2000次迭代,初始步长0.1·ε,bfloat16,ℓ∞且ε=8/255,最长上下文8轮,τ=5。测试可用到27轮。每个像素在任一方向最多改变8/255。

    测试时协议与成功判定

    • 推理时用对抗图像对每个提示重新自回归生成,再把新回复当作后续历史。作者称这比优化时的固定上下文更接近真实使用。生成设置为温度0.6、top-p 0.95、图像224×224、每轮最多512个新token。
    • s_target要求目标轮含该场景正向关键词且不含负向词;s_context要求此前各轮不含目标相关关键词。两者同时成立才算成功,再对多张攻击图像平均,得到SR∧。作者称这样排除“全程都在输出目标”的情况。关键词表在附录A.1。
    • 附录A.2从指标已判成功的对话中抽28个上下文轮和28个目标轮,4名参与者对“是否表现出目标行为”的一致率为100%。无关键词的上下文轮有95.2%被描述为有帮助。
  4. 论文做了哪些实验?

    在三个开源LVLM和四类目标上评估VMI;作者称均有成功实例,逐点SR∧正文未标出。

    实验设置

    • 模型:Qwen2.5-VL-7B-Instruct、Qwen3-VL-8B-Instruct、LLaVA-OneVision-1.5-8B-Instruct。Table 3写明视觉编码器分别为Custom、SigLIP2-SO-400M、RICE-ViT-L,规模8.3B、8.8B、8.5B。迁移评测为Qwen-SEA-LION-v4-8B-VL与QoQ-Med3-VL-8B,扰动只在Qwen3-VL上优化。
    • 数据:COCO随机图20张,LMARKS地标图20张。手机、汽车用前者,政党、股票用后者。上下文各25条:Diverse⋆由Gemini-fast生成,Diverse由ChatGPT-5.2生成,Holiday由Gemini-2.5-flash生成。优化只用Diverse⋆前6条及其名义输出;Diverse与Holiday不参与优化。
    • 协议:APGD,ε=8/255,默认2000次迭代,优化最长8轮,τ=5。测试自回归重生成历史,最多27轮。每目标另有3句锚点与触发释义(Table 4);释义实验不用原句,报告均值与标准差。温度0.6、top-p 0.95。论文未写随机重复次数。
    • 对照:Qwen3-VL、股票目标、2000次迭代上比较single target、w/o cycle & context、w/o cycle与VMI(Section 5.3)。
    • 指标:SR∧要求触发命中且上下文不泄露;另看SR_target与SR_context。判定是关键词匹配,不是LLM裁判。
    • 人工:附录A.2,4人,成功对话中各28轮;目标行为一致率100%,上下文被评为有帮助的比例95.2%。

    主结果

    表格较宽,可左右滑动

    模型Diverse⋆DiverseHoliday
    Qwen2.5-VL-7B-Instruct未报告未报告未报告
    Qwen3-VL-8B-Instruct未报告未报告未报告
    LLaVA-OneVision-1.5-8B-Instruct未报告未报告未报告

    Fig. 2画出四类目标、三套上下文的SR∧对token数曲线,纵轴刻度为0%–100%,横轴约到10^4。正文没有各点百分比,故上表不填数字。两个微调模型不在该图。

    • 作者称三个模型、四个目标都有成功实例,并称攻击者可事先核验、只传播成功图像。对含不存在物体的汽车目标,作者称攻击仍成立,且模型常编造支持推荐的理由。
    • 作者称Diverse⋆只部分用于优化,完全留出的Diverse与Holiday仍然有效;Holiday主题连贯,无关触发出现时仍成功。作者称图像与触发之间可超过10,000 token。引言另称可在超过25个无关轮次之后生效;实验测试上限是27轮。
    • 作者称Qwen3-VL总体比Qwen2.5-VL更抗VMI;LLaVA-OneVision-1.5在Holiday上最不抗,在Diverse⋆与Diverse的多数场景最易受攻击。Fig. 2转写只有图例和坐标刻度,没有曲线端点,这一排序无法从转写文本核对。

    释义与跨模型迁移

    • 释义:Fig. 3在锚点与触发都被释义时给出SR∧均值及三句标准差。作者称相对优化用原句略有下降,但仍有效。正文未给各点百分比。
    • 迁移:Fig. 5只优化Qwen3-VL上的股票目标,再原样评测SEA-LION与Med3。作者称迁移后成功率仍高,且与源模型相近,因此只需公开基座即可影响其微调版本的用户。正文未给百分比。作者将此称为针对专有微调的gray-box情形。

    算法变体与定性示例

    • 变体:Fig. 4在Qwen3-VL、股票目标、2000次迭代上比较四种目标。作者称single target在第一轮之后失败;只加锚点时,很短的对话有改善;加入固定八轮上下文后,不同长度都有改善;带循环的VMI在多步之后高于这些变体。正文未标百分比。
    • 分项:Fig. 6在留出的Holiday上拆开两项。作者称single target的SR_target较小但不是零,SR_context最差,即目标泄露进上下文;加锚点后SR_context提高,但不跨长度泛化;VMI的SR_target最高,SR_context与固定上下文变体相当。作者称SR_context几乎不随长度变化,泄露若发生,早在对话前段就出现。
    • 示例:附录B给出各模型、各目标在Diverse与Holiday上的轨迹。作者称触发前回复与上下文相符,触发后才出现目标,并常附带编造理由(如Fig. 14、18、19、20)。Fig. 19图注称手机型号晚于Qwen-2.5-7B发布,示例中的技术细节大多可核对为幻觉。Fig. 17的Diverse示例没有给出预定车型,而是指向另一件Apple产品并说明那不是车;同图Holiday示例则给出预定推荐。这是单条示例,不是汇总比例。

    其他消融与分析

    • 迭代次数(Fig. 22,仅Qwen3-VL、股票目标):作者称500次已能成功;增至2000次后,几乎全部上下文长度都有改善;8000次没有稳定增益,在留出的Holiday上更差,作者认为是过拟合。默认因此用2000次。
  5. 有什么可以进一步探索的点?

    作者指出需要基座white-box,对话只含一张图;仅API模型仍是开放问题。

    作者指出的局限与后续方向

    • 攻击需要基座模型的white-box访问;针对只能经API使用的模型设计攻击,作者称为开放问题(Limitations)。
    • 对话被限制为只含一张输入图像(Limitations)。
    • 作者在Conclusion提出,LVLM安全评估不应只看模型直接拒绝什么,还应看扩展的名义交互之后,能否被悄悄导向特定输出。

    实验覆盖范围

    • 被测并画曲线的模型为Qwen2.5-VL-7B-Instruct、Qwen3-VL-8B-Instruct、LLaVA-OneVision-1.5-8B-Instruct;Fig. 5另把Qwen3-VL上的扰动迁到Qwen-SEA-LION-v4-8B-VL与QoQ-Med3-VL-8B。论文未报告仅API可用模型上的数字(Section 5.1–5.2,Limitations)。
    • 图像为COCO与LMARKS各20张;目标为手机、汽车、政党、股票;上下文为Diverse⋆、Diverse、Holiday各25条。优化上下文为Diverse⋆前6条,测试最多27轮(Section 5.1)。
    • 算法变体及500、2000、8000次迭代的比较都在Qwen3-VL的股票目标上(Fig. 4、Fig. 6、Fig. 22)。释义实验每目标三句,报告均值与标准差(Fig. 3、Table 4)。
    • 成功与否由关键词规则判定。人工核对抽样自指标已判成功的对话,4人、28个上下文轮与28个目标轮。论文写出95.2%,但未说明分母是轮次还是评分人次,也未报告失败样本上的一致性(附录A.2)。
    • 论文未报告随机重复次数。Fig. 2–6与Fig. 22的逐点SR∧未在正文以数字给出。
  6. 总结一下论文的主要内容

    VMI让扰动图像在多轮LVLM中潜伏,作者称触发话题出现后仍可输出预定消息。

    VMI是面向多轮LVLM的定向图像攻击:第三方发布带小扰动的图像,良性用户把它当作普通输入。

    • 问题:单轮视觉攻击要么在无关提示上也吐出目标,要么假定用户上传后立刻使用特定提示。作者要利用图像留在上下文中这一事实,让名义轮次正常,只在选定话题输出预定消息。
    • 做法:在ℓ∞半径8/255内,用APGD同时优化首轮良性锚点与触发目标,并按τ=5在2到8轮上下文间切换。中间回复在优化时固定为名义输出。测试时自回归重写历史,最长27轮。成功需关键词命中且上下文不泄露。
    • 主实验:三个开源LVLM、四类目标、三套上下文上,作者称每个模型与场景都有成功实例;留出的Diverse、Holiday以及三句释义仍然有效。作者称图像与触发之间可超过10,000 token。作者称Qwen3-VL总体比Qwen2.5-VL更抗此攻击,LLaVA-OneVision-1.5在Holiday上最不抗、在另外两套提示的多数场景最易受攻击。逐点百分比正文未标出。
    • 迁移与变体:股票目标的扰动只在Qwen3-VL上优化,作者称迁到两个微调模型后成功率与源模型相近。作者称去掉锚点或循环后,长对话或隐蔽性变差;8000次迭代在Holiday上不如2000次,作者认为是过拟合。关键词判定在成功样本上与4人判断的一致率为100%。
    • 作者结论:作者认为经看似无害的图像做大规模用户操纵是可行的,并呼吁评估长名义交互之后模型能否被导向特定输出,而不只评估直接拒答。作者同时写明:需要基座white-box,且只考虑一张输入图。
阅读原文arxiv.org