研究者提出针对商用多模态大模型的隐蔽视觉提示注入方法
Covert Visual Prompt Injection against Commercial Multimodal Large Language Models
CoTTA用隐蔽文字触发和双目标对齐攻击闭源MLLM,GPT-4o描述hard ASR为74%(Table 2)。
black-box:不能访问参数、梯度或内部状态。
- 闭源MLLM会跟随嵌在输入里的指令,但显眼提示易被看见,只对齐自然图像语义又难指定精确句子。作者要在人眼难察的图像改动下诱导指定恶意语句。
- CoTTA在图像中心叠尺度和旋转可学习的有界文字触发,再加ℓ∞预算内的扰动。攻击图的全局特征被拉向目标文本和动态目标图,token级特征只对齐目标图。目标图则靠近文本、远离当前攻击图。
- black-box下评测四个闭源模型、图像描述100张与VQA100对。作者称GPT-4o上CoTTA的描述soft/hard ASR为81%/74%,VQA hard为82%;Claude-4.5的VQA hard为2%(Table 3)。
- 论文无局限专节;结论希望后续做更隐蔽、更可控的对抗操控。实验覆盖四个闭源模型的black-box迁移、图像描述与VQA及若干攻击基线。未报告评审模型名称和重复次数,也未评测文中提到的输入过滤或检测。
- 威胁模型
- black-box:不能访问参数、梯度或内部状态。只改输入图像,隐蔽触发与对抗扰动合计受ℓ∞约束,ε=16。形式目标是任意提示下,输出在语义上包含、蕴含或执行指定命令c⋆。用替代编码器优化后迁移到闭源MLLM。
- 被测模型
- GPT-4oGPT-5Claude-4.5Gemini-2.5
- 基准
- NIPS 2017 Adversarial Attacks and Defenses Competition datasetScienceQA
- 指标
- ASRAvgSim
研究者提出一种针对闭源多模态大语言模型的隐蔽视觉提示注入方法,将对抗指令嵌入图像视觉模态。该方法通过有界文字叠加提供语义引导,同时迭代优化难以察觉的视觉扰动,在粗粒度和细粒度两个层面把被攻击图像的特征表示对齐到恶意视觉与文本目标;视觉目标以文字渲染图像实例化,并在优化中逐步细化以更准确表达目标语义并提升迁移性。在两项多模态理解任务、多个闭源多模态大模型上的实验显示,该方法优于现有方法。
深度解读
这篇论文试图解决什么问题?
要在难察的图像改动下让闭源MLLM输出指定句子,作者提出CoTTA。
要在人眼难察的图像改动下,让闭源 MLLM 输出攻击者指定的句子。
- 场景:作者称 MLLM 已用于智能体和机器人,指令跟随使嵌在输入里的提示可以劫持行为,模型安全因此更受关注。
- 现有不足:作者称已有提示注入多依赖看得见的文本或视觉提示;显眼视觉提示更易被用户发现,也更可能被输入过滤或安全机制处理。对齐自然图像语义的对抗攻击则难以精确指定可执行指令。
- 假设:作者认为只对齐恶意文本会受跨模态表示差距限制,闭源模型内部表示又不可访问。图像到图像对齐更易迁移,但不能编码任意指定句子。
- 提出:作者将这一设定称为 adversarial prompt injection,并提出 Covert Triggered dual-Target Attack(CoTTA):有界文字叠加作隐蔽触发,扰动同时对齐文本目标与动态视觉目标。
- 威胁模型:
- 目标:求 x′=x+δ,使任意提示 p 的输出在语义上包含、蕴含或在操作上执行 c⋆(Definition 3.1 的 target-string expressivity)。
- 知识:实验采用 black-box,不能访问参数、梯度或内部状态;梯度来自替代编码器,再迁移。
- 能力:只改输入图像。触发与扰动合计满足 invisibility,ℓ∞ 范数 ε=16。
- 受害系统:商用闭源 MLLM,被测为 GPT-4o、GPT-5、Claude-4.5、Gemini-2.5,任务为图像描述与 VQA。
有哪些相关研究?
作者把相关工作分成对抗攻击和提示注入,并称二者分别难精确控句或视觉显眼。
作者按对抗攻击与提示注入分组,并用隐蔽性和控句精度的折中定位本文。
视觉对抗攻击
- AttackVLM(Zhao et al., 2023):扰动 CLIP、BLIP 等编码器的视觉特征,做可迁移攻击。作者称把图像特征对齐到目标图像,比对齐到目标文本更易迁移,并影响了后续工作。
- M-Attack(Li et al., 2025)与 FOA-Attack(Jia et al., 2025):用多提取器集成和特征空间对齐。论文称二者在图像描述上、包括对闭源系统(如 ChatGPT-4o),目标攻击成功率超过 90%。作者指出,以自然图像特征为目标时,难以强制精确恶意句子或可执行命令。该 90% 是论文对既有图像语义攻击的转述,不是本文实验数字。
- Agent-Attack(Wu et al., 2024):把图像特征对齐到目标文本,以攻击闭源模型。作者称性能有限,并认为可能来自跨模态表示不匹配。Bailey et al.(2023)报告,在 ℓ∞ 预算下其方法未能学到有效的特定字符串劫持。
提示注入
- 上下文注入:Liu et al.(2023b; 2024b)、Yi et al.(2025)、Shi et al.(2024)、Lu et al.(2025)把对抗命令写入输入,使模型覆盖或忽略合法用户提示。
- 图像内文字:Pathade(2025)、Cheng et al.(2025)、Kimura et al.(2024)、Wang et al.(2025)把文字指令直接放进图像。作者称 Cheng et al.(2025)用排版策略放置提示,注入内容仍然视觉上显眼。
- 过滤与检测:作者称显眼视觉提示更可能被模型侧输入过滤或安全机制缓解,并引用 Lin et al.(2025)、Jacob et al.(2024)和 Li et al.(2024c)。
基线与基准
- 基线:实验比较 AttackVLM、AnyAttack(Zhang et al., 2025)、M-Attack、FOA-Attack、Agent-Attack。AnyAttack 用训练过的噪声生成器产生目标对抗样本。作者称若干基线原本面向图像描述,比较时把带显式文字的 G0img 设为它们的对抗目标。
- 基准:图像描述用 NIPS 2017 Adversarial Attacks and Defenses Competition 数据集抽样的 100 张图;VQA 用 ScienceQA(Lu et al., 2022)随机 100 个图–问题对。
作者称现有路线要么难被看见但控句不精确,要么能细粒度控句但提示显眼;本文要在不可感知改动下仍诱导指定句子。
论文如何解决这个问题?
CoTTA用居中可学习文字触发加扰动,并把攻击图对齐到文本与动态目标图。
CoTTA 先在原图中心放一层有界、几何可学习的文字触发,再在同一 ℓ∞ 预算内优化扰动,使攻击图同时靠近恶意文本和一张动态目标图。
问题设定
fθ 把图像–提示对自回归解码成词序列。对抗提示注入要求 x′=x+δ 落在预算内,且对提示集合中的每个 p 都诱导 c⋆。作者把该要求写成
\forall p \in P,\ f_\theta(x',p) \models c^\star。这里 |= 表示输出在语义上包含、蕴含或在操作上执行 c⋆;δ 还须满足 ℓ∞ 不超过 ε。作者认为式 (3) 的图像到图像对齐控句不精确,式 (4) 的图像到文本对齐又常因模态差距不够,尤其在无法访问闭源模型内部表示时。隐蔽文字触发
触发提供轻量语义线索。作者观察到中心位置最有效,因此锚在图像中心,只学习尺度 s 和旋转 θ。目标句被渲染成紧裁剪文字图,经仿射变换得到二值掩码;有效缩放限制在 0.05 到 0.95。掩码像素加上取值为 −ε 或 ε 的扰动,并裁剪到合法像素范围。s、θ 与对抗噪声共用目标 Msrc,由 Adam 每轮更新。作者观察到,若提示不明确要求注意图中文字,单独触发对输出影响有限,因此还要叠加扰动来放大语义。
动态目标图
目标图为闭源迁移提供互补监督。G0img 由身份几何(s=1、θ=0)下的初始文字掩码初始化,再用 I-FGSM 在 ε 球内更新。更新把目标图特征拉向文本嵌入,并推离当前攻击图,系数 λpull=1、λpush=0.5。作者给出的理由是:既要与目标文本语义一致,又要避免塌到当前攻击图、从而失去有信息量的监督。
粗细双目标对齐
每轮从释义集合 P⋆ 随机抽一条等价文本;论文未给出集合大小。全局项同时计算攻击图与当前目标图、攻击图与该文本的余弦相似度。token 级项只对攻击图与目标图的 patch 特征取平均余弦。二者相加为 Msrc=Mglobal+Mlocal。源图扰动用步长 αsrc 的符号梯度上升最大化该式,再投影回 ℓ∞ 球。论文设定 300 个 epoch,源图与目标图的 ε 均为 16,αsrc 与 αtgt 均为 1。梯度来自 CLIP-B/16、CLIP-B/32 与 LAION 的集成。
成功判定
图像描述分两条准则。soft 以目标文字图的描述为参照;hard 要求输出与目标句的语义相似度超过 0.3。VQA 只用 hard。相似度来自 LLM-as-a-judge;soft 时先用同一受害模型为两张图写描述。论文未写 soft 的成功阈值,也未写评审模型名称。命令分两类:VQA 为预设错误信息,图像描述为诱导行动的指令。论文给出了示例句,此处不复述。
论文做了哪些实验?
四个闭源模型的黑盒迁移中,CoTTA在GPT-4o上ASR高于对比方法,Claude-4.5上都很低。
实验设置
- 目标模型:GPT-4o、GPT-5、Claude-4.5、Gemini-2.5。第 4.1 节为 black-box,不访问参数、梯度或内部状态。
- 替代器与基线:梯度来自 CLIP-B/16、CLIP-B/32、LAION。CoTTA 与 M-Attack、FOA-Attack、AnyAttack、Agent-Attack 的主行是 Ensemble;AttackVLM 另报 B/16、B/32、Laion。作者称把原面向描述任务的方法改到同一目标,以带显式文字的 G0img 为对抗目标。
- 数据:描述任务从 NIPS 2017 Adversarial Attacks and Defenses Competition 数据集抽 100 张,要求生成描述。VQA 从 ScienceQA 随机抽 100 个图–问题对。另有 1000 张图比较(Table 4)。
- 指标:ASR 与 AvgSim。soft 以目标文字图的描述为参照,论文未写成功阈值。hard 由 LLM 比较目标文本与攻击后输出,相似度超过 0.3 算成功。VQA 只评 hard。soft 时用同一受害模型为两张图写描述,再由 LLM 打分。论文未写评审模型名称,也未写重复次数。
- 超参与命令:300 epoch;源图与目标图 ε=16;αsrc、αtgt、λpull、λpush 为 1、1、1、0.5。VQA 命令是预设错误信息,描述任务是诱导行动的指令。论文给出示例句,此处不复述。
主结果
下表是 Ensemble 迁移到闭源模型的 ASR,目标不是替代器本身。描述 soft 据 Table 1,描述 hard 据 Table 2,VQA hard 据 Table 3。
表格较宽,可左右滑动
模型 方法 描述soft ASR 描述hard ASR VQA hard ASR GPT-4o CoTTA 81% 74% 82% GPT-4o FOA-Attack 47% 42% 53% GPT-5 CoTTA 56% 53% 58% GPT-5 FOA-Attack 27% 22% 12% Gemini-2.5 CoTTA 79% 81% 79% Gemini-2.5 FOA-Attack 71% 69% 42% Claude-4.5 CoTTA 8% 7% 2% Claude-4.5 FOA-Attack 6% 3% 0% - AvgSim:CoTTA 描述 soft 为 GPT-4o 0.442、GPT-5 0.320、Gemini-2.5 0.429、Claude-4.5 0.046(Table 1);描述 hard 为 0.339、0.249、0.348、0.029(Table 2);VQA hard 为 0.820、0.576、0.787、0.020(Table 3)。作者称在 GPT 系列上相对 FOA-Attack 平均高 31.5% ASR 和 0.18 AvgSim。该数是作者跨 soft/hard 与两个 GPT 模型的概括。Table 1–2 中,GPT-5 描述任务的 M-Attack ASR 为 soft 32%、hard 29%,高于 FOA-Attack,仍低于 CoTTA。
- Gemini-2.5 与 VQA:Table 1 中 FOA-Attack 与 M-Attack 的描述 soft ASR 都是 71%。作者称 CoTTA 的 AvgSim 比二者高 0.138 和 0.148(0.429 对 0.291、0.281)。VQA 上作者称 GPT-5 超过 FOA-Attack 46% ASR 和 0.457 AvgSim;Table 3 的 AvgSim 为 0.576 对 0.119。
- 低结果:作者称 Claude-4.5 最稳健,各攻击效果有限,但 CoTTA 的 ASR 与 AvgSim 仍最高。Table 2 中 M-Attack 的描述 hard ASR 为 6%,高于 FOA-Attack 的 3%。AttackVLM 与 AnyAttack 在描述 hard 上多为 0%(Table 2)。Table 3 里 AttackVLM 在 Gemini-2.5、B/32 上为 3.00%,不是全表为零。
千张图上的 hard 比较
正文称扩大到 1,000 samples,表题写 1000 images,准则为 hard,对照 FOA-Attack(Table 4)。论文未写数据集和任务,表中没有 Claude-4.5。
表格较宽,可左右滑动
模型 CoTTA ASR CoTTA AvgSim FOA ASR FOA AvgSim GPT-4o 64.7% 0.315 41.3% 0.161 GPT-5 54.4% 0.246 22.8% 0.089 Gemini-2.5 73.2% 0.308 58.4% 0.211 作者称三个模型平均超过 FOA-Attack 23.27% ASR 和 0.136 AvgSim。Table 2 的 100 张描述 hard 中,GPT-4o 的 CoTTA ASR 为 74%。两处数字对应的任务是否相同,论文未说明。
组件消融
Table 5 的对象在正文写作 GPT4o。论文未写明任务。完整 CoTTA 为 soft 81%/0.442、hard 74%/0.339,数值与 Table 1、Table 2 的 GPT-4o Ensemble 行相同。
- 去掉图像到图像对齐:soft 27%/0.155,hard 22%/0.081。作者称 ASR 下降 54% 与 52%,降幅最大。
- 去掉隐蔽触发:soft 66%/0.306,hard 54%/0.202。作者称 soft ASR 下降 15%。
- 去掉图像到文本对齐:soft 75%/0.42,hard 70%/0.348。
- 去掉目标图更新:soft 73%/0.434,hard 68%/0.351。
- 作者称四组件合用时结果最好。hard AvgSim 上,去掉图像到文本对齐为 0.348,去掉目标图更新为 0.351,都高于完整 CoTTA 的 0.339。论文未解释这一差别。
其他消融与分析
- 权重:Figure 4 在 GPT-4o 图像描述上比较 λpull=1、λpush=0.5,λpull=1、λpush=1,以及 λpull=0.5、λpush=1。作者称第一组结果最好。正文未给出各组 ASR 或 AvgSim。
- 可视化:Figure 3 展示各攻击的对抗图与扰动。作者称 CoTTA 的扰动呈现自适应隐蔽触发,改动仍然细微、自然。论文未报告定量不可感知分数。
- 单提取器:Table 2 中 AttackVLM 的 B/16、B/32、Laion 在四个模型上描述 hard ASR 均为 0%。Table 3 的 Gemini-2.5 上,B/16 为 1.00%/0.090,B/32 为 3.00%/0.022。
有什么可以进一步探索的点?
论文未专节写局限;结论希望后续研究更隐蔽、更可控的对抗操控。
作者指出的局限与后续方向
- 论文未专门讨论局限:没有 Limitations 专节,Discussion、Future Work 或附录也没有把某项结果写成方法局限。
- 后续方向:Conclusion 写,希望 CoTTA 激发后续对更隐蔽攻击,以及更精确、可控的对抗操控的研究。
实验覆盖范围
- 被测模型:GPT-4o、GPT-5、Gemini-2.5、Claude-4.5,共 4 个;第 4.1 节设为 black-box。
- 任务规模:图像描述 100 张,来自 NIPS 2017 Adversarial Attacks and Defenses Competition 数据集;VQA 为 ScienceQA 随机 100 对。Table 4 另有 1000 张图、hard criterion、三个模型,未写数据集与任务名,也不含 Claude-4.5。
- 优化与对照:替代提取器为 CLIP-B/16、CLIP-B/32、LAION;正文报告的 CoTTA 主结果为 Ensemble。优化 300 epochs,ε=16。对照为 AttackVLM、AnyAttack、M-Attack、FOA-Attack、Agent-Attack。
- 消融范围:组件消融在第 4.3 节的 GPT4o 上(Table 5),论文未写明任务。权重比较在 GPT-4o 图像描述上(Figure 4),正文列出三组 λpull、λpush,未给出各组数字。
- 未报告项:判定用 LLM-as-a-judge,hard 阈值为 0.3。论文未报告评审模型名称、与人工的一致性、重复次数、对目标模型的查询次数;也未报告对第 2.2 节所述输入过滤或检测的测试,以及人类对不可感知性的评分。
总结一下论文的主要内容
CoTTA以隐蔽触发和双目标对齐诱导指定句子;GPT系ASR较高,Claude-4.5很低。
CoTTA 是面向闭源 MLLM 的对抗提示注入:在 ℓ∞、ε=16 的预算内,用图像改动诱导指定句子。
- 问题:作者称显眼的文本或视觉提示能控句,但容易被看见,也更可能被过滤;只对齐自然图像语义的对抗攻击又难指定可执行指令。
- 做法:图像中心放尺度和旋转可学习的有界文字触发,扰动再把攻击图的全局特征拉向恶意文本和动态目标图,token 特征只对齐目标图。目标图迭代靠近文本、远离当前攻击图。梯度在 CLIP-B/16、CLIP-B/32、LAION 的集成上计算,再 black-box 迁移。
- 主结果:描述任务 100 张、VQA 100 对。GPT-4o 上 CoTTA 的描述 soft/hard ASR 为 81% 与 74%,VQA hard 为 82%(Table 1–3)。Gemini-2.5 的描述 hard ASR 为 81%。作者称相对 FOA-Attack,GPT 系列平均高出 31.5% ASR 和 0.18 AvgSim。
- 例外:Claude-4.5 上各方法 ASR 都很低,CoTTA 的 VQA hard 为 2%(Table 3)。1000 张图的 hard 比较中,GPT-4o 的 CoTTA ASR 为 64.7%(Table 4);论文未写明该表的数据集和任务。
- 作者结论:作者称这些结果暴露了现代 MLLM 的脆弱性,并希望后续研究更隐蔽的攻击,以及更精确、可控的对抗操控。