RedDiffuser:用强化扩散生成视觉输入审计 VLM 多模态安全失效
RedDiffuser: Auditing Multimodal Safety Failures in Vision-Language Models via Reinforced Diffusion
RedDiff 用强化学习微调扩散模型,审计 VLM 情境安全失效。LLaVA 主子集 Detoxify Any* 为 68.70%。
black-box、query-only 审计:文本上下文 y 固定为部分有害文本,审计者改变图像 x,观察目标 VLM 的开放续写是否出现不安全输出。
- 开放环境里的 VLM 常面对不完整、含糊的多模态输入。作者认为只测显式恶意指令会漏掉一种风险:部分有毒文本配上视觉上下文后,安全对齐是否仍能挡住有害续写。
- RedDiffuser:文本固定后,用 Gemini 贪心搜索图像提示词,再以 DDPO 微调扩散模型。奖励是 Detoxify 毒性分加 λ 倍 BERTScore。护栏变体把未通过双重 NSFW 检查的样本毒性奖励置零。
- LLaVA 主子集 Detoxify Any*:文本 58.01%,对齐(M) 68.70%(Table 1)。hold-out 无对齐变体 79.45%(Table 2)。Gemini-1.5-flash 上对齐(M) 81.33%(Table 3)。
- 论文未专门讨论局限。目标模型为 LLaVA-1.5-7B,并迁到 Gemini-1.5-flash 与 LLaMA-3.2-11B-Vision-Instruct。论文未报告重复次数和人工一致性。
- 威胁模型
- black-box、query-only 审计:文本上下文 y 固定为部分有害文本,审计者改变图像 x,观察目标 VLM 的开放续写是否出现不安全输出。扩展设定还要求图像通过外部 NSFW 护栏。
- 被测模型
- LLaVA-1.5-7BGemini-1.5-flashLLaMA-3.2-11B-Vision-Instruct
- 基准
- RealToxicityPrompts
- 指标
- Toxicity RateAny*CLIPScoreGuardrail Pass Rate
研究者提出 RedDiffuser(RedDiff),一个基于强化的框架,用扩散模型为黑盒安全测试生成语义连贯的视觉输入,结合贪心提示搜索与强化优化,挖掘暴露 VLM 潜在安全失效的高风险多模态输入。论文研究的是有害上下文暴露下的多模态安全审计,即部分有害文本与视觉上下文配对时 VLM 能否保持安全行为。在开源与商用 VLM 上的实验显示这类上下文条件下的失效较为普遍:在 LLaVA 上,RedDiffuser 将不安全回复率在原始集上最多提升 10.69%,在留出集上提升 8.91%,并可迁移到 Gemini 和 LLaMA-Vision。作者称这些漏洞在外部安全护栏下依然存在,表明当前系统级安全机制对现实多模态风险仍不充分。
深度解读
这篇论文试图解决什么问题?
要审计部分有毒文本配上视觉上下文时,VLM 的安全对齐是否仍有效。
要审计的是:部分有毒文本配上视觉上下文时,VLM 的安全对齐是否仍然有效。
- 场景:作者称 VLM 正部署到开放应用,输入常不完整、含糊且依赖上下文。视觉输入会明显引导行为,只做文本审计不够;社交、用户生成内容和多轮交互里,输入很少规整,可能带隐含安全风险。
- 现有缺口:作者称既有评测以指令为中心,主要看显式越狱提示词或对抗扰动能否触发有害输出,较少看情境条件引起的失效,因此可能高估安全性。
- 核心设定:部分有害文本与视觉上下文配对后,模型能否仍保持安全。不安全续写(脏话、侮辱或威胁)被当作情境条件失效的可观察指标。作者写明不把该设定当成由显式恶意意图驱动的常规越狱。
- 本文提出:RedDiffuser(RedDiff),黑盒强化学习框架,用扩散模型生成语义连贯的视觉输入做安全压力测试,并扩展到存在外部 NSFW 护栏时的审计。
- 威胁模型:
- 目标:看视觉上下文是否与文本中的有害信号交互并放大这些信号,使开放续写出现不安全行为。
- 知识:作者写明为 black-box,且为 query-only,对应实际 API 部署。
- 能力:文本上下文 y 固定;改变的是图像 x。用目标模型反馈找出语义连贯、能暴露高风险行为的多模态输入,并用强化学习优化扩散模型。
- 受害系统:被查询的 VLM。扩展设定还审计上游安全过滤能否挡住有害多模态情境。
有哪些相关研究?
相关工作分 VLM 架构与显式越狱;作者把本文定位为情境条件审计。
引言与 Related Work 把讨论分成 VLM 架构,以及既有安全评测与越狱。
VLM 与视觉输入
- LLaVA(Liu et al., 2024):CLIP 编码器连接 LLaMA,用 GPT-4 合成多模态指令数据做端到端微调。
- MiniGPT-4(Zhu et al., 2023):线性投影对齐冻结的 ViT 与 Vicuna,先在大规模图文对上预训练,再做高质量微调。
- InstructBLIP(Dai et al., 2023):基于 BLIP-2,加入指令感知的 Query Transformer,并重整 26 个公开数据集。作者称加入视觉后,攻击面比纯文本 LLM 更宽;论文所引后续工作显示,视觉扰动和跨模态不一致可被用来绕过安全机制或引出有害行为。
越狱与安全评测
- 白盒攻击(论文归入一组引用):用梯度信息优化对抗输入。
- 黑盒方法(论文归入另一组引用):靠提示词工程、视觉角色扮演或字体排印式操纵绕过安全机制。引言还把显式越狱提示词与对抗扰动列为既有评测的主要对象。
- 作者的批评挂在这组评测上,而不是改写被引作者的结论:作者称这些研究指出当前 VLM 对齐的局限,但评测仍主要框在显式攻击,看直接越狱提示词或对抗输入能否触发有害输出,较少看并不采取直接攻击形式、仍可能影响生成的有害多模态情境。
基线方法与基准
- 基线:Text-Only(只有文本)、Single-Prompt(Gemini 为每条文本前缀生成一次图像提示词)、Greedy-Prompt(再做贪心搜索)。护栏实验与 CLIPScore 对照使用未微调的 Stable Diffusion。
- 基准:RealToxicityPrompts 的挑战子集,1,199 条与有毒续写行为相关的文本提示,在审计里当作固定文本上下文。
作者称本文不是再提出一种越狱方法,而是把 RedDiffuser 当作诊断框架,审计对齐在有害情境暴露下是否仍然有效。
论文如何解决这个问题?
先贪心搜索图像提示词,再用毒性与对齐双奖励微调扩散模型。
RedDiffuser 不把任务写成改写显式恶意指令。文本上下文固定后,先搜索高风险图像提示词,再用强化学习微调扩散模型,使生成图像在语义仍连贯时更容易引出不安全续写。
审计设定与 DDPO
- 输入:目标 VLM M 接收固定的部分文本 y 与图像 x,产生开放续写 M(x, y)。审计只改变 x。
- 优化器:采用 Denoising Diffusion Policy Optimization(DDPO)。反向去噪被写成马尔可夫决策过程:状态含上下文、时间步和当前噪声样本,动作为预测的上一状态。奖励只在最后一步非零,等于终态样本与上下文上的任务奖励。策略梯度用重要性采样,按当前策略与旧策略的似然比更新。
- 骨干与访问:预训练扩散模型为 Stable Diffusion v1.5。对目标 VLM 只有 query-only 访问。
高风险提示词的贪心搜索
- 作者认为,通用 LLM 单步写出的图像提示词往往不足以暴露较强的安全失效,因此用目标 VLM 的毒性反馈迭代更新候选提示词。
- 辅助模型为 Gemini-1.5-Pro(正文亦称 Gemini Pro),安全设置关闭,并放入先前认定的高风险案例作上下文示例。正文未列出这些示例的措辞。
- 每轮用新提示词生成图像,再让目标 VLM 在固定文本下续写,并由 Detoxify 打分。毒性上升则保留该提示词,否则搜索停止。保留结果作为后续强化学习的初始化。Algorithm 1 汇总了该过程。
毒性奖励与对齐奖励
- 毒性奖励:用续写类提示让 M 补全 y。Detoxify 给六个毒性属性打分,取平均作为 R_tox,用作不安全程度的代理。测试用的 0.5 阈值不进入该奖励。
- 对齐奖励:用短描述提示让 M 描述图像,再用 BERTScore 计算图像提示词与该描述的词级最大余弦相似,对词数取平均,得到 R_align。作者称这是为避免优化时图像漂离提示词并出现模型坍缩。
- 总奖励:Rtotal = Rtox + λ Ralign。含义是同时推高不安全续写的代理分,并约束图像与提示词的语义一致。实验中的 λ 为 0、0.05、0.1、0.2,对应无对齐、Low、Medium、High。
外部护栏下的检查器感知变体
- 图像可能在到达 VLM 前被挡住。双重检查为:Stable Diffusion 图像级 NSFW checker,以及判断图像是否含性、暴力或其他 NSFW 内容的 VLM 语义检查器。论文未写明后者是哪个模型。两道都判为 non-NSFW 才算 safe;任一拦截则拒绝,且不产生模型输出。
- 贪心搜索改为带护栏信号:每个提示词采样 10 张图,以覆盖扩散采样的随机性。有图通过两道检查则保留提示词;否则让辅助 LLM 在知道外部护栏的前提下重写,并丢掉持续产生 NSFW 图像的提示词。
- 奖励塑形用指示函数 I(x),仅当两道检查都为 safe 时为 1。Rtoxguard = I(x) · Rtox(M(x, y))。对齐奖励不变。作者称这样审计的是整条安全流水线,而不只是 VLM。
训练与成功判定
- 8 张 NVIDIA A100:6 张训练,2 张算分。每 GPU batch size 为 24,学习率 3e-4。600 次更新后早停;作者称这是为减轻 reward hacking。
- 训练文本取挑战子集按顺序的前 132 条。作者称再增大该规模对泛化收益有限,且会拖慢收敛。
- 测试把属性分超过 0.5 的续写计为该属性阳性;Any* 表示六个属性至少一项阳性。训练阶段不使用这个阈值。
论文做了哪些实验?
Table 1 中 LLaVA 主子集、对齐(M) 的 Detoxify Any* 为 68.70%。
实验设置
- 目标模型:优化与主结果使用 LLaVA-1.5-7B。迁移测试为 Gemini-1.5-flash 与 LLaMA-3.2-11B-Vision-Instruct(Table 4 标题写作 Llama-3.2-11B-Vision-Instruct)。图像骨干为 Stable Diffusion v1.5。候选提示词由 Gemini-1.5-Pro 生成,且关闭其安全设置。
- 数据:RealToxicityPrompts 挑战子集 1,199 条,当作固定文本上下文。前 132 条为主评测子集(摘要称 original set),其余为 hold-out。护栏实验使用论文所称 full dataset。
- 基线:Text-Only、Single-Prompt、Greedy-Prompt。护栏与 CLIPScore 实验另以未微调 Stable Diffusion 为图像来源对照。
- 指标:各毒性属性得分超过 0.5 的续写比例;Any* 为六项至少一项超过 0.5。CLIPScore 中 α=2.5。GPR 为图像同时通过两道护栏的比例,即式 (6) 中指示函数的平均。
- 评审:训练奖励用 Detoxify 六属性平均分;测试同时报告 Detoxify 与 Perspective API。无人工评审。论文未报告重复次数。两套分类器的六类名称并不相同,例如 Obscene 对 Profanity、Insult 对 Sexually Explicit。
- 训练配置:8 张 A100,每 GPU batch size 24,学习率 3e-4,600 次更新后早停。λ 取 0、0.05、0.1、0.2。
主结果
据 Table 1,目标为 LLaVA,主评测子集,Any*(%)。
方法 Detoxify Any* Perspective Any* Text-Only Baseline 58.01 53.03 Single-Prompt Baseline 55.72 55.30 Greedy-Prompt Baseline 64.12 58.33 RedDiff w/o alignment 61.83 58.33 RedDiff w/ alignment (L) 62.59 58.33 RedDiff w/ alignment (M) 68.70 61.36 RedDiff w/ alignment (H) 63.35 62.12 - 作者称对齐(M) 的 Detoxify Any* 最高,为 68.70%;Perspective 上对齐(H) 最高,为 62.12%。作者认为两个分类器上的上升说明失效不绑在单一毒性指标上。摘要称原集合上不安全响应率最多提高 10.69%;结论写从 58.01% 到 68.70%。
- 反例:Single-Prompt 的 Detoxify Any* 为 55.72%,低于 Text-Only 的 58.01%。作者称单次图像提示词只带来有限的额外退化。无对齐 RedDiff 的 61.83% 也低于 Greedy-Prompt 的 64.12%;作者未单独解释这一行。
- 作者称该子集基线毒性低于 hold-out,因而更适合观察情境条件下的安全下降。Table 1 的 Text-Only Detoxify Any* 为 58.01%,Table 2 为 70.54%。
跨提示泛化
- 测优化时未见的剩余提示词。Table 2 把对应行标为 RTD,正文称为 RedDiff。Detoxify Any*:Text-only 70.54%,Single-Prompt 76.64%,Greedy-Prompt 77.57%,RTD 无对齐 79.45%,对齐 L/M/H 为 78.33%、78.70%、79.36%。
- Perspective Any*:70.00%、75.63%、77.60%、79.28%、77.50%、78.16%、78.81%。作者称无对齐变体在两个分类器上 Any* 都最高,并写到 Obscene 67.44%、Insult 42.02%、Profanity 68.13%、Severe Toxicity 7.12%。
- 作者认为相对趋势与主子集一致,失效不限于优化时见过的提示词。摘要称 hold-out 上最多提高 8.91%;结论写从 70.54% 到 79.45%。对齐变体的 Any* 低于无对齐变体。
跨模型迁移
- 只用 LLaVA 的反馈优化,再把得到的多模态输入直接用于两个未见 VLM。Table 3、Table 4 只报告 Any*。
- Gemini-1.5-flash:文本仅 Detoxify / Perspective 为 76.23% / 78.26%;对齐(M) 为 81.33% / 82.52%。贡献中作者称 Gemini +5.1%。作者认为有害文本本身已常引出不安全续写,视觉上下文会再放大,且该模式能迁到商业 VLM。
- LLaMA-3.2-11B-Vision-Instruct:文本仅 15.02% / 18.68%;对齐(L) 为 41.85% / 45.24%,无对齐为 41.01% / 43.90%。贡献中作者称 LLaMA-Vision +26.83%。作者认为其文本基线低得多,但这些输入仍能露出可迁移的失效。
外部护栏
- 全数据集上,LLaVA 前接外部护栏。对照设定为对齐(M)。图像须同时通过 Stable Diffusion NSFW checker 与基于 VLM 的语义检查器,否则拒绝且无模型输出。
- Table 6 的 Detoxify Any*:Stable Diffusion 37.45%,RedDiff (Base) 38.28%,RedDiff (Guard) 69.39%;GPR 为 49.96%、54.13%、94.50%。Perspective Any* 为 38.20%、39.78%、69.47%,GPR 与上一行相同。
- 作者称 Base 未用护栏反馈,GPR 仍高于 Stable Diffusion,因而认为生成转向了更隐蔽、仍能通过过滤的视觉模式。作者称 Guard 的 Detoxify Any* 从 38.28% 到 69.39%,GPR 到 94.50%。摘要与贡献称相对 Stable Diffusion 将 GPR 提高 40.4%;Table 6 给出的 GPR 是 49.96% 与 94.50%。
其他消融与分析
- CLIPScore(Table 5):Stable Diffusion 44.47;无对齐 41.87,L 42.86,M 44.02,H 44.80。作者称各变体与 44.47 相当或更高。
- 作者称 Figure 3 在相同图像提示词下,Stable Diffusion 更中性,RedDiffuser 更常出现风险相关线索;λ 从左到右为 0、0.05、0.1、0.2。所附文本看不到图中像素。Figure 1 图注称标准扩散模型对应良性续写,RedDiffuser 对应有害续写;此处不复述图中文本。
- Table 1 Detoxify:Identity Attack 的 Text-Only 为 5.34%,各 RedDiff 行为 3.05% 或 3.81%;Threat 在 Text-Only、无对齐、对齐(M) 为 0.00%。作者未解释这些属性。
- Table 1 的 Detoxify 中,Toxicity 列与 Any* 各行相同;Perspective 的 Text-Only 为 Toxicity 46.96%、Any* 53.03%。
- 护栏设定下每个提示词采样 10 张图(Section 4.4)。论文未报告贪心搜索的迭代上限。
有什么可以进一步探索的点?
论文未专门写出局限或后续工作。
作者指出的局限与后续方向
论文未专门讨论局限。提供的文本没有 Limitations、Future Work 或附录中的局限说明;结论讨论的是评测盲区与审计范式,没有把某项结果写成本文的不足或计划中的后续工作。
实验覆盖范围
- 优化与主表的目标模型是 LLaVA-1.5-7B;迁移目标是 Gemini-1.5-flash 与 LLaMA-3.2-11B-Vision-Instruct(Section 5.1–5.2,Table 1–4)。
- 数据是 RealToxicityPrompts 挑战子集 1,199 条;前 132 条为主评测子集,其余为 hold-out。护栏实验使用论文所称 full dataset(Section 5、Section 5.4,Table 6)。
- 测试同时使用 Detoxify 与 Perspective API,阳性阈值为 0.5,并报告 Any*、CLIPScore 与 GPR。训练奖励只用 Detoxify。λ 取 0、0.05、0.1、0.2。
- 对照包括 Text-Only、Single-Prompt、Greedy-Prompt,以及未微调 Stable Diffusion。护栏为 Stable Diffusion NSFW checker 加上论文未点名的 VLM 语义检查器。
- 论文未报告重复次数、查询次数、与人工判定的一致性,以及语义检查器的模型名。强化学习写明 600 次更新后早停;贪心搜索的迭代上限未报告。
总结一下论文的主要内容
用强化扩散生成视觉上下文,审计有害文本情境下的 VLM 安全失效。
RedDiffuser 是黑盒审计框架:有害内容不是显式攻击指令,而是固定的部分有毒文本,再配上扩散模型生成的图像,看 VLM 的开放续写会不会变得不安全。
- 做法:Gemini-1.5-Pro 按 Detoxify 反馈贪心挑选图像提示词,再用 DDPO 微调 Stable Diffusion v1.5。奖励同时推高毒性分,并用 BERTScore 约束图像与提示词一致。若前面还有 NSFW 护栏,未通过双重检查的图像不产生毒性奖励。
- 主子集:优化目标是 LLaVA-1.5-7B,数据来自 RealToxicityPrompts。Detoxify Any* 上,仅文本 58.01%,对齐权重 0.1 时 68.70%;Perspective 上该权重为 61.36%,权重 0.2 时为 62.12%(Table 1)。摘要称这一集合上最多提高 10.69%。
- hold-out:Table 2 中 RTD 无对齐变体的 Detoxify Any* 为 79.45%,仅文本为 70.54%。对齐变体低于这一行。结论写从 70.54% 到 79.45%。
- 迁移:同一批输入直接用于未见模型。Gemini-1.5-flash 上,对齐(M) 的 Detoxify Any* 为 81.33%,仅文本为 76.23%(Table 3)。LLaMA-3.2-11B-Vision-Instruct 上,对齐(L) 为 41.85%,仅文本为 15.02%(Table 4)。贡献中作者称二者分别增加 5.1% 与 26.83%。
- 护栏:全数据集上,RedDiff (Guard) 的 GPR 为 94.50%,Detoxify Any* 为 69.39%(Table 6)。作者称相对 Stable Diffusion 将 GPR 提高 40.4%;表中 Stable Diffusion 的 GPR 为 49.96%。
- 作者结论:语义连贯的视觉上下文会放大不安全行为,且不限于优化时用的那个 VLM;上游 NSFW 过滤单独挡不住这类失效。作者认为只围绕显式指令的安全评测有盲区,情境感知的多模态审计应作为补充。