Odysseus 用双重隐写越狱 GPT-4o、Gemini-2.0 与 Grok-3,攻击成功率最高 99%
Odysseus: Jailbreaking Commercial Multimodal LLM-integrated Systems via Dual Steganography
论文提出双重隐写越狱方法Odysseus,在JBB-Behaviors上对Grok-3达到99% ASR。
论文采用黑盒(black-box)威胁模型。
- 现有商业MLLM集成系统的安全过滤器基于恶意内容必须显式出现在输入或输出中的假设。攻击者利用跨模态交互隐藏对抗意图时,这一假设失效,导致现有防御存在盲区。
- Odysseus引入双重隐写范式:先将恶意文本编码为二进制矩阵并嵌入载体图像,再通过函数调用促使受害系统提取提示词、生成违规回复并将其重新隐写回图像,最后由攻击者在本地解码提取回复。
- 在GPT-4o、Gemini-2.0-pro、Gemini-2.0-flash和Grok-3上,Odysseus在双基准上的平均ASR达78%,其中Grok-3在JBB-Behaviors上达99%,且完全绕过OpenAI审查API。
- 方法评估仅覆盖4个商业闭源MLLM系统和2个基准;汉明码仅支持单比特纠错,在连续多次变换下字符级恢复准确率下降;且较多依赖基于函数调用的自动化提取与重隐写机制。
- 威胁模型
- 论文采用黑盒(black-box)威胁模型。攻击者通过包含文本与图像的多模态查询与在线 MLLM 集成系统交互,无权访问模型内部参数或梯度,仅能观察系统响应。攻击目标是构建对抗查询(文本与图像组件),绕过系统的输入与输出安全过滤器,诱导系统生成原本会被拦截的有害响应。
- 被测模型
- GPT-4o-2024-08-06Gemini-2.0-proGemini-2.0-flashGrok-3
- 基准
- SafeBenchJBB-BehaviorsCOCOStrongReject
- 指标
- ASRSSIMPSNRACC
研究者提出 Odysseus,一种针对商业多模态大模型集成系统的越狱范式,通过双重隐写把恶意查询和模型回复都藏进看似正常的图片中。攻击分四步:先把恶意提示编码为二进制矩阵,用隐写模型嵌入图片;图片送入目标系统后,系统经 function calling 调用攻击者指定的提取函数解出隐藏查询并生成回复,再把违规回复隐写回图片返回;攻击者本地解码得到内容。在 SafeBench 和 JBB-Behaviors 上对 GPT-4o、Gemini-2.0-pro、Gemini-2.0-flash 和 Grok-3 测试,平均攻击成功率 78%,最高达 99%,高于次优基线 HIMRD 的 57.25%。作者称该方法生成的图片与原图视觉上难以区分,SSIM 0.8361、PSNR 68.5971,并能绕过 OpenAI Moderation API 的输入过滤,检测率为 0%。
推荐理由论文披露商业多模态系统安全过滤依赖恶意内容显式可见的假设,并给出跨模态隐藏载荷的完整攻击链与实测成功率。
深度解读
这篇论文试图解决什么问题?
作者称商业MLLM系统的安全过滤器过度依赖恶意内容显式呈现的假设,容易被跨模态双重隐写攻击绕过。
商业多模态大语言模型(MLLM)集成系统的安全过滤器依赖恶意内容显式出现的假设,无法防御将攻击载荷隐蔽编码至非文本模态的双重隐写越狱攻击。
- 现实场景与危害:MLLM广泛应用于智能体与交互系统,若安全对齐被突破,可能被用于生成有害内容、泄露敏感信息或协助违规活动。
- 现有防御的根本假设:商业系统部署的文本与图像过滤器假定恶意内容必须显式存在于输入或输出中,作者认为这一假设在多模态交互中并不成立。
- 现有越狱方法的局限:现有MLLM越狱攻击多在明文或弱伪装下直接输入恶意内容,容易触发商业系统的输入与输出审查机制。
- 论文提出的方案:论文提出了双重隐写越狱范式Odysseus,在输入端与输出端均将恶意信息隐写嵌入正常图像,实现端到端的隐蔽交互。
- 威胁模型:
- 攻击者目标:构建包含文本与图像组件的对抗查询,绕过安全过滤器并诱导受害系统生成原本会被拦截的有害响应。
- 攻击者知识:采用黑盒(black-box)设定,攻击者无法访问受害模型的内部参数或梯度,仅能观察系统响应。
- 攻击者能力:攻击者能够通过API向系统发送多模态查询,并定义符合函数调用规范的本地工具。
- 受害系统:具备图像与文本跨模态处理能力、支持函数调用且配备输入输出安全过滤器的商业MLLM集成系统。
有哪些相关研究?
作者梳理了LLM与MLLM越狱攻击及防御、信息隐写术等研究,指出已有攻击显式暴露载荷因而易被商业系统拦截。
相关研究主要涵盖LLM越狱、MLLM多模态越狱、安全防御以及信息隐写技术,现有越狱工作多因显式暴露恶意载荷而受限于商业过滤器。
- LLM越狱攻击:
- 基于提示词与梯度的方法:ArtPrompt(2024)利用ASCII字符隐藏恶意内容,GCG(2023)与AutoDAN(2024)通过梯度优化对抗后缀。作者称这些方法将恶意内容局限在文本模态,易被文本过滤器识别。
- 密码与微调攻击:CipherChat(2023)利用Unicode编码等密码形式绕过模型;Fun-tuning(2025)通过微调直接改变模型内部权重。
- MLLM越狱攻击:
- 跨模态迁移与优化攻击:FigStep(2025)通过排版渲染将文本转入图像,HADES(2024)与Liu等(2024)利用关联图像激活跨模态对齐漏洞;VAE(2024)、UMK(2024)和BAP(2024)在非文本模态施加对抗扰动。作者称这些方法仍显式暴露恶意语义或产生可见扰动。
- 并发隐写攻击工作:作者在附录D中指出,并发工作StegoAttack(2025)在传统文本框架下利用自然语言隐藏意图,依赖模型语言理解与多步推理,在普通基座模型上攻击失败。
- MLLM安全防御:
- 内在与外在防御:内在防御通过RLHF优化安全目标或通过MCTS引导解码(Zhou等,2024);外在防御覆盖输入平滑(SmoothLLM,2023)、跨模态重写(ECSO,2024)与输出对比解码(CoCA,2024)。作者称商业系统均部署了专有输入输出过滤器。
- 信息隐写术:
- 经典与深度隐写方法:从空间域LSB替换(1998)和DCT频域隐写(2012),发展到基于GAN的HiDDeN(2018)与SteganoGAN(2019)。作者借鉴HiDDeN架构实现端到端高容量隐写与鲁棒提取。
- 基线方法与基准:对比了10个越狱基准方法,包括ArtPrompt、CipherChat、VAE、UMK、BAP、FigStep-Pro、MM-SafetyBench、HADES、HIMRD以及并发工作StegoAttack;评测基准为SafeBench和JBB-Behaviors。
作者强调,不同于以往显式输入或输出恶意内容的研究,Odysseus利用多模态通道与函数调用实现输入与输出的双重隐写,切断了显式语义暴露。
- LLM越狱攻击:
论文如何解决这个问题?
Odysseus构建了查询编码、神经隐写嵌入、基于函数调用的模型交互与响应提取的四阶段双重隐写攻击流水线。
Odysseus的核心设计在于双重隐写(dual steganography)范式,将恶意查询和系统生成的有害响应隐蔽嵌入到良性载体图像中,通过函数调用机制驱动受害系统完成提取与再嵌入。
恶意查询编码与冗余注入
- 恶意内容加密:将输入的恶意查询文本通过Base64等标准算法进行预编码,生成中间字符串,避免在明文中直接暴露恶意语义。
- 文本分块与二进制转换:将中间字符串切分为固定长度的子串,每个字符转换为8位ASCII二进制向量,映射为二进制矩阵。
- 汉明码冗余注入:利用汉明码生成矩阵引入校验位,校验位数量满足条件 2r ≥ l + r + 1,在偶校验下提供单比特纠错能力以抵御后续传输噪声。
神经隐写模型设计与多目标优化
- 网络架构组成:借鉴HiDDeN架构,隐写网络包含编码器、解码器、模拟真实失真的噪声层以及对抗判别器。
- 多目标联合训练:采用多任务损失函数优化模型参数:minθs ℒB(Bi, Bout) + λ1 ℒG(Ien) + λ2 ℒI(Ico, Ien)其中L_B为二进制矩阵重构损失,L_G为对抗判别器损失,L_I为图像感知失真损失,lambda_1与lambda_2为平衡权重。
- 多重嵌入机制:编码器将二进制矩阵分别嵌入到q张不同的良性载体图像中,生成由若干128*128子图像构成的编码图像。
模型交互与函数调用驱动
- 纠错提取函数调用:向受害MLLM提交编码图像与指令,诱导模型通过JSON格式的函数调用执行本地提取工具,利用解码器对q张图像解码并均值滤波,经阈值二值化与伴随式校验恢复查询。
- 模型安全绕过推理:受害MLLM在内部获取提取的编码查询并生成回复,整个推理过程与回复均保持编码状态,使内部对齐与推理监控失效。
- 回复隐写再嵌入:通过强制指定工具调用,促使模型调用本地隐藏函数,将生成的违规回复利用汉明码编码与隐写编码器嵌入到新载体图像中返回。
本地响应提取与纠错解码
- 本地图像解码:攻击者接收系统返回的图像,使用本地隐写解码器提取连续值矩阵,经q重估计均值和阈值二值化重构二进制矩阵。
- 伴随式纠错与还原:利用校验矩阵计算伴随式向量,若存在单比特错误则执行异或比特翻转纠错,最后经ASCII转换与Base64解码还原最终违规文本。
论文做了哪些实验?
论文在4个商业系统和2个基准上对比了10种基线,测得Odysseus平均ASR达78%,并评估了隐蔽性与防御鲁棒性。
实验设置
- 被测系统:评测了4个广泛部署的商业MLLM集成系统,包括GPT-4o-2024-08-06、Gemini-2.0-pro、Gemini-2.0-flash以及Grok-3,均通过官方API访问并将采样温度设为0。
- 评测数据集:采用包含50个有害问题的SafeBench-tiny(从SafeBench的10个类别中各选取5个)以及包含100个违规行为的JBB-Behaviors。
- 对比基线:选取10个基线,包括ArtPrompt、CipherChat、VAE、UMK、BAP、FigStep-Pro、MM-SafetyBench、HADES、HIMRD,以及并发工作StegoAttack。
- 评估指标:主要指标为攻击成功率(ASR);隐蔽性指标采用结构相似性指数(SSIM)和峰值信噪比(PSNR);隐写可靠性采用字符级提取准确率(ACC)。
- 评审协议:采用三阶段评测流程,首先通过拒答关键词黑名单初筛,接着使用HarmBench分类器提示词进行二分类判定,最后进行人工复核。
- 重复次数与硬件:每个样本重复尝试10次以确保一致性;所有实验在NVIDIA A100 80GB GPU上运行。
主结果
(据 Table 1,部分基准如 MM-SafetyBench、HADES、VAE、UMK、ArtPrompt 因表格列数限制未列入下表)
表格较宽,可左右滑动
系统与数据集 FigStep-pro HIMRD BAP CipherChat Ours GPT-4o (SafeBench) 16% 28% 40% 6% 54% GPT-4o (JBB-Behaviors) 35% 3% 22% 1% 50% Gemini-2.0-pro (SafeBench) 32% 68% 46% 40% 72% Gemini-2.0-pro (JBB-Behaviors) 3% 34% 7% 85% 90% Gemini-2.0-flash (SafeBench) 6% 98% 46% 4% 76% Gemini-2.0-flash (JBB-Behaviors) 36% 47% 12% 0% 85% Grok-3 (SafeBench) 42% 92% 58% 78% 98% Grok-3 (JBB-Behaviors) 81% 88% 36% 88% 99% - 整体攻击表现:作者称Odysseus在多数系统和数据集上均取得最高ASR,仅在Gemini-2.0-flash的SafeBench上低于HIMRD(Table 1)。
- 防御过滤失效分析:作者认为基线方法由于显式暴露文本或扰动,在经历系统更新后易被过滤器拦截,而白盒方法迁移至黑盒商业系统时效果受限(Section V-B)。
- 类别稳健性差异:作者指出基线在不同危害类别间表现不均(如HIMRD在物理伤害高但在恶意软件低),而Odysseus在JBB-Behaviors的10个类别上均保持较高ASR(Figure 4)。
视觉隐蔽性与输入防御评测
- 测了什么:在100张COCO样本上评估视觉失真(SSIM、PSNR),并使用OpenAI Moderation API(omni-moderation-latest)与3种隐写分析分类器(训练判别器、Xu-Net、Yedroudj-Net)测试检出率。
- 结果:Odysseus的SSIM为0.8361、PSNR为68.5971(Table 2);OpenAI审查API检出率为0%(Section V-D);三种隐写分类器的F1分别为0.179、0.668和0.450(Table 6)。
- 作者的解读:作者认为隐写模型引入的失真肉眼不可见且结构破坏小,能完全绕过现有输入审查,同时经典隐写分析模型因训练数据分布不匹配而难以有效检出。
图像变换与自适应防御鲁棒性
- 测了什么:测试了裁剪、缩放、颜色变换、高斯噪声、Dropout和中值滤波等图像变换,以及4种自适应毒性分类器(Perspective API、HarmBench、ToxiGen、HateBERT)和思维链监控。
- 结果:在最大变换强度下单变换提取准确率保持在92%至100%(Figure 6);4种自适应毒性检测器的检出率均为0%(Table 7);开启思维链后中间推理依然受编码保护而未被触发拦截。
- 作者的解读:作者认为汉明码纠错与多重嵌入有效抵御了输入输出图像扰动,且由于中间产物始终保持密文形式,依赖文本分类的自适应防御无法识别恶意语义。
独立评测标准与无函数调用场景验证
- 测了什么:在附录F1中使用StrongReject重新评估ASR,在附录D中对比并发工作StegoAttack,并在附录H中测试缺乏自定义函数调用的ChatGPT网页端。
- 结果:在StrongReject下Odysseus平均ASR为72%(Table 9);StegoAttack在4个商业系统上的ASR均为0%(Table 8);在ChatGPT网页端仍可通过模型内置编码机制实现攻击(Figure 9)。
- 作者的解读:作者认为优异表现并非评测标准宽松所致,同时表明攻击在不支持用户定义函数调用的受限交互环境中依然具有现实威胁。
其他消融与分析
- 单次尝试与重复尝试:GPT-4o单次尝试ASR在双基准上分别为12.8%和16.2%,重复10次后升至54%和50%(Table 3、Table 4)。
- 冗余图像数量 q:随着 q 从1增至5,Resize变换下的提取准确率从84.87%升至98.70%,实验权衡后选取 q=3(Table 5)。
- 编码算法类型:Base64在各模型上取得相对最高的ASR,但Caesar与Unicode同样保持较高成功率(Figure 5b)。
- 校验码影响:加入汉明码后,颜色变换与Resize的提取准确率分别从92%和95%提升至96%(Table 11)。
- 复合变换鲁棒性:连续应用3次随机图像变换后,比特级准确率为90.67%,字符级准确率为39.95%(Table 10)。
- 字符扰动下的语义恢复:在10%字符错误率下,Grok-3与Gemini-2.0-pro的词级恢复准确率分别为100%和99%(Table 12)。
有什么可以进一步探索的点?
作者指出高级纠错编码与轻量审计机制是未来方向,实验覆盖了4个商业系统与双基准评测。
作者指出的局限与后续方向
- 高级冗余机制与纠错编码:在连续多次图像变换下,字符级恢复准确率出现明显下滑,作者指出引入更高级的冗余机制或纠错编码是未来有前景的方向(附录F2)。
- 轻量且无视格式的函数调用审计:由于函数调用输出的异构性以及动静态分析带来的计算开销与延迟,作者指出开发轻量且格式无关的审计机制是未来防御的重要研究方向(附录G)。
- 扩散模型变换防御的开销与画质折损:作者在讨论扩散模型变换防御时指出,扩散模型会降低图像质量影响下游视觉任务,且高计算成本导致明显延迟(附录G)。
- 穷举解码防御的脆弱性与高延迟:作者指出穷举解码所有常见编码方案在计算上开销巨大,且攻击者通过随机化或更换编码方案即可使防御失效(附录G)。
- 跨模态一致性检测的误报困境:作者指出由于良性多模态输入本身存在天然的跨模态语义差异,跨模态一致性检查在实际部署中极难可靠实现且易引发误报(附录G)。
实验覆盖范围
- 被测系统范围:实验覆盖了GPT-4o-2024-08-06、Gemini-2.0-pro、Gemini-2.0-flash和Grok-3共4个闭源商业MLLM集成系统(Section V-A)。
- 评测基准范围:主实验覆盖了SafeBench-tiny(50条)和JBB-Behaviors(100条)共2个安全评测数据集(Section V-A)。
- 防御评测范围:防御鲁棒性评测包含OpenAI Moderation API输入过滤、3种隐写检测器、6种图像变换以及4种自适应毒性分类器(Section V-D)。
- 测试轮次与单次表现:主实验默认采用10次重复查询取并集作为成功判定,论文同时报告了单次尝试(1-shot)下的ASR(Section V-B、Table 4)。
- 未报告信息:论文在主实验中设置温度为0并重复10次,但未报告商业系统在不同随机采样温度下的表现差异。
总结一下论文的主要内容
作者称现有商业MLLM系统存在安全盲区,提出的双重隐写越狱方法Odysseus在四系统上平均ASR达78%。
Odysseus是一套针对商业MLLM集成系统的双重隐写越狱攻击范式。
- 要解决的问题:商业MLLM安全过滤器依赖恶意内容显式出现的假设,当攻击者将载荷隐写于非文本模态并通过函数调用交互时,该防线失效。
- 方法要点:通过Base64编码与汉明码将恶意文本转换为二进制矩阵并隐写嵌入图像;利用受害系统的函数调用机制在本地提取查询并执行密文推理;再通过函数调用将违规回复隐写回图像并由攻击者本地解码。
- 重要实验结果:
- 在GPT-4o、Gemini-2.0-pro、Gemini-2.0-flash和Grok-3上,Odysseus在双基准上的平均ASR达到78%,高于次优基线HIMRD的57.25%(Table 1)。
- 在Grok-3上针对JBB-Behaviors数据集取得了最高99%的ASR(Table 1)。
- 在视觉感知质量上,Odysseus在COCO数据集上达到0.8361的SSIM和68.5971的PSNR(Table 2)。
- 在防御绕过方面,完全绕过OpenAI Moderation API(检出率0%),且在4种自适应毒性分类器下检出率均为0%(Table 7)。
- 作者的结论与启示:作者认为该研究揭示了现有商业MLLM集成系统安全防御的关键盲区,强调未来的多模态安全防御必须考虑隐式与跨模态威胁,不能仅依赖显式输入输出过滤器。