MetaBreak:通过特殊 token 操纵越狱在线 LLM 服务
MetaBreak: Jailbreaking Online LLM Services via Special Token Manipulation
作者提出 MetaBreak 注入特殊 token,在 4 个开源模型上取得 62.0% 平均 ASR 并绕过审核。
黑盒或仅通过 Web API/Chatbot 交互,攻击者利用公开模板与嵌入或 API 角色抽象注入特殊 token,绕过内部安全对齐与外部审核。
- 在线大语言模型服务通过平台聊天模板包裹与外部内容审核机制防护,导致现有的特殊 token 注入与提示词工程越狱方法在真实商业服务中失效或成功率受限。
- 提出由四个原语构成的 MetaBreak:响应注入伪造助手前缀;轮次掩码通过少样本单字间隔构造使模型吸收平台模板包裹;输入分割利用容量差规避审核模型;语义模拟基于 L2 范数距离用普通 token 替代被过滤的特殊 token。
- 在 4 个本地开源模型上取得 62.0% 的平均 ASR;在部署护栏防御时取得 40.7%–59.7% 的平均 ASR(对比 PAP 的 16.2%–53.1%);在 7 个在线服务上取得 59.8% 的平均 ASR。
- 论文指出的局限包括依赖聊天模板结构知识(未公开的闭源/小众模型不可用)以及寻找替代 token 需访问词嵌入向量;实验覆盖 4 个开源模型、5 个在线对话机器人及 2 个商业 Web API,未测试自适应防御。
- 被测模型
- Llama-3.3-70B-InstructQwen-2.5-72B-InstructGemma-2-27B-InstructPhi4-14BLlama-3.1-405BGPT-4.1Claude-Opus-4LlamaGuard-3-8BPromptGuard-86MShieldGemma-2-27B
- 基准
- SorryBench
- 指标
- ASRFlagging Rate
研究者提出 MetaBreak,利用 LLM 聊天模板中的特殊 token 构造四个攻击原语,越狱在线 LLM 服务。在 Ollama 本地部署的 Llama-3.3-70B、Qwen-2.5-72B、Gemma-2-27B 和 Phi4-14B 上,MetaBreak 平均攻击成功率 62.0%,与 PAP(56.8%)和 GPTFuzzer(61.6%)相当;在启用内容审核时,MetaBreak 比 PAP 和 GPTFuzzer 分别高出 11.6% 和 34.8%。四个原语包括响应注入、轮次掩蔽、输入分段和语义模仿,其中输入分段通过把敏感词拆开绕过 LlamaGuard 等审核模型,语义模仿则用嵌入空间中 L2 距离最近的普通 token 替换被清洗的特殊 token。代码和数据集已开源。
推荐理由论文给出特殊 token 注入的四个攻击原语,并说明在部署内容审核后仍比 PAP、GPTFuzzer 高出 11.6% 和 34.8%,可据此评估在线服务的防护缺口。
深度解读
这篇论文试图解决什么问题?
针对在线 LLM 服务的模板包裹与审核机制,利用特殊 token 注入实现端到端越狱。
在线 LLM 服务中如何通过特殊 token 注入实现越狱并同时规避平台防御机制。
- 场景与重要性:在线大语言模型服务通常部署在云端并提供 Chatbot 或 Web API 交互,为防止滥用,平台同时部署了模型内部的安全对齐与外部的内容审核模型;直接利用特殊 token 操纵模型行为是潜在的攻击面。
- 现有方法的不足:作者称,现有的特殊 token 攻击方法(如 Virtual Context 与 ChatBug)未考虑平台自动添加的聊天模板包裹标签,导致伪造对话结构被破坏;同时这些方法未考虑外部审核拦截;基于提示词工程的方法(如 PAP 与 GPTFuzzer)则容易改变原始问题语义导致答非所问。
- 核心观察与假设:特殊 token 具有上下文无关与结构控制语义;受害主模型与轻量级内容审核模型之间存在理解能力差距;在嵌入空间中,基于向量差的 L2 范数可找到与特殊 token 功能相近的普通 token。
- 论文提出的方案:作者提出了包含四个攻击原语的工具套件 MetaBreak,通过协同运用响应注入、轮次掩码、输入分割与语义模拟,针对在线 LLM 服务实施越狱。
- 威胁模型:
- 攻击者目标:构造特殊输入,绕过模型内部安全对齐与外部内容审核器,诱导在线 LLM 生成有害内容。
- 攻击者知识:针对开源权重模型需获知其公开的聊天模板结构与 token 嵌入向量;针对闭源专有模型无需知道特殊 token,仅通过 Web API 提供的消息角色抽象进行操纵。
- 攻击者能力:攻击者仅通过 Chatbot 界面或 Web API 接口发送文本请求,不假设平台存在传统 Web 漏洞或软件缺陷。
- 受害系统:由云端托管的开放权重或专有商用 LLM 及其挂载的内容安全护栏组成的在线服务系统。
有哪些相关研究?
系统化解决现有特殊 token 攻击无法抵抗模板包裹、内容审核与 token 清洗的问题。
论文在引言、相关工作与实验中梳理并对比了以下研究:
基于提示词工程的越狱攻击
- 黑盒语义与变异越狱:包括 ASCII 艺术掩码 ArtPrompt、基于模糊测试的变异提示 GPTFuzzer 以及说服性改写 PAP。作者称此类方法常因插入大量无关文本或过度改写而模糊原题意图,导致模型理解偏差。
- 白盒对抗后缀优化:包括基于梯度的后缀优化 GCG 以及遗传算法提示优化 AutoDAN。作者称白盒方法在不同模型架构间的迁移性面临挑战。
基于系统级漏洞与特殊 token 的攻击
- 解码与系统机制漏洞:EnDec 利用强制解码操纵内部生成过程;Catastrophic 改变采样温度等解码参数以破坏对齐。作者称 EnDec 操作模型内部状态,代表了前缀注入的思想上限。
- 特殊 token 注入方法:Virtual Context(VC)利用一少样本提示将特殊 token 与越狱有效载荷编码在嵌套对话中;ChatBug 提出了格式不匹配攻击(ChatBug-M)与消息溢出攻击(ChatBug-O)。作者指出,这些方法未解决平台添加的模板包裹干扰,且未考虑外部内容审核,在商业在线服务中效果受限。
基线方法与评测基准
- 基线方法:直接输入(DI)、PAP、GPTFuzzer、Virtual Context(VC)、ChatBug-O 与 ChatBug-M。
- 评测基准:采用包含 44 个安全类别、共 440 条不安全指令的 SorryBench 数据集。
论文与已有工作的区别定位 作者将 MetaBreak 定位为系统化解决平台聊天模板包裹干扰、外部审核拦截以及特殊 token 过滤清洗的特殊 token 注入攻击框架,并指出特殊 token 操纵与提示词工程策略互补。
论文如何解决这个问题?
通过响应注入、轮次掩码、输入分割与基于 L2 范数的语义模拟实现端到端攻击。
论文提出了名为 MetaBreak 的攻击框架,通过协同四个攻击原语构建针对在线大语言模型服务的完整攻击链。
核心原语设计
- 响应注入(Response Injection):利用角色管理特殊 token 伪造助手头部标识,在输入中构造肯定式前缀(如肯定性短语),引导 LLM 沿用助手角色继续补全有害内容。
- 轮次掩码(Turn Masking):为解决平台自动添加的用户与助手边界标签打乱上下文的问题,通过少样本单字间隔构造,利用特定分隔符引导模型按词输出,使模型适应并吸收平台插入的多余助手标签,从而掩盖伪造对话结构。
- 输入分割(Input Segmentation):利用情感分析工具识别输入中的敏感表达,并用用户角色标记符号将敏感词汇切断(例如拆分违禁词)。轻量级审核模型因理解能力有限无法识别违禁词,而主模型能重组完整语义。
- 语义模拟(Semantic Mimicry):当平台清洗所有用户输入的特殊 token 时,通过在词表嵌入空间中计算替代词向量与特殊 token 向量的欧氏距离,选取最接近的常规 token 替代特殊 token 参与注入。
向量替代度量公式
论文指出常规词的余弦相似度无法准确衡量特殊 token 的功能等价性,因特殊 token 与常规 token 的模长分布存在明显差异,故采用向量差的 L2 范数作为距离度量: d(v1, v2) = ||v1 − v2||2 其中 v1 与 v2 分别为词表中两个 token 的高维嵌入向量,该距离同时衡量向量方向与幅值。
交互与接口适配
- 单轮交互优化:为避免逐字生成的低效性,通过前置构建数个单字前缀示例再紧跟多字连接词,单次请求即可诱导模型输出完整有害回答。
- 对话机器人与 Web API 双接口支持:针对开源模型对话服务,直接在文本中注入目标模型对应的特殊 token 字符串;针对专有闭源模型的 Web API(Chat Completions 接口),通过向 JSON 请求体中传入带有 assistant 角色标记的字典对象间接实现 token 结构排布,无需知晓具体特殊 token 字符。
论文做了哪些实验?
在 4 个本地模型取得 62.0% 平均 ASR,在 7 个商用在线服务取得 59.8% 平均 ASR。
论文通过本地实验与真实在线服务评测了 MetaBreak 的攻击有效性。
实验设置
- 被测模型:本地测试采用 Llama-3.3-70B-Instruct(Q8_0)、Qwen-2.5-72B-Instruct(Q8_0)、Gemma-2-27B-Instruct(FP16)、Phi4-14B(FP16);真实服务测试采用 Llama-3.1-405B、Qwen-2.5-72B、Gemma-2-27B、Phi-4、Llama-3.3-70B、GPT-4.1、Claude-Opus-4。
- 基准与规模:SorryBench 数据集,涵盖 44 个不安全话题类别,共 440 条类别平衡的潜在不安全指令。
- 对比基线:Direct Input(DI)、PAP、GPTFuzzer、Virtual Context(VC)、ChatBug-O、ChatBug-M。
- 防御与护栏:LlamaGuard-3-8B、PromptGuard-86M、ShieldGemma-2-27B 及特殊 token 清洗防御。
- 指标定义与评审方式:攻击成功率(ASR,越狱成功次数占测试样本的比例);采用 SorryBench 提供的判定模型判断回答是否达成履行(fulfillment),输出 1 为达成、0 为拒绝或未实质协助。
主结果
下表呈现 4 个本地模型在无内容审核时的 ASR 主结果(据 Table 2):
表格较宽,可左右滑动
模型 DI MetaBreak PAP GPTFuzzer VC ChatBug-O ChatBug-M Llama-3.3 31.6% 87.3% 60.9% 67.7% 29.8% 30.2% 32.3% Qwen-2.5 32.3% 45.2% 71.1% 62.5% 31.1% 37.7% 37.0% Gemma-2 10.2% 45.5% 42.0% 82.3% 19.3% 10.2% 8.9% Phi-4 37.7% 69.8% 53.0% 33.9% 58.6% 37.7% 24.3% 平均 (Avg.) 28.0% 62.0% 56.8% 61.6% 34.7% 29.0% 25.6% - 平均性能对比:MetaBreak 平均 ASR 达到 62.0%,高于 PAP 的 56.8% 与 GPTFuzzer 的 61.6%,大幅高于 VC(34.7%)与 ChatBug 变体(29.0%、25.6%)。
- 模型架构差异:MetaBreak 在 Llama-3.3 与 Phi-4 上效果最好;PAP 在 Qwen-2.5 上表现最佳(71.1%);GPTFuzzer 在 Gemma-2 上表现最佳(82.3%)。
- 方法互补性:将 MetaBreak 与 PAP、GPTFuzzer 融合后,平均 ASR 分别提升至 81.1%(提升 24.3 个百分点)与 81.8%(提升 20.2 个百分点)。
规避护栏与内容审核实验
- 测试内容:测试在三款护栏模型(LlamaGuard、PromptGuard、ShieldGemma)拦截下的输入标记率与实际 ASR。
- 实验结果:输入分割使审核标记率相比无分割下降 42.9%(Table 5 中 MetaBreakIS 标记率在三款护栏上分别为 19.4%、38.2%、14.9%)。在实际 ASR 上(Table 6),MetaBreakIS 在三款护栏下的平均 ASR 分别为 51.5%、59.7%、40.7%,显著高于 PAP(47.8%、53.1%、16.2%)与 GPTFuzzer(13.5%、34.0%、0.0%)。
- 作者解读:作者认为轻量级审核模型无法识别切分后的敏感词,而主模型能够重构语义;PAP 虽标记率低但在强安全对齐下 ASR 衰减大。
规避特殊 Token 清洗实验
- 测试内容:模拟平台过滤所有特殊 token 的防御,使用基于 L2 范数筛选的常规 token 替代。
- 实验结果:Token 相似度与 ASR 呈正相关(Figure 7)。在选择最高相似度普通 token 替代时,ASR 接近未清洗的水平;当相似度低于一定阈值时 ASR 骤降,例如 Phi-4 上相似度从 83.1% 降至 77.1% 时,ASR 降低 33.9 个百分点。
- 作者解读:作者指出特殊 token 与常规 token 的模长差异决定了必须使用 L2 范数而非余弦相似度来选择替代词。
真实在线服务评测
- 测试内容:在 Poe、HuggingChat 平台以及 OpenAI、Anthropic 的官方 Web API 上测试 7 种模型服务(Table 9)。
- 实验结果:在 Poe 上的 Llama-3.1-405B 上,MetaBreak 取得 94.1% 的 ASR(PAP 为 54.1%,GPTFuzzer 为 34.1%);在 GPT-4.1 Web API 上取得 55.5% 的 ASR;在 Claude-Opus-4 Web API 上取得 59.1% 的 ASR。跨 7 个在线服务的平均 ASR 为 59.8%。
- 作者解读:作者称真实平台与本地量化环境的表现高度一致,且商用闭源 API 同样易受通过 API 角色抽象构建的攻击影响。
其他消融与分析
- 无特殊 token(普通 token 替代):平均 ASR 从 62.0% 降至 28.6%,降低 33.3 个百分点(Table 7)。
- 无轮次掩码:平均 ASR 降至 29.0%,降低 33.0 个百分点(Table 7)。
- 无输入分割(护栏环境下):平均 ASR 降至 20.6%,降低 30.0 个百分点(Table 7)。
- 无语义模拟(清洗环境下):平均 ASR 降至 26.4%,降低 35.6 个百分点(Table 7)。
- LLM-as-a-Judge 偏差:抽样 50 例人工核验,MetaBreak 的 TP 为 84.0%、FP 为 16.0%、TN 为 80.0%、FN 为 20.0%(Table 8),作者指出存在判定模型因回复结尾出现劝阻语而误判为失败的现象。
- 失败案例分布:分析 190 例失败样本,直接拒绝占 28.4%、假阴性占 14.7%、部分越狱占 17.9%、良性延续占 38.9%(§5.6)。
有什么可以进一步探索的点?
依赖模板结构与嵌入向量访问权限,且未针对专有闭源对话机器人开展测试。
作者指出的局限与后续方向
- 依赖聊天模板结构知识:MetaBreak 依赖对聊天模板结构的先验知识,对于未公开模板的小众或专有 LLM,攻击适用性受限(出自 §6 Limitations)。
- 依赖词嵌入向量信息:用于绕过特殊 token 清洗的语义模拟策略需要访问模型的 token 嵌入向量以计算距离,在无法获取嵌入权重的场景下不可行(出自 §6 Limitations)。
- 探索拓展至 AI 智能体系统:作者计划将 MetaBreak 扩展到具有复杂架构的新兴 LLM 系统(如 AI 智能体),系统研究越狱之外的隐私泄露与未授权代码执行漏洞(出自 §6 Future Directions)。
实验覆盖范围
- 被测模型范围:本地实验评估了 Llama-3.3-70B、Qwen-2.5-72B、Gemma-2-27B、Phi4-14B 共 4 个开源模型;在线实验评估了 5 个对话机器人与 2 个 Web API(GPT-4.1、Claude-Opus-4)。
- 护栏与防御评测范围:护栏评测覆盖了 LlamaGuard-3-8B、PromptGuard-86M 和 ShieldGemma-2-27B 共 3 款模型;输入清洗防御测试了移除所有用户输入特殊 token 的设定。
- 基准测试集覆盖:数据集覆盖了 SorryBench 的 44 个安全类别共 440 条测试样本。
- 攻击接口限制:对专有闭源模型仅通过 Web API 测试,未包含专有闭源模型背后的对话机器人界面。
- 论文未报告自适应防御实验:论文讨论了对抗训练与监控特定输入模式等缓解方向,但未在实验中实际实现并评估针对 MetaBreak 的自适应防御。
总结一下论文的主要内容
利用特殊 token 注入对抗平台模板包裹与审核,多场景验证了越狱有效性与互补性。
- 定位与问题:针对在线大语言模型服务中聊天模板自动包裹与外部内容审核机制导致的越狱防御壁垒,探讨如何利用特殊 token 的结构性元数据语义实现可靠越狱。
- 攻击框架设计:提出由响应注入、轮次掩码、输入分割与语义模拟四个原语组成的 MetaBreak 套件,分别解决助手角色伪造、平台包裹标签消除、审核模型识别规避以及特殊 token 清洗绕过等问题。
- 核心实验结果:在 4 个本地开源模型上实现 62.0% 的平均 ASR(Table 2);在部署护栏防御时取得 40.7%–59.7% 的平均 ASR(Table 6);在 7 个商用在线服务上取得 59.8% 的平均 ASR(Table 9);与现有提示工程方法融合后在各模型上 ASR 提升 20.2–24.3 个百分点。
- 作者结论与倡议:作者认为特殊 token 注入与提示词工程机制不同且具高度互补性;作者指出简单过滤特殊 token 或依赖提示词对抗训练无法根本解决该威胁,倡议建立涵盖 token 级、行为级与上下文级的多层防御框架。