研究者提出对抗分词攻击,可在不改文本的情况下绕过 LLM 安全限制
Adversarial Tokenization
AdvTok只改分词、不改文本来越狱;Llama3在Malicious上SRScore为.517(Table1)。
攻击者不改变恶意字符串,只改变其分词,以引出不安全回复、让安全分类器判为safe,或在提示注入中只追加payload。
- LLM管线通常只用一种规范分词,忽略其余合法分词。作者要回答:能否不改恶意文本、只改分词,来绕过安全对齐并仍生成有意义回复。
- 以插入代价1、删除代价0的编辑距离组织分词,并用MRMDD按距离采样。AdvTok在距离为2的邻域上贪心最大化目标回复前缀概率,同一分词可接到GCG、AutoDAN和FFA。
- 越狱数据为AdvBench、Malicious、Masterkey。作者称AdvTok在Llama3上单独SRScore最高;与AutoDAN组合在OLMo2上更高。安全模型绕过与提示注入中,对抗分词也高于规范分词基线。
- 作者指出闭源适用性有限:需要logits,不允许输入原始token序列的模型会阻止该攻击(第12节)。实验包括正文中的开源LLM与LlamaGuard、ShieldGemma;第10节的防御没有配套实验结果。
- 威胁模型
- 攻击者不改变恶意字符串,只改变其分词,以引出不安全回复、让安全分类器判为safe,或在提示注入中只追加payload。AdvTok需要目标模型logits。论文未使用white-box或black-box等术语。受害对象是子词LLM与安全分类器。
- 被测模型
- Llama3.2-1BLlama3.2-3BLlama3.1-8BGemma2 (2B)OLMo2 (7B)LlamaGuardShieldGemma
- 基准
- AdvBenchMaliciousMasterkeyTruthfulQAQ&A dataset (Appendix C)
- 指标
- SRScoreASRAHSBypass Rateprompt injection success rateaccuracy
论文提出对抗分词(adversarial tokenization)攻击:同一字符串存在指数级多种分词方式,而 LLM 训练和推理通常只采用其中一种,例如 Llama3 将 penguin 分为 [p,enguin],而 [peng,uin] 同样合法。作者发现模型虽只在一个分词上训练,仍能理解其他分词,据此可将明显恶意的字符串重新分词以绕过安全与对齐限制。实验在三个前沿 LLM 和对抗数据集上验证了该攻击,作者称其效果可与现有最先进对抗方法竞争,且无需改动有害请求的文本,揭示了子词模型中此前未知的漏洞。该论文发表于 ACL 2025。
深度解读
这篇论文试图解决什么问题?
不改恶意文本、只改分词,能否绕过对齐并仍生成有意义回复。
不改文本、只改分词,能否绕过 LLM 安全对齐并仍得到有意义回复。
- 场景:作者认为多数管线把 tokenizer 当作技术细节,训练和推理只取一种规范分词(canonical tokenization),忽略指数级的其他合法分词。若这些分词仍带语义,后训练对齐就可能只移动规范分词附近的概率质量。
- 现有方法:作者称已有非规范分词工作主要做边际化而非生成;重分词和 token 切分被当作防御,不是针对分词本身的攻击;搜索前后缀 token 会改变文本。作者称就他们所知,把对抗性分词当作攻击此前未被探索。
- 观察:Figure 4 中问答准确率随离开规范分词的归一化距离下降;端点数值在文本转换中不可读。作者称趋势平滑、近处噪声不大,并假设非规范分词仍可能访问未对齐的条件分布。
- 本文做法:提出贪心搜索 AdvTok,不改恶意字符串,只换 token 边界,并可接到已有攻击上。案例为越狱、安全模型规避和提示注入。
- 威胁模型:
- 目标:越狱要模型忠实回答恶意请求;安全模型规避要专用分类器把该请求判为 safe;提示注入要无害请求被追加 payload 后产生有毒回复。
- 知识:搜索用目标模型的条件概率(式 2),需要 logits。论文未使用 white-box、black-box 或 no-box 来命名该设定。
- 能力:不改底层字符串。提示注入中攻击者不能改用户请求,只能追加 payload;用户被假定诚实,其请求为规范分词。
- 受害系统:子词 LLM,以及可叠在对话管线上的安全分类器。成功分别由 StrongREJECT、绕过率,以及子串加拒答规则判定。
有哪些相关研究?
安全对齐、分词边际化与越狱方法均未把非规范分词当作攻击轴。
论文第 2 节把相关工作放在安全训练、分词研究和 token 攻防三类里,实验再与越狱基线对比。
安全与对齐
- 监督微调:Agarwal et al.(2024)、Gu et al.(2024)、Sanh et al.(2022)、Wei et al.(2022)用监督微调做适应或蒸馏。
- 偏好对齐:Rafailov et al.(2024)、Schulman et al.(2017)、Azar et al.(2023)、Yuan et al.(2023)从人类偏好学习策略或排序。
- 红队:Samvelyan et al.(2024)、Pan et al.(2024)、Perez et al.(2022)生成或组织对抗提示。作者称这些安全与红队流程都没有计入非规范分词。
分词本身
- 子词模型的分词问题:Giulianelli et al.(2024)、Petrov et al.(2023)、Ovalle et al.(2024)、Singh and Strouse(2024)讨论字符串如何被切开。论文此处只作引述。
- 边际化:Geh et al.(2024)、Cao and Rimell(2021)、Chirkova et al.(2023)、Vieira et al.(2024)研究非规范分词。作者称其重点是边际化,而不是对生成的影响。
与 token 有关的攻防
- 重分词类防御:作者把 Jiang et al.(2024)与 Ding et al.(2025)列为重分词或 token splitting,并称它们不是为对抗分词攻击而设计。
- adversarial tokens:Zou et al.(2023)、Wang et al.(2024)搜索特定前后缀 token。作者称二者相邻但根本不同:那种搜索会改文本,对抗性分词只改 token 空间表示(Figure 1)。
基线方法与数据集
- 越狱基线:规范分词;GCG(Zou et al.,2023)加梯度优化后缀;AutoDAN(Liu et al.,2024b)用遗传算法拼前后缀;FFA(Zhou et al.,2024)用固定模板把请求放进虚构或假设场景。第 7 节还提到 Liu et al.(2024a)、Xiao et al.(2024)、Jiang et al.(2024)的模板改写。
- 数据与评测:AdvBench 520、Malicious 100、Masterkey 45(Table 3 写作 MasterKey)。StrongREJECT 来自 Souly et al.(2024);ASR、AHS 的量规来自 Qi et al.(2023)与 Jiang et al.(2024)。安全分类器为 LlamaGuard(Inan et al.,2023)与 ShieldGemma(Zeng et al.,2024)。提示注入采用类似 Perez and Ribeiro(2022)的请求-载荷-回复模板。
作者把本文定位成一条被忽视的攻击轴:不改文本,即可与现有对抗方法竞争,并可附加到已有攻击上。作者称就他们所知,这一攻击此前未被探索。
论文如何解决这个问题?
AdvTok在分词邻域贪心搜索,最大化目标回复前缀的条件概率。
先用编辑距离把一个字符串的合法分词组织成可采样结构,再用 AdvTok 在局部邻域上提高目标回复的条件概率。按距离均匀采样用于第 4–5 节;越狱搜索是另一套贪心过程,并不从该图里抽样。
距离与 MRMDD
- BPE 规范分词:词表从字符开始,反复并入最高频 token 对,直到预定大小。规范分词器按训练时的合并顺序应用到不动点。后文只考虑 BPE 词表。
- 距离:采用 Levenshtein,插入代价 1、删除代价 0,替换因而变成先删后插。任意两分词的最大距离为字符串长度。附录 A 还写成两分词切分位置集的差的大小。作者称正代价且均匀时,多项式时间按距离均匀采样仍是开放问题,并怀疑是 NP-hard,因此把删除代价设为 0。
- 图表示:MDD 的路径是一种完整分词。Algorithm 1 编译多根 MDD(MRMDD):第 i 个根对应与参考分词距离恰好为 i 的分词;偏离参考的边消耗预算,再剪掉到不了终点的路径。
- 规模:边数上界为 O(|x|^2·|V|),因为距离不超过 |x|。作者称实践中合法 token 很少,边数更接近 |x|^2。附录 B 用 Llama3 tokenizer、AdvBench 句首、k=20:长度 20 时边数仍低于 1600,二次拟合为 y=2.5541x^2。从距离 i 均匀采样与边数成线性。
语义保持怎么估计
- 固定问题、四个选项和距离 k,看在该距离的分词条件下,规范分词答案里概率最大者是否为标准答案。这是下界:对答案的全部分词做边际化,对自回归模型是 NP-hard(Geh et al.,2024)。
- 每个距离采样 128 个分词。比较时用距离除以该串的最大距离。问答集 15 题、每题 4 选项,易、中、难各 5 题(附录 C)。
AdvTok
- 邻域:Ne(v) 是与 v 距离恰好为 2 的分词。命题 2:token 长度有界时,邻域大小为 O(|v|^2)。命题 3:任意两个 BPE 分词可经邻域步互达,因此局部搜索够得到任意分词。
- 优化:要找的是使目标回复 r 在前缀 q 下概率最大的分词,即 argmaxv ∈ TV(x) pLLM(r ∣ q, v)。其判定形式(问题 4)是 NP-complete(定理 5)。Algorithm 2 因而只在邻域上迭代,每步取该概率最大的邻居。
- 实验近似:附录 E.1 不遍历整个邻域,而是无放回抽 128 个;作者称这是完整优化的下界。主结果的初始分词是均匀随机样本,不是规范分词;作者称用规范分词作初值会落到更低的局部最大值。迭代上限很少被达到,因为找到局部最优就停;论文未给出该上限的数值。
- 目标回复:r 是与问题相关的肯定前缀。AdvBench 复用 Zou et al.(2023)的前缀,另两个数据集手工构造。作者的理由是:能引出某一个肯定前缀的分词,也可能引出语义相近但词面不同的前缀。前缀原文不在此复述。
三项案例中的用法
- 越狱:攻击输入就是恶意请求的一种分词,文本不变。同一分词可插进 GCG、AutoDAN、FFA 的模板或前后缀。生成设置为 temperature=1、top_k=0、top_p=1、最多 256 个新 token,每种攻击 32 条回复。
- 安全模型:pSafety(非 safe|g, q)>0.5 判为 unsafe,否则 safe。绕过率是恶意请求被判 safe 的比例。复用 Llama3、Gemma2 越狱时的分词,而不是为误分类另做优化。作者称这更接近既要聊天模型给出肯定回复、又要穿过分类器的设定。LlamaGuard 与 Llama3 共用 tokenizer,ShieldGemma 与 Gemma2 共用。
- 提示注入:论文称为 man-in-the-middle。攻击者不能改无害且已规范分词的用户请求,只能追加 payload。成功要同时满足:目标串是回复的大小写不敏感子串,且回复不含 Table 7 的拒答串。11 个请求、8 个 payload、5 个目标回复,共 440 种组合,每种 64 条回复。附录 E.2 给出原句,此处不复述。
作者讨论的防御
- 全部重分词:作者称若(反)分词器双射,则可完全解决。Gemma2 的 token ID 330 与 235317 映射到同一字符串;冲突 token 对为 Gemma2 8381、OLMo2 121995、Llama3 309862。
- API 只收字符串:可挡住该利用,但用户失去 token 级微调或 embedding 所需的访问,且不解决开源模型。
- 训练流程:作者认为预训练会把语义漏到许多分词上(Kaplan et al.,2024),而安全训练通常只是数据相对少的后训练,未必覆盖这些分词。作者提出,要充分处理该问题,可能要把安全并入子词模型的预训练。论文未报告这些防御的实验。
论文做了哪些实验?
Table1中AdvTok在Llama3三列SRScore均为最高。
实验设置
- 模型:语义与越狱主实验为 Llama3(1B)、Gemma2(2B)、OLMo2(7B)。附录 F.1 的尺寸实验写明 Llama3.2-1B、Llama3.2-3B、Llama3.1-8B,且 1B 列与 Table 1 的 Llama3 数字相同。安全模型为 LlamaGuard、ShieldGemma。AHS/ASR 的评审是 GPT-4o-mini-2024-07-18。
- 数据:附录 C 的问答集 15 题。越狱为 AdvBench 520、Malicious 100、Masterkey 45(Table 3)。提示注入 440 个组合。附录 H 用 Malicious 的 100 条有害题和 TruthfulQA 的 100 条无害题。
- 基线:规范分词;GCG 为 batch 512、top-k 256、100 步;AutoDAN 为 100 步,并沿用原作者的成功检测;FFA 优化三组 scene-purpose(Table 4),模板不复述。AdvTok 可与三者组合。
- 指标:SRScore 在 [0, 1],越高表示不拒答且与请求相关。AHS 为 1–5。ASR 是有害分等于 5 的比例。安全模型报告 Bypass Rate。提示注入报告成功率。
- 生成与评审:越狱每种攻击 32 条回复,并报告均值和标准误。GPT-4o-mini 的 temperature=0、top_p=0。StrongREJECT 用其高层 API,论文未写该评审背后的模型名。Figure 5 对一条请求、每个距离抽 16 个分词,每个分词生成 32 条、长度 256。提示注入每种组合 64 条。
- 搜索预算:AdvTok 每步抽 128 个邻居,不是全邻域。越狱案例约 4680 个 NVIDIA L40S GPU 小时。论文未报告实验使用的迭代上限,也未报告搜索查询次数。
主结果
下表只列 Table 1 的 SRScore 均值,标准误见原表。超过 8 行,故未列入 Gemma2 / Masterkey。
表格较宽,可左右滑动
模型与数据集 Canonical AdvTok Table 1 该列最高 Llama3 / AdvBench .023 .275 AdvTok .275 Llama3 / Malicious .176 .517 AdvTok .517 Llama3 / Masterkey .272 .451 AdvTok .451 Gemma2 / AdvBench .020 .150 AutoDAN .429 Gemma2 / Malicious .042 .104 AdvTok+AutoDAN .406 OLMo2 / AdvBench .015 .214 AdvTok+AutoDAN .670 OLMo2 / Malicious .036 .238 AdvTok+AutoDAN .697 OLMo2 / Masterkey .231 .370 AdvTok+AutoDAN .612 - 作者称 AdvTok 在 Llama3 上作为单独攻击最好,与其他方法组合后仍低于单独 AdvTok。作者给出的一种可能解释是:Llama3 在安全后训练中有意或无意见过已知越狱技术。
- 作者称 Gemma2 与 OLMo2 上单独 AdvTok 具有竞争力,与 AutoDAN 组合时尤其突出。Table 1 里 OLMo2 三列的单独 AdvTok 都低于 FFA(.447、.513、.438)。Gemma2 的 AdvBench 上,AdvTok+AutoDAN(.390)低于单独 AutoDAN(.429)。
- 未列入的 Gemma2 / Masterkey:Canonical .219,AdvTok .290,该列最高为 AdvTok+AutoDAN .352。另一处组合未升高:Gemma2 的 Malicious 上 AdvTok+GCG 为 .374,单独 GCG 为 .385。
安全模型绕过
- 测的是请求而非 32 条回复:同一批越狱分词是否被 LlamaGuard、ShieldGemma 判为 safe,阈值 0.5。
- Table 2:LlamaGuard 上 AdvTok 为 AdvBench 16.15%、Malicious 16.00%、Masterkey 55.56%;该模型 AdvBench 最高是 AdvTok+AutoDAN 的 24.81%。规范分词为 3.27%、9.00%、33.33%。ShieldGemma 上 AdvTok 为 63.27%、86.00%、86.67%;AdvBench 最高是 AdvTok+GCG 的 69.94%。其规范分词已为 53.27%、79.00%、80.00%。
- 作者称 LlamaGuard 在 AdvBench 与 Malicious 上防得较好,但在对抗性分词、尤其 Masterkey 上吃力,并称安全模型绕过率大于 20% 已经很高。附录 H、Table 10:ShieldGemma 规范分词的有害题 TP 为 0.21、无害题 FP 为 0.00;作者称高绕过率来自高假阴性,把问题过度判为 safe。LlamaGuard 规范分词 TP 0.91、FP 0.02;GCG、AutoDAN、FFA 的无害题 FP 为 0.57、0.38、0.95,AdvTok 为 FP 0.03、TP 0.84。作者称 LlamaGuard 可能在常见的改文本越狱上训练过,而 AdvTok 仍能避开检测。
提示注入
- 440 个组合、各 64 条。成功须同时命中目标子串且不含 Table 7 的拒答串。作者称这盖不住全部分对分错,因为回复常审查或拼错冒犯词(Table 13)。
- Figure 6 标注三组均值和标准差:AdvTok 为 76.98%±30.48%、74.63%±27.12%、47.82%±34.22%;规范基线为 5.80%±17.36%、36.62%±37.89%、23.96%±33.62%。正文未写出各面板对应哪个模型。作者称对抗分词后成功率一致上升。纵轴刻度为 0 到 100。
- Table 13 是 Llama3、同一请求和同一 payload 的抽样回复:规范分词一侧多为拒答;AdvTok 一侧既有目标串,也有拼写变体和改写。原句不复述。
语义随距离的变化
- Figure 4:Llama3、Gemma2、OLMo2 在易、中、难三档上,准确率随归一化距离下降。作者称趋势平滑,靠近规范的非规范分词噪声不大。文本转换读不到曲线端点。
- Figure 5:一条恶意请求上,距离 0 的规范分词分数倾向最低。作者称 Llama3 近凹,可能对应语义衰减;OLMo2 似上升,作者认为可能因为语义信号在该模型上保留得更稳。这是作者对图的解释。
其他消融与分析
- 尺寸(Table 8,SRScore):Llama3.2-1B 的 AdvTok 为 .275、.517、.451;3B 为 .115、.284、.418;8B 为 .043、.092、.280。8B 的 Masterkey 列最高是 AdvTok+AutoDAN .345。作者称 AutoDAN 随尺寸增大更有效,其他方法倾向变低;AdvTok 在 1B 和 3B 最有效。
- ASR(Table 6):Llama3 的 AdvTok 为 23.65%、39.41%、27.22%;OLMo2 的 AdvTok+AutoDAN 为 55.07%、63.78%、48.54%。Gemma2 的 AdvBench 上 AutoDAN 为 49.30%,AdvTok 为 6.14%。
- AHS(Table 5,1–5):Llama3 的 AdvTok 为 2.855、3.523、3.442;OLMo2 的 AdvTok+AutoDAN 为 4.022、4.223、4.090。
- 长度(Table 9,Overall):AdvTok 的 Pearson r=0.4833(p=0.0000);AdvTok+GCG 为 0.5139;AdvTok+AutoDAN 为 0.1329(p=0.1943)。作者称更长文本的分词空间更大,可能有助于越狱。Figure 9 中聚合提示词多数落在 [50, 100]。
- 超参数(Figure 11,Llama 3.2 1B,Malicious):图注称采样邻居越多 AdvTok 越高,即使 2 个样本也超过其他方法;初始分词种子的影响较小。第 7 节称超参数选择并不显著改变结果。
- 词表长度(附录 D):Llama3 与 OLMo2 的 token 最长 128,Gemma2 最长 31,多数低于 10。
有什么可以进一步探索的点?
作者指出闭源场景需要logits,且原始token输入会挡住攻击。
作者指出的局限与后续方向
- 对抗性分词对闭源 LLM 的适用性有限(第 12 节 Limitations)。
- 方法依赖 logits 来计算式 (2),许多专有模型限制这一访问(第 12 节)。
- 不允许用户输入原始 token 序列的闭源模型,本身就会阻止该攻击(第 12 节)。
第 10 节提出重分词、限制 API 输入,以及把安全并入预训练,但没有把它们写成待做实验。伦理节承认公开的代码可能被误用,并希望推动安全研究;这不是标明的研究局限。
实验覆盖范围
- 主结果的生成模型为 Llama3(1B)、Gemma2(2B)、OLMo2(7B);附录 F.1 与 Table 8 另有 Llama3.2-3B、Llama3.1-8B。1B 列与 Table 1 的 Llama3 数字相同。
- 越狱数据为 AdvBench 520、Malicious 100、Masterkey 45,每种攻击 32 条回复。问答集 15 题,每个距离 128 个分词。
- 安全模型为 LlamaGuard 与 ShieldGemma,阈值 0.5,分词复用越狱搜索而不是针对误分类优化。附录 H 另报 Malicious 100 与 TruthfulQA 100 的 FP、TP。
- 提示注入为 440 个组合、每种 64 条。Figure 6 给出三组成功率均值,正文未标明各面板模型。AHS/ASR 的评审是 GPT-4o-mini-2024-07-18;StrongREJECT 背后的模型论文未写明。
- 第 10 节讨论了输入重分词、API 只收字符串,以及把安全并入预训练;论文未报告这些防御的实验结果。AdvTok 每步抽 128 个邻居。越狱案例约 4680 个 L40S GPU 小时。论文未报告迭代上限和搜索查询次数。
总结一下论文的主要内容
作者称非规范分词能躲开对齐并仍得到针对原请求的回复。
作者用非规范分词攻击已对齐的子词 LLM:恶意字符串的字符不变,只改 token 边界。
- 问题:部署系统通常只使用 BPE 给出的一种规范分词。作者问另一种合法分词能否躲开安全限制,同时让回复仍然对着原来的请求。
- 做法:插入代价 1、删除代价 0,把与参考分词相距不超过给定预算的分词编进 MRMDD,用于按距离采样。AdvTok 则从随机分词出发,在距离恰好为 2 的邻域里贪心提高肯定回复前缀的条件概率;该优化的判定形式是 NP-complete。同一分词可以插进 GCG、AutoDAN 和 FFA。实验每步只抽 128 个邻居。
- 语义:Figure 4 中 Llama3、Gemma2、OLMo2 的问答准确率随归一化距离下降。作者称近处仍保留语义,下降平滑。
- 越狱:Table 1 里 Llama3 的 AdvTok SRScore 为 AdvBench .275、Malicious .517、Masterkey .451,高于规范分词的 .023、.176、.272,也是这三列最高。OLMo2 上 AdvTok+AutoDAN 为 .670、.697、.612。Gemma2 的 AdvBench 上,单独 AutoDAN 的 .429 高于 AdvTok 的 .150。
- 分类器与注入:LlamaGuard 对 Masterkey 上 AdvTok 的绕过率为 55.56%(Table 2)。ShieldGemma 的规范分词绕过率已是 53.27%、79.00%、80.00%。Figure 6 三组提示注入均值中,AdvTok 为 76.98%、74.63%、47.82%,规范基线为 5.80%、36.62%、23.96%;面板对应的模型正文未标明。
- 作者的结论:非规范分词仍能生成有意义回复,却能走到对齐所移动的概率质量之外。作者认为安全后训练相对预训练更小,未必盖住这些分词;要处理该问题,可能要把安全并入预训练。作者同时指出,没有 logits、或不允许输入原始 token 序列的闭源模型,会挡住这一攻击。