研究:字符级扰动可破坏 LLM 水印,并提出基于遗传算法的去除攻击
Character-Level Perturbations Disrupt LLM Watermarks
作者用字符级扰动攻击五种LLM水印;OPT、KGW、ER=0.1时ASR为0.2228(Table II)。
黑盒设定:对手只能获得受害LLM的输出文本,不知模型结构、参数、logits,也不知水印方案。
- LLM水印在生成时注入可检测信号,用于归因与滥用防范。作者认为既有移除攻击假设过强、多用token或句子级扰动,可能高估鲁棒性。
- 作者比较单次编辑的攻击范围:token级为h+1,字符级打乱分词后为h+3。AC1随机改字符;AC2用有限查询训练BERT参考检测器,再以遗传算法选位置。
- OPT与LLaMA的五种水印上,同ER时字符级ASR多高于token级;OPT、KGW、ER=0.1时为0.2228对0.0224(Table II)。字符级GA在OPT上五方案平均ASR为0.6514。梯度迁移ASR低于0.1。
- 结论提出需要专门防御,并建议改进分词与水印方案,以及研究水印伪造。实验使用OPT-1.3B与LLaMA-3-8B、五种推理时水印;论文未报告Table II样本量与重复次数。
- 威胁模型
- 黑盒设定:对手只能获得受害LLM的输出文本,不知模型结构、参数、logits,也不知水印方案。AC1不能访问原检测器;AC2对受害LLM和原检测器每条输入仅有限次黑盒查询。目标是以最小编辑率使全局水印分低于阈值τd。
- 被测模型
- OPT-1.3BLLaMA-3-8B
- 基准
- C4 RealNewsLike
- 指标
- ASRWDRAUCBLEUROUGE-F1PPL rateER
论文《Character-Level Perturbations Disrupt LLM Watermarks》提出,字符级扰动(如拼写错误、字符交换、删除、同形字)能通过扰乱 tokenization 过程同时影响多个 token,从而在受限威胁模型下比常规方法更有效地去除 LLM 水印。作者首先形式化了 LLM 水印的系统模型,并刻画了两种限制对水印检测器访问的现实威胁模型,随后分析不同扰动类型的攻击范围。基于此,他们提出使用遗传算法(GA)并借助参考检测器进行优化的引导式去除攻击,在仅能有限次黑盒查询检测器的实际威胁模型下表现出较强的去除效果。作者还提出对抗困境:任何固定防御都可被合适的扰动策略绕过,并据此设计自适应复合字符级攻击,实验显示其能有效击败现有防御。研究结论指出当前 LLM 水印方案存在显著脆弱性,需要开发新的鲁棒机制。
深度解读
这篇论文试图解决什么问题?
作者认为既有移除攻击偏弱,字符级扰动的攻击范围被低估,水印鲁棒性可能被高估。
现有推理时LLM水印,在检测器不可用或只能有限查询时,能否被小编辑率的字符级扰动移除。
- 场景:作者称水印用于版权、滥用防范和机器文本检测,生成时注入可统计检测的信号。实用性取决于对抗编辑后仍可检测;作者认为既有移除攻击偏弱,可能使鲁棒性被高估。
- 既有不足:作者称先前工作常假设已知水印方案、可无限查询受害LLM或检测器,或有相似代理LLM。扰动多在token级或句子级,且不优先修改对水印分最关键的token。
- 观察:作者将单次编辑影响的token数定义为攻击范围。token级修改影响该token及后续h个密钥,范围为h+1;字符级打乱分词,一个token常被拆成至少3个子词,范围为h+3。
- 提出:形式化AC1与AC2。无检测器时用随机字符级扰动做基准;有限查询时用参考检测器引导的遗传算法;并对固定防御提出自适应复合字符级攻击。
- 威胁模型:
- 目标:最小化编辑率,使扰动后全局水印分Sw低于阈值τd,并尽量保持语义与不易察觉。
- 知识:黑盒,只有受害LLM输出;不知结构、参数、logits,也不知水印方案及δ、γ、h。水印窃取和用代理LLM近似token分布因此不可行。
- 能力:每条输入及其轻微扰动只有有限次黑盒查询。AC1不访问原检测器;AC2可有限查询原检测器与受害LLM。
- 受害系统:返回带水印文本的LLM API,以及判定文本是否含水印的检测API。系统模型1中检测器私有,系统模型2中为公开API。
有哪些相关研究?
作者按检测器访问和扰动层级对照既有移除方法,并称其不适用于两类现实威胁模型。
推理时水印
- logits阶段:KGW(Kirchenbauer等,2023)与Unigram(Zhao等,2024)用密钥划分绿/红名单,并对绿名单logits加偏置。
- 概率或采样阶段:Unbias(Hu等,2024)、DIP(Wu等,2024)重加权token概率;SynthID(Dathathri等,2024)等在采样时用伪随机分数选token。
- 训练时对照:作者提到触发器式训练时水印,并称推理时方法不必改参数、更灵活。
移除、改写与窃取
- 句子级改写:Krishna等(2023)用DIPPER改写以逃避检测;He等(2024)讨论水印能否经翻译保留。
- 窃取后移除:Jovanović等(2024)、Zhang等(2024)、Wu与Chandrasekaran(2024)、Chen等(2025)。附录称这类方法计算开销大,需要知道水印细节,且只针对较窄的一类方案。
- 其他移除:Piet等(2025)评估语言水印;Zhang等(2024)讨论强水印的不可能性;Liang等(2024)用梯度文本对抗做黑盒迁移。附录称后者因参考检测器与原检测器边界不匹配,依赖注入大量噪声。
字符级扰动的既有测试
- 检测下降:Kirchenbauer等、Piet等、Liu等、Creo与Pudasaini、Liang等测试过错字、拼写错误和同形字,作者称这些扰动可以降低检测。
- 作者的批评:附录称这些工作没有解释字符级为何移除成功率更高,也没有系统利用该优势设计更复杂的攻击。
- Table I:作者按有限查询、是否访问原检测器、是否知道模型与水印方案,以及字符/token/句子级和有无梯度引导,给既有方法打勾。作者称在其两类现实威胁模型下,既有方法不适用。
基线与数据
- 基线方法:token级用Gensim做同义替换;句子级用DIPPER与AuthorMist;引导设定用Sand和Best-of-N;梯度对照为TextBugger与DeepWordBug。
- 数据:提示来自C4的RealNewsLike子集,由OPT-1.3B与LLaMA-3-8B生成带水印文本;五种水印经MarkLLM实现。
作者称本文给出LLM水印移除的首次全面分析:用攻击范围解释字符级优势,并用参考检测器引导的遗传算法,在有限查询下选择扰动位置。
论文如何解决这个问题?
字符级编辑打乱分词以扩大攻击范围;有限查询时用参考检测器引导遗传算法选位置。
整体上,作者把移除效果归结为单次编辑的攻击范围,据此采用字符级扰动;在只能有限查询原检测器时,再用参考检测器引导的遗传算法选择位置。
系统与优化目标
- 访问约束:系统模型1的检测器只供模型方或授权方使用;系统模型2把检测器做成公开API。作者称实际系统会限制对LLM及检测器的黑盒查询。
- 目标:在全局水印分低于检测阈值的前提下最小化编辑率,即 argmin ER(X,X̃) s.t. Sw(X̃)<τd。
- 密钥依赖:位置t的密钥由前h个token的哈希得到。h=0时同一LLM的token共用密钥;作者后文用这一点解释Unigram的共享绿名单。
攻击范围与AC1随机攻击
- token级:修改xt会改变自身分数,并改变后续h个位置的密钥,攻击范围为h+1。
- 字符级:一次编辑打乱分词,常把一个token拆成至少3个子词,再影响后续h个位置,范围为h+3。Figure 2在h=1、分数取0或1的图示中,范围是2对4,WDR图示为1/2对2/3。
- 随机策略:AC1不能访问原检测器,也不能用本地代理LLM。位置均匀随机抽取,每个被选token只改一个字符,优先靠近中部,编辑率不超过上界ϵ。
- 操作类型:错字、删除、相邻交换、插入零宽字符或空白、同形字替换。作者称同形字常拆成至少3个子词,其余类型多为一分为二,因此后文以同形字为主要字符级类型。
AC2:参考检测器与遗传算法
- 参考检测器:对每种水印微调BERT回归模型,预测归一化全局水印分。数据为5000条水印文本和5000条非水印文本;Ref-0、Ref-5、Ref-9表示每样本0、5、9个token级或字符级增广。作者假定检测器返回分数,而不只是二值标签。
- 不匹配:原检测器按具体方案的规则计分;参考检测器是神经网络,可能对少数高梯度token过度敏感。作者称因此用参考检测器做梯度优化不可靠。
- GA:无梯度搜索token位置子集,使参考检测器分数下降并控制编辑率。先去掉梯度超过均值加α倍标准差的token;Dref高于τl时只降分数,低于后再联合惩罚编辑率;相邻迭代损失改进小于δl则保留上一代父代。主实验未给出τl、δl、λ和α的取值。
- Best-of-N:把GA迭代轮数设为1,生成N个候选,取得分最低者再交给原检测器。主实验的GA使用n=15、种群100,即对参考检测器1500次查询。
对固定防御的自适应复合攻击
- 作者的论点:对任何固定防御,都存在至少一种可绕过它的扰动策略。
- 两层搜索:内层为每个位置选择防御函数作用后字符编辑距离更小的复合扰动;外层搜索能降低Dref的token子集,并加上编辑率惩罚。
- 复合扰动:同一位置叠加一种以上字符修改。防御模块为拼写纠正、OCR、Unicode规范化和删除异常字符。
- 作者的解释:即使防御去掉可疑字符或拼写错误,仍可能无法恢复原token,从而打乱水印密钥和信号。
成功如何判定
- ASR:只在水印文本上计算,指攻击后不再被检出的比例。主实验使用水印设计者给出的检测阈值;正文未给出τd的数值。
- WDR:水印分下降量,除以水印集上Sw的最大值与非水印集上Sw的最小值之差。
- 预算:正文的编辑距离和编辑率默认是token级,除非另作说明。
论文做了哪些实验?
在OPT与LLaMA的五种水印上,同编辑率时字符级ASR多高于token级,GA进一步抬高ASR。
实验设置
- 受害模型:OPT-1.3B与LLaMA-3-8B,在NVIDIA A100上生成文本。提示来自C4的RealNewsLike子集。
- 水印:KGW、DIP、SynthID、Unigram、Unbias,实现来自MarkLLM。前四者中KGW、Unigram、DIP、Unbias设γ=0.5;KGW与Unigram设δ=2;KGW的h=1;其余超参沿用MarkLLM默认。
- 对照:AC1比较Gensim同义替换、字符级扰动,以及DIPPER(lexical diversity 20、order diversity 0)和AuthorMist。AC2比较Best-of-N、GA和Sand;梯度对照为TextBugger与DeepWordBug。
- 指标:token级ER;WDR;ASR,仅在水印样本上、用设计者给出的阈值计算。AUC通过滑动τd得到,负类为原始非水印文本。质量指标为BLEU、ROUGE-F1,以及由受害LLM计算的PPL rate。
- 规模与未报告项:Table VII的文本长度为100、ϵ=0.1、参考检测器为Ref-9。参考检测器训练数据为每种水印5000条水印文本加5000条非水印文本。人工评估为15人、每人200篇。Table II未说明文本长度和样本量;论文未报告攻击重复次数。
- 编辑率口径:作者对C4的统计是每token平均5.18个字符。正文ER默认按token计。
主结果
下表为Table II中ER=0.1的一部分。省略了LLaMA上DIP、Unbias的ER=0.1,以及全部ER=0.5和句子级结果。
表格较宽,可左右滑动
条件(ER=0.1) token ASR char ASR token WDR char WDR OPT KGW 0.0224 0.2228 0.0832 0.1274 OPT DIP 0.5917 0.6586 0.1847 0.2000 OPT SynthID 0.0709 0.1368 0.1698 0.2191 OPT Unigram 0.0520 0.0788 0.0437 0.0788 OPT Unbias 0.5684 0.6728 0.1760 0.1964 LLaMA KGW 0.1359 0.2261 0.0923 0.1136 LLaMA Unigram 0.0562 0.1564 0.0243 0.0529 LLaMA SynthID 0.1064 0.1824 0.1499 0.1849 - 低预算:作者称字符级在低编辑预算下优势更明显,并报告KGW、SynthID、Unigram且ER=0.1时,平均ASR为字符级0.1672、token级0.0740。上表各行的字符级ASR均高于同行token级。
- 句子级:作者称可比编辑率下字符级也优于句子级。Table II中LLaMA、Unigram、字符级ER=0.5的ASR为0.8290,DIPPER在ER=0.5320时ASR为0.8625。AuthorMist的ER多在2.3以上,ASR可以到1.0000(OPT、DIP)。
- 例外:LLaMA、DIP、ER=0.5时,字符级WDR为0.3983,token级为0.4069,ASR均为0.9988。作者称DIP和Unbias较弱,token级已经较有效。Figure 4中作者称同形字替换的ASR更高,尤其在ER=0.05和0.1;正文未给出各点精确值。
文本质量与人工评估
- 自动指标:Table IV使用100 token输入。作者报告OPT、ER=0.1时,字符级平均BLEU/ROUGE-F1为0.7715/0.8677,token级为0.7675/0.9080;PPL rate为1.1584对1.6601。ER=0.5时字符级ROUGE-F1为0.4393,token级为0.5568。
- 人工:15名评分者按语法/连贯、正确性、流畅性和总体质量打0–3分,并给出基于t分布的95%置信区间。Table VI总体均分为水印文本2.63±0.06、句子级2.48±0.04、字符级2.24±0.03、token级1.26±0.04。论文未说明这组文本的水印方案和编辑率。
- 作者解读:作者称字符级比token级更能保持质量和视觉不易察觉;句子级文本更流畅,但需要很高的编辑率。正文未报告显著性检验。
参考检测器引导的移除
- 设定:文本长度100,ϵ=0.1,Ref-9。GA为15轮、种群100,对参考检测器查询1500次。Best-of-N比较N=10与N=1500;Sand按增量接受扰动。
- 结果:作者报告字符级五方案平均ASR为,GA在OPT/LLaMA上0.6514/0.6615,Best-of-N(N=10)0.4414/0.4466,Sand 0.2622/0.3099。同等查询预算下,Best-of-N(N=1500)字符级平均ASR为0.4555/0.4468。
- 作者解读:作者称GA更能利用参考检测器并减轻不匹配;Sand依赖小步反馈,不匹配使该反馈不可靠。Table IX中TextBugger与DeepWordBug的ASR均低于0.1。
固定防御与自适应攻击
- 设置:Section VI比较普通GA与针对拼写纠正、OCR、Unicode规范化、删除异常字符的自适应GA,ϵ=0.1。Table X未说明受害LLM。
- 平均ASR:作者报告SC、DE、UN的自适应攻击把平均ASR从0.6631升到0.7365、0.7293、0.7407;加上对应防御后为0.6966、0.6323、0.6736。OCR自适应平均ASR为0.6380,加OCR后为0.6810。
- 例外:作者称Unigram在OCR设定下ASR下降,因为其密钥不依赖上下文。Table X中该格在原检测器上为0.5896,加OCR防御后为0.4776。
其他消融与分析
- Figure 3:ER从0.05到0.5、文本100 token;KGW、Unigram、SynthID且ER≤0.2时,作者报告平均ASR字符级/token级为OPT 0.2840/0.1461、LLaMA 0.2197/0.1325。
- Table III:作者报告攻击前平均AUC为1.0;字符级ER=0.1/0.3/0.5的平均AUC为0.9833/0.8244/0.6861,token级为0.9887/0.8556/0.7294。Unigram、字符级、ER=0.5仍为OPT 0.9608、LLaMA 0.9374。
- Table V:频率排序相对随机策略,ER=0.1时token级平均ASR变化为OPT 0.009、LLaMA 0.0685,字符级为0.0429、0.0020;ER=0.5时作者报告的平均变化含负数。作者称Unigram是例外。
- Table VIII(OPT):GA字符级、KGW的ASR,Ref-0为0.3596,Ref-9为0.4966。
- Table IX:TextBugger在Unbias上的ASR为0.0490,为表中较高一格;各方案两种梯度攻击ASR均低于0.1。
- Appendix Table XI:法文、LLaMA、KGW、100 token、ER=0.1,token/字符ASR为0.0736/0.1207;ER=0.5为0.9264/0.9816。
有什么可以进一步探索的点?
作者在结论中提出需要新防御、改进分词与水印,并把水印伪造列为后续方向。
作者指出的局限与后续方向
论文没有单独的Limitations节。结论中写出的后续方向如下。
- 专门防御:作者称结果说明需要针对水印移除攻击的专门防御(Conclusion)。
- 分词与方案:作者称一个方向是改进分词策略和水印方案,以增强对移除攻击的鲁棒性(Conclusion)。
- 水印伪造:作者称本文主要做移除;更好的引导技术下,对手可能用字符级扰动伪造水印,并把文本错误归因于LLM(Conclusion)。
实验覆盖范围
- 模型与水印:受害LLM为OPT-1.3B和LLaMA-3-8B;水印为KGW、DIP、SynthID、Unigram、Unbias(Section IV-C)。
- 数据:提示来自C4的RealNewsLike。主文多处使用100 token;附录另报50至200 token,以及LLaMA生成的法文、KGW和SynthID(Appendix A-B、A-C)。
- 攻击设定:覆盖AC1随机扰动和AC2有限查询;引导方法包括Best-of-N、GA和Sand,并与TextBugger、DeepWordBug对比(Section V)。
- 防御:评测拼写纠正、OCR、Unicode规范化和异常字符删除(Section VI、Table X)。Table X未说明受害LLM。
- 规模缺口:人工评估为15人、每人200篇(Table VI)。参考检测器训练用5000条水印文本和5000条非水印文本(Section V-B)。论文未报告Table II的样本量,也未报告攻击重复次数。
总结一下论文的主要内容
字符级扰动靠更大攻击范围移除水印;有限查询下,参考检测器引导的GA进一步降低可检测性。
这篇工作评估推理时LLM水印在黑盒、有限查询下的移除难度,并比较字符级、token级和句子级编辑。
- 问题:作者认为既有移除要么假设过强的访问能力,要么主要改token或整句,且缺少对关键位置的引导,因此可能高估水印鲁棒性。
- 方法:攻击范围被定义为一次编辑影响的token数。token级为h+1;字符级打乱分词,范围为h+3。AC1随机选择位置,每个被选token只改一个靠近中部的字符。AC2用有限查询训练BERT参考检测器,再用遗传算法做无梯度选位;对固定防御则叠加复合字符扰动。
- 低预算结果:Table II中,OPT、KGW、ER=0.1时字符级ASR为0.2228,token级为0.0224。作者报告KGW、SynthID、Unigram且ER=0.1时,两模型平均ASR为0.1672对0.0740。Unigram在该预算下字符级ASR仍低,OPT为0.0788。
- 引导结果:长度100、ϵ=0.1、Ref-9时,作者报告字符级GA的五方案平均ASR为OPT 0.6514、LLaMA 0.6615,高于同文给出的Best-of-N和Sand平均。梯度迁移的ASR低于0.1(Table IX)。
- 检测与质量:作者报告字符级攻击后平均AUC在ER=0.5为0.6861;Table III里Unigram、字符级、ER=0.5仍为OPT 0.9608、LLaMA 0.9374。人工总体均分为字符级2.24±0.03、token级1.26±0.04(Table VI)。
- 作者结论:作者称现有方案对字符级移除偏脆弱,需要新的防御,并可从分词和水印设计入手;水印伪造是后续方向。对固定防御,作者论证总存在可绕过的扰动策略,并用自适应复合攻击作了测试。