跳到正文
原文
论文追踪· arXiv:2605.07481· Jonathan Hong Jin Ng, Anh Tu Ngo, Anupam Chattopadhyay·本站收录 · 原文发表

Vaporizer:研究者用改写类攻击破解大语言模型输出水印方案

Vaporizer: Breaking Watermarking Schemes for Large Language Model Outputs

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

Vaporizer 用释义、翻译和词法攻击三套水印,Publicly Detectable 去除率均为 100.0%。

威胁模型攻击者改写已加水印的 LLM 输出,用词法、往返翻译和释义去掉水印并保住语义。

问题
水印被用来在 LLM 输出中嵌入不可见标记、核验作者,并被宣称稳健且可落地。问题是词法改写、往返翻译和神经释义能否去掉这些标记,同时保住文本大意。
方法
攻击已生成的水印文本,不改水印算法本身。词法包括同义词、删除和换序;MarianMT 做英–德、英–西、英–法往返翻译;释义用 BART 与 Pegasus。用各方案检测器判断是否去掉,并用 BERT、复杂度、可读性和语法错误看质量。
实验与结果
100 条提示上,Publicly Detectable 去除率均为 100.0%。Pegasus 对 Provable Robust 为 23.0%,对 SynthID 为 14.0%。作者称去掉水印通常会损及文本质量。
局限与可以继续做的
作者称 100 条提示可能覆盖不到真实 LLM 输出的全部变异,并建议做抗释义的自适应水印、把信号嵌进更深语义、以及可调强度。实验未报告生成水印文本的底层模型名,也未报告重复次数。
实验设置100 ChatGPT-generated writing prompts · success rate、Z-score 等
威胁模型
攻击者改写已加水印的 LLM 输出,用词法、往返翻译和释义去掉水印并保住语义。论文未写白盒或黑盒。Publicly Detectable 保留签名初始比特,只改其余部分。Provable Robust 以 Z-score 低于 0、SynthID 以 g-score 低于 0.5 记为去掉;密码方案以水印被去除计。
基准
100 ChatGPT-generated writing prompts
指标
success rateZ-scoreg-scoreBERT ScoreGunning Fog IndexFlesch Reading Easegrammatical error count
AI 导读研究者提出 Vaporizer,用多种改写文本攻击测试主流大语言模型输出水印方案的鲁棒性,这些方案自称鲁棒、可扩展且达到生产级。攻击策略包括词汇替换、机器翻译和神经改写,在保持文本语义不变的前提下改动文本;效果以水印是否被成功去除和语义是否保留两项指标衡量,语义保留通过 BERT 分数、文本复杂度、语法错误和 Flesch Reading Ease 指数评估。结果显示不同水印模型的效果差异较大,但共同的结论是只要投入合理成本就能去除水印。研究据此指出现有 LLM 水印系统的强弱项,并提出改进其安全性的方向。

研究者提出 Vaporizer,用多种改写文本攻击测试主流大语言模型输出水印方案的鲁棒性,这些方案自称鲁棒、可扩展且达到生产级。攻击策略包括词汇替换、机器翻译和神经改写,在保持文本语义不变的前提下改动文本;效果以水印是否被成功去除和语义是否保留两项指标衡量,语义保留通过 BERT 分数、文本复杂度、语法错误和 Flesch Reading Ease 指数评估。结果显示不同水印模型的效果差异较大,但共同的结论是只要投入合理成本就能去除水印。研究据此指出现有 LLM 水印系统的强弱项,并提出改进其安全性的方向。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    三套宣称稳健的 LLM 输出水印,能否被保持语义的改写去掉。

    声称稳健的 LLM 输出水印,能否被保持语义的改写去掉。

    • 场景:作者称 LLM 已用于助手、内容与代码生成,并带来内容真实性、抄袭检测和模型归属问题;水印被建议用来在生成文本中嵌入不可见标记以核验作者。
    • 现有不足:作者称检测仍易受保持语义完整性的文本操纵破坏。所选三套方案被宣称稳健、可扩展且可实际使用,但作者认为统计模式和精确 token 结构都可被改写打乱。
    • 做法:标题中的 Vaporizer 用词法变换、机器翻译和神经释义攻击这三套水印,同时看水印是否去除、语义是否保住。作者称这是对主流方案脆弱性的首次全面展示。
    • 威胁模型:
      • 目标:去掉水印,并保持文本的一般含义。两个标准一起用。
      • 知识:论文未使用 white-box 或 black-box。攻击作用在已生成的水印文本上;实验方调用各方案的检测过程记分。
      • 能力:同义词替换、删词、换序、MarianMT 往返翻译、BART 与 Pegasus 释义,也可逐步加大修改比例。Publicly Detectable 保留生成签名的初始片段 character bits,只改其余 character bits。
      • 受害对象:Provable Robust Watermarking、Publicly Detectable Watermarking、SynthID 标记过的 LLM 输出。论文未说明底层语言模型名称。
  2. 有哪些相关研究?

    讨论集中在三套被评水印:绿名单偏置、公开签名与锦标赛采样。

    Related Work 主要拆开三套被评方案;引言另引用语义改写与综述。

    统计绿名单水印

    • Kirchenbauer et al. (2023):生成时把 token 分成 green 与 red,抬高 green token 的采样概率,并讨论低熵与高熵上下文的自适应处理。Table 1 将其标为 Token Partitioning、统计型。
    • Zhao et al. (2024):把词表划成 green list 与 red list,提高 green token 比例,用 z-score 相对无水印基线做检测;相关工作写阈值通常接近 0。作者称它对轻微扰动稳健,但仍会被重分配 token 频率的语义保持变换影响。本文的 Provable Robust Watermarking 即此方案,Table 1 亦写作 Unigram Watermarking。

    密码学与锦标赛采样

    • Fairoze et al. (2025):用哈希与纠错码把数字签名编进文本,验证者无需原模型或私钥,凭公开参数核验。作者称它依赖精确 token 结构,释义或翻译即可破坏签名恢复。此即 Publicly Detectable Watermarking。
    • SynthID(Dathathri et al., 2024):Google DeepMind 的锦标赛采样。每个位置抽多个候选,用密钥播种的确定性评分选出最高分;检测重算平均分,相关工作写阈值通常约 0.5。作者称它依赖重复结构,易受激进释义和 token 级打乱影响。
    • Christ et al. (2023):Table 1 列为 Undetectable Watermark、密码型。正文未讨论其做法,也未纳入实验。

    语义改写与综述

    • Hou et al. (2024):引言引用该文,称保持语义的文本操纵可以破坏水印。未展开其 SemStamp 方法,也未当作实验基线。
    • Liu et al. (2024):文本水印综述,引言用来说明水印被用于核验作者。未作实验对比。

    基线与数据:实验没有复现其他攻击作基线。对照是同一提示的水印文本,以及关闭水印后的无水印文本。数据是 ChatGPT 生成的 100 条写作提示,不是文中命名的公开基准。

    作者把本文定位为对这三套代表方案的系统攻击评测:作者称这是首次全面展示统计型与密码型主流水印都可被语义保持攻击去掉,并同时量化去除效果与文本质量。引言称无法评测全部水印方法,故选这三套作代表。

  3. 论文如何解决这个问题?

    Vaporizer 改写水印文本,用原检测器看标记是否还在、语义是否保住。

    Vaporizer 不改水印算法,而是对已嵌入水印的文本做三类改写,再用各方案自己的检测器和一组质量指标,看标记是否还在、大意是否还在。

    对象与成功定义

    • 三套方案:Provable Robust 用词表绿名单偏置,检测为 z-score;Publicly Detectable 用哈希与纠错码编码可公开验证的签名;SynthID 用密钥播种的锦标赛采样,检测为 token 平均分。
    • 判定:Provable Robust 以 Z-score 低于 0 为去除成功;SynthID 以 g-score 低于 0.5 为成功。Publicly Detectable 以水印被去掉为成功,方法节未另给数值阈值;其检测定义是能否恢复并核验签名。
    • 签名片段:对 Publicly Detectable,生成签名所用的初始片段 character bits 保持不动,攻击只作用在其余 character bits。
    • 对照:同一模型框架关闭水印,得到无水印输出。论文未给出该框架的模型名。

    三类攻击

    • 词法:WordNet 同义词替换,仅内容词(名词、动词、形容词、副词),替换率上限 30%。删除用随机抽样,最多去掉 10% token,并侧重功能词。另有随机交换任意两 token,以及相邻词交换;相邻交换限制在相同句法类别的词对。结果表中的 Swap 未再区分这两种交换。
    • 翻译:MarianMT,语言对为英–法、英–德、英–西,先译出再译回英语。batch size 为 8,beam size 为 4。
    • 释义:BART(facebook/bart-large-cnn)的 beam size 为 4、temperature 为 0.7;另用 Pegasus 释义模型。两者最大序列长度 512 token,长文本切成重叠块。Figure 1 与结果表另有 Simple Paraphrase,方法节未说明其实现。
    • 增量:对词法变换逐步加大修改,并记录检测分。附录也有 Simple Paraphrase 的增量曲线;正文称翻译的增量曲线未画出。

    质量记录与运行

    • 检测记录:比较原水印文本与攻击后文本的检测分、成功率,以及检测分随修改比例的变化。
    • 质量指标:DeBERTa-XLarge-MNLI 计算 BERT F1;复杂度为 Gunning Fog Index;可读性为 Flesch Reading Ease;语法错误用 LanguageTool。百分比变化以原水印文本为参照,故水印文本的 BERT Score 为 1.00。
    • 翻译附加指标:正文称翻译还结合 BERT 与 ROUGE 看充分性与流畅性,结果表未报告 ROUGE。
    • 数据与机器:ChatGPT 生成 100 条写作提示,覆盖创意写作、概念解释、描述和观点等。代码为 Python 3.11,PyTorch 与 CUDA,GPU 为 NVIDIA RTX 4070 Super(12GB VRAM)。作者称参数按他们所认为的效果与质量平衡设定,论文未报告参数搜索。
  4. 论文做了哪些实验?

    Publicly Detectable 为 100.0%,Pegasus 对 Provable Robust 为 23.0%。

    实验设置

    • 被测对象:Provable Robust Watermarking、SynthID、Publicly Detectable Watermarking。论文未说明生成文本的底层语言模型。
    • 数据:ChatGPT 生成的 100 条写作提示。增量质量图注写明 100 个测试样本,误差带为 95% 置信区间。论文未报告重复次数,正文也未给出置信区间端点。
    • 攻击与对照:同义词替换、删除、Swap、Simple Paraphrase、BART、Pegasus,以及英–德、英–西、英–法往返翻译。对照为水印文本和关闭水印的文本。
    • 去除指标:Provable Robust 为 Z-score 低于 0 的样本比例;SynthID 为 g-score 低于 0.5 的样本比例。Publicly Detectable 的 Table 6 只给去除成功率。
    • 质量指标:BERT Score、Gunning Fog、Flesch Reading Ease、LanguageTool 语法错误数。变化百分比相对原水印文本。
    • 判定方式:无 LLM 裁判,也无人工一致性。成功由各方案检测器判定。

    主结果

    据 Table 2、Table 4、Table 6。成功率为水印去除比例。参照均值是水印文本的 mean Z-score 或 mean g-score。

    | 方案 | Pegasus | BART | 同义词替换 | 翻译(德/西/法) | 水印参照均值 | | Provable Robust | 23.0% | 2.0% | 1.0% | 5.0% / 5.0% / 4.0% | 8.43(Z) | | SynthID | 14.0% | 3.0% | 11.0% | 2.0% / 2.0% / 3.0% | 0.563(g) | | Publicly Detectable | 100.0% | 100.0% | 100.0% | 100.0% / 100.0% / 100.0% | 未报告 |

    • 作者称 Provable Robust 抵抗最强:Pegasus 去除率 23.0%,mean Z-score 0.93,中位数 1.21;无水印文本 mean Z-score 为 -0.52(Table 2)。同表中同义词替换为 1.0%,BART 为 2.0%,并非所有释义都高。
    • SynthID 上 Pegasus 为 14.0%,但 mean g-score 仍为 0.538,高于 0.5;无水印均值为 0.501(Table 4)。同义词替换 11.0%、Swap 9.0%,高于作者所称翻译的 2–3%(表中为 2.0%、2.0%、3.0%)。
    • Table 6 列出的 Publicly Detectable 攻击均为 100.0%。作者称很少的修改就会完全去掉水印(正文对 Figure 17、Figure 18 的描述)。

    文本质量

    • Provable Robust(Table 3):翻译的 BERT 变化为 -4.27%、-4.20%、-5.17%,复杂度为 +10.25%、+20.67%、+23.03%。作者称翻译 BERT 降幅 4–5%、复杂度上升 10–23%。Pegasus 的 BERT 为 0.87(-12.61%),语法错误均值 0.03(-99.13%)。Simple Paraphrase 的 BERT 为 0.83(-16.79%),错误变化 +1004.36%;同义词替换错误变化 +797.67%。
    • SynthID(Table 5):Pegasus 的 BERT 为 0.872(-12.8%),错误变化 -97.36%。翻译 BERT 变化为 -6.12%、-5.84%、-6.52%。同义词替换错误 +974.45%,Simple Paraphrase 错误 +960.35%。
    • Publicly Detectable(Table 7):去除率都是 100.0%,质量差很大。Swap 的 BERT 为 0.908(-9.25%)。德语往返翻译复杂度 +315.00%,可读性均值 -288.14(-571.93%),BERT 0.799(-20.1%)。BART、Pegasus 的 BERT 变化为 -14.3%、-16.2%。该方案水印文本自身错误均值为 20.45,Table 3、Table 5 的对应值为 3.44 与 2.27。

    增量修改

    Figure 5–8、Figure 12–15、Figure 19–22 分别对应三套方案上的词交换、删除、同义词和 Simple Paraphrase,画出复杂度、BERT、可读性与语法错误。曲线形状以下列作者描述为准。

    • 作者称 Provable Robust 的 BERT 随修改强度近线性下降;同义词替换的质量曲线最陡,删除更好地保住语义连贯(正文对 Figure 5–8)。
    • 作者称 SynthID 的抵抗介于另两套之间:修改 5–10% 文本时语义保持已受影响,检测也开始变差;同义词替换在修改强度超过 15% 后语法错误上升很快,去除收益只是中等(正文对 Figure 12–15)。
    • 作者称 Publicly Detectable 在很少修改时检测就失败(Figure 17、Figure 18);交换和删除的可读性曲线较平,翻译造成很大的可读性下降,且翻译增量图未画出(正文对 Figure 19–22)。

    其他消融与分析

    • 无水印对照:Provable Robust 的 mean Z-score 为 -0.52(Table 2);SynthID 的 mean g-score 为 0.501(Table 4)。Publicly Detectable 无水印文本的复杂度 7.05(-33.93%)、可读性 75.25(+23.24%)、错误 8.71(-57.41%)(Table 7)。
    • 作者称运行时间较短:Provable Robust 约每样本 3 分钟,另两套约每样本 6 分钟(Section 5)。论文未给测量表。
    • 论文未做攻击参数的系统消融;替换率、删除率、beam、temperature 为固定设置。
    • 正文与附录图号不完全一致:正文把 Provable Robust 的 Z-score 分布称作 Figure 3、增量检测称作 Figure 4,附录图注相反。SynthID 的 Figure 9–11 也有同类错位。附录 Figure 8 图注写 Simple Replacement,正文称为 Simple Paraphrase。

    作者称成功去掉水印时,语义保持、可读性或语法正确性总会变差。表内也有单项变好:Provable Robust 上 Pegasus 的语法错误 -99.13%、可读性 +6.43%,但 BERT 仍为 -12.61%(Table 3)。神经释义也不一律高:Provable Robust 上 BART 仅 2.0%(Table 2)。

  5. 有什么可以进一步探索的点?

    作者称 100 条提示或盖不住真实变异,并建议抗释义与深层嵌入。

    作者指出的局限与后续方向

    • 实验只用 100 条文本提示,作者称可能覆盖不到真实 LLM 输出的全部变异;作者同时称已用足够长的文本作弥补(Section 5)。
    • 后续应研究能检测并防御释义攻击的自适应水印(Section 5)。
    • 水印应嵌入更深的概念区域,而不是表层文本特征(Section 5)。Conclusion 再次提出把信号嵌进深层语义结构。
    • 水印强度应可调,以便按应用平衡安全与文本质量(Section 5)。
    • 作者认为质量下降与检测分变弱可以一起用于混合检测(Section 5)。Conclusion 写利用质量度量的混合方法。
    • 作者称未来水印需要经受住神经释义,才能保证内容归属(Conclusion)。

    实验覆盖范围

    • 被评水印为 Provable Robust Watermarking、Publicly Detectable Watermarking、SynthID。引言称无法评测全部水印方法,故以这三套为代表。每套有关闭水印的对照。
    • 数据为 ChatGPT 生成的 100 条写作提示。增量图注写 100 个测试样本和 95% 置信区间。论文未报告重复次数,也未给出置信区间端点。
    • 攻击包括同义词替换(上限 30%)、删除(上限 10%)、词交换、Simple / BART / Pegasus 释义,以及英–德、英–西、英–法 MarianMT 往返翻译。增量曲线覆盖词交换、删除、同义词和 Simple Paraphrase。
    • 去除判定用方案自带检测器:Z-score 低于 0,或 g-score 低于 0.5。Publicly Detectable 的结果表只报告去除率,未报告检测分数。论文未报告人工评估。
    • 论文未报告生成水印文本的底层语言模型名称,也未报告 Simple Paraphrase 的实现。方法节提到 ROUGE,结果表未给出数值。
  6. 总结一下论文的主要内容

    Publicly Detectable 去除率 100.0%,统计方案上 Pegasus 最高 23.0%。

    Vaporizer 用保持语义的文本改写,检查三套 LLM 输出水印还能不能被检测到。

    • 问题:水印被用来标记模型生成文本并核验归属,且被宣称稳健、可扩展、可落地。作者要看词法改动、往返翻译和神经释义能否去掉标记,同时不改掉大意。
    • 做法:攻击已生成的水印文本。词法含同义词、删除和换序;MarianMT 在英–德、英–西、英–法之间往返;释义用 BART 与 Pegasus。Provable Robust 以 Z-score 低于 0 为去掉,SynthID 以 g-score 低于 0.5 为去掉。Publicly Detectable 保留签名所用的初始片段比特。质量用 BERT、Gunning Fog、Flesch 和语法错误。
    • 结果:100 条提示上,Table 6 中 Publicly Detectable 的各攻击去除率均为 100.0%。Provable Robust 的水印文本 mean Z-score 为 8.43,Pegasus 攻击后为 0.93,去除率 23.0%;同义词替换为 1.0%(Table 2)。SynthID 上 Pegasus 为 14.0%,mean g-score 0.538,仍高于 0.5(Table 4)。Pegasus 的 BERT 相对变化为 -12.61%(Provable Robust,Table 3)和 -12.8%(SynthID,Table 5)。
    • 作者结论:作者称三套方案都能以合理努力去掉水印;分布偏置比签名结构更难打掉,神经释义、尤其 Pegasus,是主要威胁。作者认为去除与质量下降绑在一起,检测可以同时看质量指标;水印应嵌到更深的语义,并针对释义来设计。
阅读原文arxiv.org