跳到正文
原文
论文追踪· arXiv:2604.10893· Shuhao Zhang, Yuli Chen, Jiale Han, Bo Cheng, Jiabao Ma·本站收录 · 原文发表

研究者提出 Adaptive Stealing 自适应窃取水印攻击方法

Beyond A Fixed Seal: Adaptive Stealing Watermark in Large Language Models

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

作者提出AS,用10,000条样本擦除三种水印,作者称AUC<0.55。

威胁模型攻击者仅有有限水印文本Dw、助手模型LMatt与无限非水印文本Dn,目标是对带水印的LMvic做spoofing或scrubbing。

问题
固定策略的窃取水印算法把多种上下文视角合成一个印章,忽略被盗信息分布不均,也跟不上生成时上下文的变化。这类攻击会削弱内容归属与滥用追溯所依赖的水印检测。
方法
Adaptive Stealing按上下文token的位置激活构造多个印章,每步用动态生成相关性、水印兼容性与生成优先级选一个印章,再按攻击方向修改logits。
实验与结果
在OPT-2.7b与Llama3-8b上,对KGW、SynthID、Unbiased做擦除时,作者称AS的AUC<0.55;伪造时Table 2的AS AUC高于WS。未知配置下Table 3的AS伪造AUC为0.843。
局限与可以继续做的
作者指出AS的生成延迟约为WS的1.6倍,只评了两种受害模型和三种水印,多语言效果待测,且与WS相同的印象施加方式对文本质量损伤较大。
实验设置OPT-2.7b、Llama3-8b · C4 (realnews-like subset)、Dolly (CW subset) 等 · AUC、TPR@1% 等
威胁模型
攻击者仅有有限水印文本Dw、助手模型LMatt与无限非水印文本Dn,目标是对带水印的LMvic做spoofing或scrubbing。限制为Unknown Parameters(不知密钥K与水印超参)、Limited Queries,以及Inaccessible Detection(不能访问检测接口)。
被测模型
OPT-2.7bLlama3-8b
基准
C4 (realnews-like subset)Dolly (CW subset)HarmHarmfulQAdvBench
指标
AUCTPR@1%WCSPPL
AI 导读研究者提出 Adaptive Stealing(AS)自适应窃取水印算法,用于从受害 LLM 生成的水印文本中提取水印信息并构造针对性对抗攻击。该方法通过 Position-Based Seal Construction 与 Adaptive Selection 两个模块,基于上下文有序 token 的不同激活状态定义多个攻击视角,并在攻击时按水印兼容性、生成优先级和动态生成相关性选择最优视角。实验显示,在相同实验条件下 AS 对目标水印的窃取效率显著提升。作者据此指出需要更鲁棒的 LLM 水印来抵御此类攻击,并公开了代码。

研究者提出 Adaptive Stealing(AS)自适应窃取水印算法,用于从受害 LLM 生成的水印文本中提取水印信息并构造针对性对抗攻击。该方法通过 Position-Based Seal Construction 与 Adaptive Selection 两个模块,基于上下文有序 token 的不同激活状态定义多个攻击视角,并在攻击时按水印兼容性、生成优先级和动态生成相关性选择最优视角。实验显示,在相同实验条件下 AS 对目标水印的窃取效率显著提升。作者据此指出需要更鲁棒的 LLM 水印来抵御此类攻击,并公开了代码。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    固定印章跟不上生成上下文,作者提出可逐步选印章的Adaptive Stealing。

    固定印章无法随生成上下文调整,因而难以针对未知的水印位置规则实施窃取。

    • 场景:作者称水印用于识别LLM生成文本,并支撑内容归属、滥用追溯与法律追责。窃取水印算法(stealing watermark algorithm, SWA)从受害模型的水印文本提取信息,再做spoofing(把文本伪造成带水印)或scrubbing(擦除水印以逃避检测)。
    • 现有不足:Sadasivan et al. (2023)用181个常见词的2-gram频率,伪造针对KGW LeftHash的印章;Watermark Stealing(WS, Jovanovic et al., 2024)把多种上下文视角静态加权成一个固定印章。作者称攻击者不知道受害水印激活哪些上下文位置,固定印章跟不上生成过程。
    • 假设:印章生成Impression时只使用ctx的一部分。作者推断,与真实印章更相符的变换,会和生成出的水印token相关更高,因此窃取应是逐步决策,而不是静态复现。
    • 方法:提出Adaptive Stealing(AS),包含Position-Based Seal Construction与Adaptive Selection。作者称目的是通过理解攻击来加强防御。
    • 威胁模型:
      • 目标:从带水印wm的受害模型LMvic窃取信息,构造spoofing或scrubbing。
      • 知识:Unknown Parameters,密钥K与wm的全部超参数未知。
      • 能力:只有有限水印文本Dw、助手模型LMatt和无限非水印文本Dn;Limited Queries,可查询LMvic,但条数受费用与时间限制。
      • 检测接口:Inaccessible Detection,不能访问wm的检测接口。
  2. 有哪些相关研究?

    生成式水印分三类嵌入;现有SWA多伪造固定印章,主基线为WS。

    相关工作按水印嵌入、水印攻击和SWA三组组织。

    生成式LLM水印

    • 三类嵌入:logits操纵(Kirchenbauer et al., 2023;Fu et al., 2024;Liu et al., 2024;Zhao et al., 2024等)、概率分布调整(Hu et al., 2024;Chen et al., 2025b;Feng et al., 2025)、采样策略修改(Dathathri et al., 2024;Kuditipudi et al., 2024;Christ et al., 2024)。
    • 部署特点:作者称这类生成式水印无需重训练,部署时资源消耗小。引言还提到Fraser et al. (2025)、Liu et al. (2025)等关于检测LLM文本的工作,并称文本越逼真,常规检测越无效。

    擦除与伪造

    • scrubbing:Zhang et al. (2023)、Krishna et al. (2023)、Chang et al. (2025)用文本改写去水印;用LLM改写时,Jovanovic et al. (2024)利用水印信息做更有针对性的擦除。
    • spoofing:Sadasivan et al. (2023)与Jovanovic et al. (2024)必须借助水印信息才能伪造。

    Stealing Watermark Algorithm

    • 固定印章:Sadasivan et al. (2023)、Jovanovic et al. (2024)、Zhang et al. (2024)主要针对KGW变体伪造一个固定印章。作者称单一静态印章无法适应不同水印实现或生成上下文。
    • 威胁讨论:Liu et al. (2024, 2025)、Gu et al. (2024)、Pan et al. (2025)被用来说明spoofing与scrubbing威胁水印可靠性。论文对此只作引用,没有逐篇批评。

    基线与数据

    • 基线方法:主实验基线是论文所称state-of-the-art的WS。附录D还运行了CWS、WRA、MIP;De-Mark因使用对抗提示而非常规水印文本,作者称无法公平比较。
    • 基准/数据集:受害水印文本来自C4的realnews-like子集;评测提示来自Dolly的CW子集,以及由HarmfulQ与AdvBench合并的Harm。

    作者把本文定位为:不再把多个视角静态合成一个印章,而是按位置构造多种攻击视角,并在每一步选择印章。

  3. 论文如何解决这个问题?

    AS按位置激活构造多个印章,再以三项准则逐步选择并修改logits。

    Adaptive Stealing(AS)把传统SWA的“伪造一个固定印章再施加印象”改成三步:构造多个印章、每步选择、用所选印象修改logits。Figure 2给出该流程。

    水印与传统SWA

    • 生成与嵌入:自回归LM由前文得到logits,再经softmax与解码得到下一token。印章Seal_θ(ctx, K)产生印象;ctx是待生成token之前的|ctx|个token,K是私钥。印象可通过改logits、改概率或改采样介入生成。
    • 检测:检测器模拟印章,计算token级分数并聚合成Watermark Confidence Score(WCS)。KGW的WCS是绿词z统计量;SynthID是各生成器分数的均值;Unbiased是水印概率的累加。
    • 传统窃取:攻击者统计Dw与Dn中“token T出现在ctx之后”的次数。变换H(·)把不同ctx映到同一键,以缓解低频ctx。伪造印章按ctx给token打分;施加方向决定spoofing或scrubbing。

    Position-Based Seal Construction

    • 攻击视角:H(·)被作者视为对“印章如何处理ctx”的假设。因为攻击者不知道哪些位置被激活,需要多个H(·)。
    • 有序变换:H^o(ctx, no)保留位置。no是满足0≤no<2^|ctx|的整数,转成长度|ctx|的二进制标签;标签为0的位置换成通配符。论文举例:三个token的ctx、no=4(二进制100)时只保留最左token。
    • 分数:固定一种变换后,由Dw、Dn估计条件分布,并沿用WS的分数。比值不小于1时 S(T,k)=1/cmin(p̂w(T|k)/p̂n(T|k),c),否则为0。c把分数限制到[0,1]。词表上的分数拼成该视角的印象,同一变换的全部印象构成一个伪造印章,共2^|ctx|个。

    Adaptive Selection

    • 动机:作者认为像WS那样直接加权多个印章,会引入错误印章的噪声。每步选ω最高的印章。
    • 三项准则:DGR只保留当前步概率最高的k个token,Vk=topK(V, p, k)。WC用Dw上的经验分布p̂w(T|ctx)代替未知的真实水印条件分布。GP把该印章的印象归一成概率,表示对token的相对优先级。
    • 选择分数: ω(no,ctx)=∑T∈ Vkp̂w(T|ctx)·(im̂noT)/(∑T′im̂noT′)。求和范围对应DGR,p̂w对应WC,归一化印象对应GP。

    施加印象与本文设定

    • Logits Modification:沿用WS,把助手模型的logits改为l̂ = l + δ_att · im̂。δ_att>0为spoofing,δ_att<0为scrubbing。
    • 默认参数:攻击侧|ctx|=3,因而有8个印章;c=2;Adaptive Selection的k=128。spoofing用δ_att=4、LMatt为Qwen2.5-7b;scrubbing用δ_att=-4、LMatt为Dipper。每个提示生成200个token,只做一次攻击,取数据集平均。
    • WS在本文中的配置:主实验的WS只用Full印章,权重(w1, w2, w3)=(1, 0, 0),不是WS原文的(2, 1, 0.5)。附录C.4称Partial印章主要针对SelfHash,加入后会降低对本文几种水印的伪造效果。
  4. 论文做了哪些实验?

    两种受害模型、三种水印上,Dipper+AS擦除AUC不超过0.55,伪造AUC高于WS。

    实验设置

    • 受害模型与水印:LMvic为OPT-2.7b与Llama3-8b。Markllm实现三种水印:KGW(改logits;γ=0.5,LeftHash,δ=2)、SynthID(改采样;m=30)、Unbiased(改概率分布)。主实验未写明受害水印的|ctx|。
    • 数据:Dw取C4的realnews-like子集,每条以前30个token为提示、生成400个token,|Dw|=10,000;Dn等量且无水印。作者称10k低于其他SWA的样本要求。评测提示为Dolly的CW子集与Harm。论文未报告这两套提示的条数。
    • 基线与助手:主基线为只用Full印章的WS。默认伪造助手为Qwen2.5-7b,擦除助手为Dipper。附录另测CWS、WRA、MIP。
    • 指标与判定:WCS、AUC、TPR@1%。擦除越低越好,伪造越高越好。随机分类的AUC为0.50、TPR@1%为0.01。检测用各水印自己的检测器,不是LLM裁判。PPL由Llama2-13b计算。
    • 重复:附录B.3写明上述条件下只做一次攻击,以数据集平均为结果。硬件为两块Tesla-V100。

    主结果

    Dolly上的AUC如下。擦除列来自Table 1,且都先经Dipper;伪造列来自Table 2。

    表格较宽,可左右滑动

    水印与受害模型Dipper+WS擦除Dipper+AS擦除WS伪造AS伪造
    KGW,OPT-2.7b0.690.470.740.91
    KGW,Llama3-8b0.610.370.740.89
    SynthID,OPT-2.7b0.570.480.610.68
    SynthID,Llama3-8b0.620.540.590.63
    Unbiased,OPT-2.7b0.580.470.710.80
    Unbiased,Llama3-8b0.590.500.680.76
    • 作者称无论水印、数据集或受害模型如何变化,AS的攻击效果都高于WS,伪造AUC提升为0.04–0.17。Table 2中SynthID的AS伪造AUC为0.63–0.73,是三种水印里最低的一组。
    • 擦除:作者称AS的AUC始终低于0.55,WS最低为0.55。Table 1中Dipper单独处理的AUC均超过0.65;Dipper+AS最低为0.37。SynthID、Llama3-8b、Harm一格为0.55,并不低于0.55。
    • Harm上方向相同。例如KGW、OPT-2.7b:Dipper+AS擦除AUC为0.50,AS伪造AUC为0.92;SynthID、OPT-2.7b:二者分别为0.44与0.73(Table 1、Table 2)。

    文本质量

    • Figure 3在KGW伪造上改变δ_att。图中纵轴为AUC、横轴为Perplexity;图注写的是WCS。图上没有可读的端点数值。
    • 作者称δ_att升高会提高AUC并抬高PPL;在AUC高于0.75且PPL相近时,AS的AUC仍高于WS。作者称增益来自对Dw的利用,而不是文本质量下降。论文未报告具体PPL。

    印章匹配与未知配置

    • Table 3在Llama3-8b、Dolly上,用no为0–7的伪造印章攻击六种KGW配置。配置匹配时单印章最高:受害|ctx|=1且Left时,no=1的AUC为0.997。受害|ctx|=4且Left时,AS仅为0.613,AVE为0.532。
    • 等权AVE相对单印章提升有限。Unknown是六种受害配置的平均,AS为0.843,AVE为0.765。作者称需要多样视角,再逐步选择,而不是静态平均。

    样本量与助手模型

    • Figure 4攻击KGW,|Dw|最小为100。图上没有标出各点WCS。作者称AS的WCS始终高于WS,且AS用2,000条即可达到WS用10,000条的伪造效果。
    • Table 6:LMatt与LMvic词表相同时更强。OPT-2.7b受害、OPT-1.3b助手时,Dolly上AS的AUC为1.00、TPR@1%为0.92;换成Qwen2.5-7b时为0.91与0.36。作者称相同词表会促进窃取,且相同词表下AS的TPR@1%大多高于0.9。

    其他消融与分析

    • Table 4(KGW伪造WCS):去掉GP后,OPT-2.7b、Dolly从2.698降到0.358;去掉WC降到2.454。Llama3-8b、Harm上去掉DGR为2.725,高于AS的2.648。
    • Table 5:DGR相对非DGR的逐样本胜负分并不总为正;top64、OPT-2.7b、Dolly为-0.020,top32、Llama3-8b、Harm为-0.069。
    • Table 7:Qwen2.5-7b作助手、500条、每条200 token时,|ctx|=3的AS为16.92秒、WS为10.85秒;|ctx|=4时分别为16.34秒与11.91秒。
    • Table 8:Llama3-8b、Qwen2.5-7b上,只用Full时KGW Dolly伪造AUC为0.74;Full+Partial+Empty为0.70。
    • Figure 5:作者称受害KGW的|ctx|为1–4时,AS伪造效果高于WS,且低|ctx|或与攻击设定|ctx|=3相同时更容易被伪造。Figure 6:同一Dipper擦除下,作者称|ctx|增大后KGW鲁棒性下降;图中无可读数值。
    • 附录D:CWS伪造AUC最高0.537(Table 9);WRA只微调了OPT-1.3b,AUC最高0.580;MIP擦除AUC为0.855–0.982(Table 10),高于Table 1中的AS/WS,即擦除更弱。
  5. 有什么可以进一步探索的点?

    作者指出AS延迟约为WS的1.6倍,且只评两种模型、三种水印与英文数据。

    作者指出的局限与后续方向

    • 延迟:在10,000条受害水印文本上,AS相对WS的性能提升带来约1.6×生成延迟(Limitations)。
    • 模型与水印数量:因时间与资源限制,只评了OPT-2.7b、Llama3-8b两个受害模型,以及KGW、SynthID、Unbiased三种水印(Limitations)。
    • 语言:AS的多语言攻击效果仍待测试;本文只做英文数据(Limitations)。
    • 印象施加:AS与WS用同样方式施加印象,虽能完成攻击,但对文本质量损伤较大;后续可以改进印象施加方法(Limitations)。

    实验覆盖范围

    • 主结果的受害模型为OPT-2.7b与Llama3-8b,水印为KGW、SynthID、Unbiased;提示集为Dolly的CW子集与Harm(Section 4.2,Table 1–2)。
    • 主设定的助手模型为Qwen2.5-7b(伪造)与Dipper(擦除);Table 6另把OPT-1.3b、OPT-2.7b、Gemma2-2b、Llama3-8b用作LMatt。
    • Dw为C4 realnews-like上的10,000条;检测指标为各水印自己的WCS、AUC、TPR@1%,PPL用Llama2-13b。附录A.2写明SelfHash KGW因OPT-2.7b生成200 token超过300秒而未评测。
    • 附录D报告了CWS、WRA与MIP的结果;De-Mark因查询协议不同未比较。附录B.3写明每次为单次攻击的数据集平均。
    • 论文未报告Dolly CW与Harm的提示条数,也未报告重复次数,以及检测结果与人工判定的一致性。
  6. 总结一下论文的主要内容

    AS用逐步选印章做水印伪造与擦除,作者称其攻击效果高于固定策略的WS。

    AS是一种窃取生成式LLM水印的算法,用来在密钥和检测接口不可用时伪造或擦除水印。

    • 问题:已有SWA把统计到的印象合成一个固定印章。作者称这忽略了被盗信息分布不均,也不能随生成上下文改变对token位置的使用。
    • 方法:Position-Based Seal Construction按位置激活掩码构造2^|ctx|个印章;Adaptive Selection每步用DGR、WC、GP选择印章;再以δ_att缩放印象并修改助手模型的logits。主实验攻击侧|ctx|=3、c=2、k=128。
    • 主结果:受害模型为OPT-2.7b与Llama3-8b,水印为KGW、SynthID、Unbiased,|Dw|=10,000,基线是只用Full印章的WS。Dolly上,KGW、Llama3-8b的Dipper+AS擦除AUC为0.37;作者称擦除AUC低于0.55,Table 1另有一格为0.55。伪造方面,作者称AUC提升0.04–0.17;KGW、OPT-2.7b、Dolly上AS为0.91,WS为0.74。
    • 其他结果:未知水印配置下AS伪造AUC为0.843(Table 3)。作者称AS用2,000条水印文本即可达到WS用10,000条的伪造效果(Figure 4)。词表相同的助手模型会得到更高的伪造指标(Table 6)。
    • 作者结论:作者称现有水印会泄露相当一部分信息,AS可作为评估水印的工具,并认为水印设计仍需要能承受此类攻击的研究。Limitations同时写明,该提升伴随约1.6×延迟,且沿用WS的印象施加方式会损伤文本质量。
阅读原文arxiv.org