DITTO:通过知识蒸馏伪造水印 LLM 的作者归属
DITTO: A Spoofing Attack Framework on Watermarked LLMs via Knowledge Distillation
研究者提出DITTO框架,利用水印放射性从黑盒教师模型提取并向攻击模型注入水印信号,实现跨架构与采样水印的高保真仿冒。
攻击者处于 practical black-box setting,既无法访问目标模型(victim model)的 logits,也不了解其水印方案(watermarking scheme)。
- 现有大语言模型水印假设特定水印能够证明特定模型的归属,但这种归属验证机制面临伪造威胁。攻击者可能通过仿冒受信任目标模型的水印生成不良文本,导致检测器将文本错误归因于受害者。
- DITTO框架在黑盒条件下通过知识蒸馏将目标模型的水印迁移至学生模型,对比微调前后模型的输出对数差计算全局与前缀局部偏差以提取水印信号向量,并在推理阶段将加权放大的信号注入未加水印模型的对数中。
- 在MMW Bookreport上仿冒Llama3.2-3b时,DITTO在FPR=0.1%下取得0.97的TPR(Table 2);在Dolly CW上对SynthID取得0.87的TPR(Table 3),跨架构攻击GPT-OSS 20B取得0.42的TPR(Table 6)。
- 作者指出攻击效果受水印继承保真度制约且对模型大小与架构敏感,论文未对其进行详尽优化,亦未提出具体防御机制;实验覆盖了Llama系列、GPT-OSS 20B与Phi-4 14B,水印测试了KGW与SynthID。
- 威胁模型
- 攻击者处于 practical black-box setting,既无法访问目标模型(victim model)的 logits,也不了解其水印方案(watermarking scheme)。攻击目标是窃取并伪造目标模型的独特水印信号(watermark spoofing),使攻击者的任意外部模型生成的文本被检测器误归因(misattribution)为目标模型所生成。
- 被测模型
- Llama3.1-8BLlama3.2-3BGPT-OSS 20BPhi-4 14B
- 基准
- MMW BookreportDolly CW
- 指标
- TPR@FPRmedian p-valueppl
研究者提出 DITTO,一个在黑盒条件下伪造水印 LLM 作者归属的攻击框架,让恶意模型生成的文本被检测器误判为来自可信的目标模型,从而把虚假信息嫁祸给可信来源。DITTO 把水印放射性(即在下游模型微调中意外继承水印信号的现象)从可检测特征改造成攻击载体:先让水印目标模型生成训练数据,通过知识蒸馏让开源学生模型继承水印,再比较训练前后模型的 logits 差异提取出水印信号 EWS,最后在推理时以缩放参数 α 将该信号注入攻击模型的 logits。跨模型家族实验中,用 Llama 3.2 3B 和 1B 也能复制 GPT-OSS 20B 与 Phi-4 14B 的水印。
推荐理由论文把水印放射性从溯源特征改造成伪造工具,显示仅凭水印存在无法证明模型归属,对水印溯源方案的设计有直接参考。
深度解读
这篇论文试图解决什么问题?
作者称当前大模型水印依赖特定水印证明特定模型归属的假设存在脆弱性,论文提出利用水印放射性的黑盒仿冒攻击框架DITTO。
这篇论文试图解决大语言模型水印易受仿冒攻击(watermark spoofing)并导致错误归因(misattribution)的安全隐患。
- 场景与重要性:大语言模型在工业与公共讨论中广泛应用,验证生成文本的来源并确定具体归属模型对追责和防范滥用至关重要。监管法规要求清晰的内容溯源,而当前方案通常假设检测到的特定水印能够证明特定模型的归属。
- 现有防御与攻击的不足:以往研究主要集中于通过清洗攻击(scrubbing attack)去除水印以逃避检测,较少关注水印仿冒;而防御系统普遍基于“检测到水印即代表真实归属”的单一存在性检测逻辑。
- 核心观察与假设:模型在微调时学习带水印的教师模型生成文本会不自觉继承其统计模式,即水印放射性(watermark radioactivity)。作者假设这一原本用于溯源审计的现象可被逆向转化为实施黑盒水印仿冒的攻击载体。
- 论文提出的方案:论文提出了基于知识蒸馏的水印仿冒攻击框架 DITTO(Distilled watermark Imitation of a Targeted Teacher's Outputs),通过蒸馏和对数差值分析提取目标模型的水印偏差,使未加水印的外部模型能够生成带有目标水印的文本。
- 威胁模型:
- 攻击者目标:伪造特定目标模型(victim model)的独特水印信号,使第三方或本地模型生成的文本被检测器误归因于受信任目标。
- 攻击者知识:处于实用的黑盒(black-box)设定下,攻击者无法获取目标模型的输出对数(logits),亦不知道目标模型采用的水印方案与元数据。
- 攻击者能力:攻击者仅能通过查询获取目标模型生成的大规模合成文本数据集,并在本地训练白盒开源学生模型及攻击模型。
- 受害系统:部署了水印生成与对应水印检测器的大语言模型服务系统。
有哪些相关研究?
相关研究涵盖绿红名单与采样式水印、水印窃取与清洗攻击、以及水印放射性,作者称此前工作鲜少以仿冒攻击为核心。
大语言模型水印及安全攻防研究主要沿水印机制、对抗攻击与水印放射性三个方向展开。
大语言模型水印机制
- 绿红名单方案:Kirchenbauer et al. (2023) 提出绿红名单范式,通过划分词表并在采样时向伪随机绿名单施加对数偏置;Lee et al. (2024)、Yoo et al. (2023)、Cai et al. (2025)、Guo et al. (2024) 与 Lu et al. (2024) 分别拓展至代码生成、多比特识别、语义平衡与基于熵的检测。
- 基于采样的无失真水印:Dathathri et al. (2024) 提出锦标赛采样(tournament sampling)以提供非失真保证;Kuditipudi et al. (2024) 通过修改采样过程嵌入水印且不改变模型输出分布。
水印攻击研究
- 水印窃取与规则推断:Jovanović et al. (2024) 发现黑盒查询足以学到水印规则;Zhang et al. (2024) 称混合整数规划无需检测器即可还原 KGW 绿名单;Chen et al. (2025) 估计 n-gram 参数并给出分布接近度界限。
- 水印清洗攻击:Wu and Chandrasekaran (2024b) 推断词元颜色并替换绿名单词元;Huang et al. (2025) 将清洗建模为受限优化并蒸馏代理分布;Pang et al. (2024) 指出旨在增强鲁棒性的设计选择可能带来新的脆弱性折衷。
水印放射性
- 放射性发现与消除:Sander et al. (2024, 2025) 发现下游模型在微调时会继承生成数据的统计模式并用于溯源审计;Pan et al. (2025) 指出对手可通过改写或推理时中和在很大程度上抹除这些放射性信号。
对比基线与使用基准
基线方法与评测基准:对比基线包括原始加水印模型上限、JSV(Jovanović et al., 2024)、De-Mark(Chen et al., 2025,含 graybox 与 blackbox 设置)以及仅执行 SFT 的被动蒸馏基线 distill-only;评测基准使用开源指令微调数据集 Dolly-15k(Dolly CW)以及 MarkMyWords(MMW)基准中的 Bookreport 长文本生成任务。
作者对本文定位:作者指出以往研究大多聚焦于窃取与清洗攻击,水印仿冒往往仅被视作衍生能力或局限于特定语境,本文采取“仿冒优先(spoofing-first)”视角,将原本用于检测溯源的水印放射性转化为不依赖具体水印方案的黑盒仿冒攻击手段。
论文如何解决这个问题?
DITTO框架通过知识蒸馏继承黑盒目标模型水印,分析微调前后对数差提取水印信号,并在推理时动态注入攻击模型对数中。
论文提出了 DITTO(Distilled watermark Imitation of a Targeted Teacher’s Outputs) 框架,通过知识蒸馏使开源学生模型继承黑盒目标模型的水印放射性,再通过对数差值分析分离出水印信号,并在推理生成阶段将其动态注入外部攻击模型中。
水印继承
- 构建合成数据集:使用被攻击的加水印目标模型生成大规模文本数据集。数据集中每个样本均隐含目标模型特定的统计水印模式。
- 监督微调迁移:选用一个白盒开源学生模型,在该数据集上执行标准监督微调(SFT)训练得到训练后的学生模型。微调采用 LoRA 技术,训练 3 个 epoch。训练后学生模型的输出分布在训练上下文中逼近目标模型的加水印分布,从而继承水印信号。
水印提取
- 全局与局部偏差计算:为隔离水印引起的系统性偏差并消除特定上下文知识漂移,对比微调后模型与微调前原始模型的对数输出。首先在全数据集上计算上下文无关的全局偏差;随后针对以特定 n-gram 前缀结尾的上下文,计算局部偏差。
- 构建提取水印信号:综合全局偏差与局部偏差构成提取水印信号向量 EWS(c):
EWS(c) = δglobal + ∑p ∈ prefixes(c) w(p) · δp 该式将全局偏差与按训练数据中前缀出现频率加权的局部偏差相加,使高频出现的统计信号具有更大权重。
仿冒注入攻击
- 推理时实时对数修改:在攻击模型进行文本生成的推理阶段,根据当前上下文检索对应的提取水印信号向量,并将其直接注入攻击模型的原始对数中:
l′MO(c) = lMO(c) + α · EWS(c) 该式通过缩放参数 α 控制注入强度,将修改后的对数输入 softmax 函数进行后续词元采样,使生成的文本携带目标模型的特定水印特征。
- 攻击参数与部署配置:主实验中缩放强度参数 α 固定设置为 4.5,分析实验中在 2.5 至 5.0 之间按 0.5 步长变动。攻击模型采用与学生模型相同的骨干架构。
论文做了哪些实验?
实验在MMW与Dolly上评估了DITTO对KGW与SynthID的仿冒效果,结果显示在多种模型与跨架构设置下均取得高TPR。
实验设置
- 被测模型:目标受害者模型为 Llama3.1-8B Instruct、Llama3.2-3B Instruct、GPT-OSS 20B 与 Phi-4 14B;学生模型与攻击模型为 Llama3.2-3B Instruct 与 Llama3.2-1B Instruct;文本困惑度由 Llama2-14B 测定。
- 数据集与规模:使用 Dolly-15k(15,000 条问答对,评测写作任务 Dolly CW)以及 MarkMyWords(MMW)基准的 Bookreport 长文本生成任务;微调数据集为 10,000 条样本,保留 100 条样本作为评估测试集。
- 基线方法:原始加水印模型(Watermarked,上限基线)、JSV、De-Mark(graybox 与 blackbox)、被动蒸馏基线(distill-only)及未加水印基线(non-wm)。
- 指标定义:固定低假阳性率下的真阳性率 TPR@FPR(FPR 设定为 10%、1%、0.1% 与 5%)、水印检测强度的中位数 p-value,以及由 Llama2-14B 计算的生成文本困惑度 ppl。
- 水印配置与判定:KGW 水印注入参数 δ=3、γ=0.5,检测阈值 z=4.0;同时测试了采样水印 SynthID。
主结果
表格较宽,可左右滑动
目标模型与方法 MMW TPR@1% MMW [email protected]% Dolly TPR@1% Dolly [email protected]% Dolly ppl Llama3.1-8b (Watermarked) 0.75 0.65 0.82 0.70 6.34 + JSV 0.10 0.04 0.26 0.11 6.62 + De-Mark (black) 0.94 0.73 0.82 0.70 3.93 + DITTO (Ours) 0.70 0.51 0.93 0.85 3.73 Llama3.2-3b (Watermarked) 0.79 0.74 0.68 0.61 6.34 + De-Mark (black) 0.96 0.90 0.90 0.80 4.74 + DITTO (Ours) 0.99 0.97 0.86 0.75 2.95 (注:据 Table 2,表格省略了 De-Mark (gray) 以及 Llama3.2-3b 上的 JSV;目标模型 Llama3.1-8b 由 Llama3.2-3b 仿冒,Llama3.2-3b 由 Llama3.2-1b 仿冒)
- 检测器欺骗效果:作者称 DITTO 能够通过注入仿冒水印信号成功欺骗水印检测器,在多个指标上超越或接近黑盒 De-Mark 基线与真实加水印上限。
- 模型规模影响:作者指出当骨干模型尺寸较小时,DITTO 的仿冒效果更为明显,例如在仿冒 Llama3.2-3b 时取得了更高的 TPR。
对采样水印 SynthID 的仿冒评测
- 测试内容:在 Dolly CW 数据集上评测 DITTO 对基于采样的无失真水印 SynthID 的仿冒能力(Table 3),并探究参数 α 对强度与质量的影响(Figure 4)。
- 实验结果:以 Llama3.1-8b 为受害者时,DITTO 在 FPR=0.1% 下 TPR 为 0.80,ppl 为 2.79(真实加水印模型 ppl 为 2.80);以 Llama3.2-3b 为受害者时,DITTO 在 FPR=0.1% 下 TPR 为 0.87,ppl 为 2.88(真实加水印模型 ppl 为 6.30,Table 3)。随 α 增加,p 值下降而困惑度未见持续上升趋势(Figure 4)。
- 作者解读:作者称 DITTO 不局限于特定水印算法,对绿名单(KGW)和采样式(SynthID)水印均具有普适仿冒能力;且生成的文本困惑度低于原始加水印模型,作者认为这表明 DITTO 缓解了原始加水印过程可能引起的文本质量下降。
与被动蒸馏对比及提取必要性
- 测试内容:在两组数据集上对比 DITTO 与未进行显式水印提取的被动微调基线 distill-only(Table 5)。
- 实验结果:在 Dolly CW 上针对 KGW 水印,Llama3.2-1b 攻击模型的 FPR=0.1% TPR 从 distill-only 的 0.41 提升至 DITTO 的 0.75;针对 SynthID 水印,TPR 从 0.32 提升至 0.81(Table 5)。
- 作者解读:作者称单纯依靠知识蒸馏无法捕获目标水印的全部强度,显式提取并重新注入水印信号是实现高保真仿冒的关键。
跨模型家族的受害者泛化性
- 测试内容:在 Dolly CW 上测试攻击模型(Llama 3.2 3B 和 1B)仿冒异构模型家族受害者(GPT-OSS 20B 与 Phi-4 14B)的水印(Table 6)。
- 实验结果:Llama 3.2 3B 攻击模型仿冒 GPT-OSS 20B 在 FPR=0.1% 下 TPR 为 0.42,仿冒 Phi-4 14B 为 0.35;Llama 3.2 1B 仿冒二者在 FPR=0.1% 下 TPR 分别为 0.35 与 0.42;未加水印基线在对应 FPR 下的 TPR 仅为 0.01 与 0.03(Table 6)。
- 作者解读:作者称 DITTO 在受害者与攻击者来自完全不同模型家族时依然能够复制目标水印,表明攻击不受架构相似性约束。
其他消融与分析
- 训练集规模 DT 变化:在 Dolly CW 上,数据集规模从 4k、6k、8k 增至 10k 时,FPR=0.1% 下的 TPR 从 0.41 升至 0.44、0.55、0.51,困惑度 ppl 分别为 2.63、2.91、2.80、4.18(Table 4)。
- 缩放参数 α(仿冒 8b):在 MMW Bookreport 上,α 从 2.5 增至 5.0 时,中位数 p 值从 6.83E-02 降至 1.83E-03,困惑度在 3.27 至 4.54 间波动(Table 7)。
- 缩放参数 α(仿冒 3b):在 MMW Bookreport 上,α 从 2.5 增至 5.0 时,中位数 p 值从 2.04E-06 降至 7.00E-20,困惑度从 3.79 降至 2.29(Table 7)。
- 负面结果与例外:在 MMW Bookreport 的 SynthID 实验中,Llama3.2-1b 攻击模型使用 DITTO 时在 FPR=0.1% 下的 TPR 为 0.01(低于 distill-only 的 0.10,Table 5),论文未对该下降给出解释。
有什么可以进一步探索的点?
作者指出攻击受继承保真度制约且未提供防御方案,未来需探索信号中和防御机制与真实性验证技术。
作者指出的局限与后续方向
- 水印继承保真度受制约:DITTO 的攻击效果受到水印继承保真度的制约,作者发现该保真度对模型大小和架构较为敏感(Limitations)。
- 未穷尽优化模型与架构变量:论文主要重点在于展示攻击的可行性,未对模型大小和架构等变量进行详尽优化(Limitations)。
- 系统性测绘放射性边界条件:未来研究需系统性测绘水印放射性的边界条件(Limitations)。
- 未提出具体防御机制:本研究属于对抗性研究,侧重于揭示脆弱性以提供基线,未提出具体的防御方案(Limitations)。
- 探索在蒸馏中中和泄漏信号:未来研究的关键一步是探索如何在蒸馏过程中扭曲或中和这些泄漏信号,以构建更具弹性的内容保护系统(Limitations)。
- 转向真实性验证与密码学绑定:呼吁技术范式从单纯的存在性检测转向能够区分真实水印与仿冒水印的真实性验证及密码学模型绑定(Conclusion 与 Ethical Considerations)。
实验覆盖范围
- 被测模型范围:目标受害者模型涵盖 Llama3.1-8B、Llama3.2-3B、GPT-OSS 20B 与 Phi-4 14B;学生及攻击模型涵盖 Llama3.2-3B 与 Llama3.2-1B;困惑度评测使用 Llama2-14B。
- 水印方案范围:评测覆盖了基于绿红名单的 KGW 水印(δ=3, γ=0.5)与基于采样的 SynthID 水印。
- 评测数据集与样本量:训练与评估使用了 Dolly-15k(Dolly CW)以及 MarkMyWords(MMW)的 Bookreport 任务,微调训练集为 10,000 条,保留 100 条样本作为评估测试集。
- 对比基线范围:对比基线覆盖了加水印模型上限、JSV、De-Mark(graybox 与 blackbox 设置)以及仅做 SFT 的被动蒸馏 distill-only 基线。
- 论文未报告的信息:论文未报告不同提示词的重复运行方差,亦未报告生成文本质量的人工评审结果。
总结一下论文的主要内容
论文针对大模型水印归属假设的脆弱性,提出黑盒仿冒攻击DITTO,实现跨架构和采样方案的高检测率与低困惑度仿冒。
- 研究定位:本研究是一项针对大语言模型水印归属可信度的红队安全评估工作,提出了利用知识蒸馏与水印放射性的黑盒水印仿冒攻击框架 DITTO。
- 核心问题:现有大模型水印部署普遍依赖“包含特定水印即可证明特定模型生成”的基本假设,但这一假设面临仿冒威胁;攻击者可伪造目标来源的水印使有害文本被误归因于受信任系统。
- 方法要点:攻击者在黑盒条件下通过受害模型生成的合成数据微调开源学生模型以继承水印放射性,随后通过微调前后对数差计算全局与前缀加权局部偏差提取水印信号向量,并在推理阶段将放大的信号直接注入攻击模型对数中完成伪造。
- 主要实验结果:
- 在 MMW Bookreport 上仿冒 Llama3.2-3b 时,DITTO 在严格的 FPR=0.1% 条件下取得 0.97 的 TPR,中位数 p 值达 5.48E-17,困惑度为 2.44(Table 2)。
- 在 Dolly CW 数据集上仿冒基于采样的 SynthID 水印时,以 Llama3.2-3b 为受害者取得 0.87 的 TPR(FPR=0.1%),困惑度为 2.88(Table 3)。
- 跨模型家族攻击异构受害者时,Llama 3.2 3B 攻击模型仿冒 GPT-OSS 20B 与 Phi-4 14B 在 FPR=0.1% 下分别取得 0.42 与 0.35 的 TPR(Table 6)。
- 增大攻击缩放参数 α 可提高统计显著性(降低 p 值),而生成文本困惑度未出现单调上升(Figure 3、Table 7)。
- 结论与启示:作者认为单纯检测水印信号的存在性已不再足以作为可靠的来源证明,AI 安全社区需推动技术范式变革,从单向存在性检测迈向抗仿冒的真实性验证与密码学模型绑定机制。