研究:生成式 AI 模型中的概率性复制与版权认定
Probabilistic "Copies" in Generative AI Models
作者认为现行版权法会采取功能标准:只有容易从输出中提取某一作品时,LLM 权重才算该作品的“副本”。
- 越来越多诉讼争议生成式 AI 的模型权重本身是否构成受版权保护作品的“副本”。模型以概率分布编码训练数据,输出常不确定,法规尚未回答这种编码是否本身就是副本。
- 作者先区分权重中的记忆(memorization)与输出中的提取(extraction),再把非确定性生成放进版权法对“副本”和固定(fixation)的既有规则中分析,并提出功能标准与可能的法律调整。
- 作者转述既有实证:Llama 3.1 70B 可近似生成整本 Harry Potter,语法相似度 99.2%;同一流程对 Sandman Slim 则未提取出近似正文。作者认为现行法律最可能只把容易提取的作品视为模型内的副本。
- 作者认为这一功能标准在政策上不令人满意,并建议修法;记忆比例依赖特定提取流程、模型与数据,提取失败不能证明没有记忆。本文未报告新的系统性实验。
Mark A. Lemley 与 A. Feder Cooper 在论文中讨论,已有研究显示可从部分大语言模型中提取某些受版权作品的逐字或近似逐字文本,说明模型权重以某种形式编码了这些作品。作者指出 LLM 并非以数据库格式存储信息,而是存储从训练数据中学到的 token 间统计关系,生成过程常是概率性的而非确定性的。版权法此前未处理过这种可能产生相似输出、也可能不产生的信息存储是否构成复制。作者认为,现行法下最可能的结果是采取功能性路径,即只有当某作品能被直接提取到输出中时,才认定模型包含该作品的复制,并指出这一结果在政策层面并不令人满意,提出了可能的修法方向。论文即将发表于 Berkeley Technology Law Journal。
深度解读
这篇论文试图解决什么问题?
现行版权法是否把可以概率生成受保护作品的模型权重本身视为该作品的“副本”。
现行版权法尚未解决:以概率方式编码、只有在某些条件下才会生成受保护作品的模型权重,本身是否构成该作品的“副本”(copy)。
- 场景:作者称超过一百起待决诉讼主张生成式 AI 侵权。大多质疑用受保护作品训练;越来越多的诉讼质疑输出与作品相同或相似。直到 2025 年 11 月,法院很少关注训练与输出之间的模型本身。德国法院认定 ChatGPT 包含歌词副本,英国法院认定 Stable Diffusion 本身不是 Getty 图像的侵权副本;作者称美国法院尚未直接面对这一问题。
- 为什么重要:若模型权重本身是法定意义上的副本,则制作模型、以及下载开放权重(如 Llama 3 系列)到服务器,即使从未生成侵权输出,也可能构成直接侵权。若权重只是可用于现场组装输出的信息、本身并非法律上可认的副本,则侵权可能只发生在输出。作者认为这一区分可能决定许多 LLM 的合法性。
- 技术与法律的错位:提取(extraction)是记忆(memorization)的可观察后果:训练数据在权重中留下足够强的印记,使得输出中可能复现该数据。但权重存储的是 token 之间的统计关系,生成常常是概率性而非确定性的。作者认为法规与判例对“可能会、也可能不会产出类似作品的信息存储本身是否构成副本”大体没有给出答案。
- 核心主张:作者认为版权法很可能采取功能进路:只有当从输出中提取某一作品是直接了当的(straightforward)时,才认定 LLM 包含该作品的副本。作者认为这一结果在政策上不令人满意,并提出可能的法律改变,但认为它是现行法律下最可能的结果。
有哪些相关研究?
论文把机器学习的记忆与提取研究,与版权法上的副本、固定和合理使用判例并置讨论。
作者把相关工作分为记忆与提取的技术文献、对隐喻的法律讨论,以及版权法上的副本、固定与侵权判例。
记忆与提取
- Feldman(2021)与 Shokri 等:前者讨论学习是否需要记忆,后者研究针对机器学习模型的成员推断攻击。作者用它们说明,记忆研究早于版权诉讼。
- Carlini 等、Lee 等、Nasr 等:Carlini 等从 LLM 和扩散模型中提取训练数据;Lee 等研究去重复使语言模型更好,作者称序列重复会提高记忆可能性;Nasr 等研究从生产语言模型可扩展地提取训练数据,并区分可发现的记忆与可提取的记忆。
- 近似与概率提取:Hayes 等用概率提取测量记忆;Ippolito 等认为逐字记忆定义过窄,阻止逐字生成会给出虚假的隐私感;Ahmed 等、Zhang 等以及作者自己的 Near-Verbatim 工作研究近似复现。Schwarzschild 等从对抗压缩角度重新理解记忆;Morris 等估计语言模型记忆了多少。
作者及同行的法律—技术文献
- Cooper 与 Grimmelmann(2025):向法律读者解释记忆,认为能生成书籍的长逐字片段,意味着这些部分被编码进模型;提取是记忆的症状而非原因。作者称本文把该说法放进概率性生成与“副本”定义的具体法律问题中。
- Lee、Cooper 与 Grimmelmann 的 Talkin’:把生成式 AI 供应链(训练、微调、对齐)写给法律读者,并讨论隐喻如何简化并歪曲技术问题。
- 压缩与反对意见:Delétang 等认为语言建模就是信息论意义上的压缩;Franceschelli 等讨论把基础模型训练视为数据压缩对版权的意义。作者点名 Larroyed 把记忆当成隐喻而非技术概念,Haviv 等认为提取过于依赖提示词,不足以证明权重中的记忆;作者不同意这两种读法。
版权法上的副本与模型
- 美国版权局与学者:版权局在 2025 年报告中认为,权重固定于有形介质,其中所含内容也是固定的副本;作者称这一说法没有判例支持。Gervais 等与 Yuvaraj 认为模型权重可以是副本。
- 模型本身是否为衍生作品:Andersen 与 Kadrey 案驳回了“只要用受保护作品训练,模型就是侵权衍生作品”的主张。作者认为这些训练案争议的是训练数据中被认可的中间副本及合理使用,并未回答模型内是否做成了副本。
- 输出与歌词:纽约时报诉微软等案中,法院拒绝驳回“输出与原作实质相似”的主张;GEMA 案认定歌词在输出中的复制构成侵权。作者引用第九巡回法院与第二巡回法院的实质相似性标准,说明侵权不要求完全相同。
基线与数据
本文没有设置新的实验基线。作者用作例证的是自己先前工作中的提取结果:对象为开放权重、非对话机器人模型,对照文本来自 Books3;作者称 Books3 约含 200,000 本电子书,已转成文本以供 LLM 训练。作者把本文定位为:不在隐喻层面解决模型是否为副本,而是说明记忆的概率性与非均匀性,使得“权重里有没有法定副本”必须按作品、模型与提取难度分别回答。
论文如何解决这个问题?
先把记忆与提取分开,再以功能标准判断权重何时才是法定副本。
整体思路分两步:Part I 说明权重如何编码信息、什么叫记忆、为什么存储与压缩的隐喻不足以回答版权问题;Part II 把这些机制放进美国版权法对“副本”和固定的规则,得出一条功能标准。
模型、解码与记忆
- 权重编码的是分布:语言模型由权重组成。训练把架构与数据集变成一组固定权重,参数化 token 序列上的概率分布。作者称这种“存储”不是数据库式的可寻址副本,且即使建模者通常也不知道某一信息留在哪里。
- 解码与模型分开:自回归 LLM 按上下文预测下一个 token。贪心解码每步取概率最高的 token,在固定分布下对同一提示词给出相同输出;随机采样则可以给出不同输出。作者认为变异来自解码而非权重本身在变化。对开放权重模型,用户可自选解码;ChatGPT、Claude 等系统还有强化学习、提示词处理和输出过滤,可以使已记忆内容不出现在用户看到的输出里。
- 记忆是分布的性质:作者把记忆定义为模型对训练数据中的特定序列赋予异常高的概率,使分布尖锐到某一序列占主导。近似变体(如标点差异)也算记忆。记忆不能直接观察,通常通过仔细选择的输出来研究。提取成功是记忆的证据;提取失败不能推出没有记忆。作者还区分有意的提取与非有意的回吐(regurgitation),并称后者的频率研究很少。
法律上的“副本”
- 法规没有直接回答:作者认为 1976 年版权法把“副本”定义为固定于有形介质、可以被感知、复制或传播的材料对象(material object),但没有规定权重这种编码是否算。作者认为二进制编码本身并不妨碍构成副本,难点在于权重不是作品的直接编码,而是可能用于生成它的统计关系。
- 非确定性实例:作者用既有判例讨论“并非每次都会出现”的材料是否已经固定。作者认为法院更关心某一表现能否被感知、复制或传递,而不是它是否每次都以同一形式出现。作者把这一分析用到生成式 AI:确定性解码可以稳定复现记忆文本;概率性解码只在部分运行中复现。
- 功能标准:作者认为,法院最可能问的是提取是否直接了当,而不是权重里有没有一份像文件那样的副本。若用短提示词和常规解码就能稳定得到整部或大部分作品,作者认为法院会把模型视为包含该作品的副本;若只有大量重复采样、特殊提示或系统级绕过才偶尔出现,作者认为法院较不可能把模型本身当成副本,即使输出仍可能侵权。
后果与政策
- 若认定为副本:制作模型和再次复制权重都可能是直接侵权,即使没有人请求侵权输出。作者认为这一副本仍可能构成合理使用,但合理使用是另一个问题,不能取代“是否存在副本”。
- 政策上的不满:作者认为功能标准会随着提取方法变强而移动:今天难以提取的作品,明天可能变得容易提取,从而追溯地改变模型的法律性质。作者建议考虑修改法律,使“模型是否为副本”不完全取决于当下的提取难度;具体改法文本以作者在 Part II.E 的讨论为准,作者并未把这些建议写成已经立法。
论文做了哪些实验?
本文没有新实验,只转述先前提取研究:同一流程能近似复现 Harry Potter,不能复现 Sandman Slim。
本文是法律论文,没有报告新的消融或系统性实验。下面的数字都是作者对既有提取研究的转述。
实验设置
- 被转述的模型:作者自己的例子使用 Llama 3.1 70B(开放权重、非对话机器人模型)。比较中还提到 Llama 与 Qwen、Llama 2 与 Llama 3、Llama 2 7B 与 Llama 2 70B,以及生产系统中的 ChatGPT 3.5、ChatGPT 4.1、Claude 3.7 Sonnet、Grok 3、Gemini 2.5 Pro。本文没有把这些模型列成一张统一的实验表。
- 文本与解码:对照来自 Books3。Figure 1 的提示词为“Mr. and Mrs. Durs”,用 Llama 3.1 70B 的贪心解码;作者称整书还可用 beam search 确定性解码。Figure 2 为用开篇短片段提示后生成的四段文本。Figure 3 用 Sandman Slim 开头几句作提示,并试过不同长度。
- 指标:Figure 2 报告语法相似度为 99.2%。作者没有在本文给出该指标的公式或评审模型。先前文献中的 0.5%–10%、3.6 bits-per-parameter 和约 10% 模型容量,作者都声明依赖特定提取流程、模型与数据。
- 样本量:本文写明同一提示词可运行数百或数千次,并写到“每 1000 次尝试中有 1 次生成训练数据”仍是记忆的强证据。没有报告本文自己的重复次数或人工一致性。
主结果
以下数字只能对应到正文对 Figure 2 及先前工作的转述,不是本文的新测量。
表格较宽,可左右滑动
对象 设置 结果 出处 Llama 3.1 70B Harry Potter 开篇短片段;贪心解码 / beam search 近似复现全书(304 页),语法相似度 99.2% Figure 1、Figure 2 Llama 3.1 70B 仅第一句;同一套代码 从 Ta-Nehisi Coates 的 A Case for Reparations 生成超过 10,000 词近似文本 正文 I.B Llama 3.1 70B Sandman Slim 开头几句,多种提示词长度 未产生近似正文的生成 Figure 3 - 作者的解读:Harry Potter 上每一步的最高概率 token 与原书一致,因此可以确定性复现全书;作者认为唯一合理的解释是训练数据中的记忆。Figure 2 的差异主要是格式以及英式与美式拼写。
- 对照:作者称 Sandman Slim 确在 Llama 的训练数据中,但同一流程没有复现近似正文。生成中出现了提示词未提供的人物名。作者认为这说明记忆并非均匀地覆盖全部训练数据。
- 测量的限制:作者称贪心解码会漏掉概率提取能找到的大量记忆;同一提示词重复采样时,一次 50 个 token 的逐字提取可能伴随数百次非逐字输出;近似提取说明先前方法仍低估了记忆。
跨模型与系统层
- 变异:作者称记忆的程度随模型家族(Llama 对 Qwen)、版本(Llama 2 对 Llama 3)、规模(Llama 2 7B 对 70B)和具体作品而变化。本文没有给出这些对比的数字表。
- 生产系统:作者转述 Nasr 等,让模型不断重复同一个词的方法使 ChatGPT 3.5 的部分输出泄露逐字训练数据。Ahmed 等从 ChatGPT 4.1 与 Claude 3.7 Sonnet 提取受保护书籍时使用了越狱,从 Grok 3 与 Gemini 2.5 Pro 提取时没有使用越狱;作者称这些情况都绕过了内容过滤。本文未报告具体提取比例。
- 总量估计:作者引用先前估计,约 0.5% 到 10% 的训练序列可能被记忆;Nasr 等称约 10% 的模型容量用于逐字记忆。Morris 等报告 GPT 系模型每参数 3.6 bits 的记忆容量,作者声明该数字来自与生产 LLM 显著不同的小模型训练设置,不宜当成对 LLM 的一般结论。
其他消融与分析
- 本文没有自己的消融表。作者只声明:改变提取方法、模型或关注的训练数据,都会改变记忆估计。
- 运行时的数值精度、KV cache、硬件以及混合专家(MoE)路由,可以改变哪个 token 排在最高;作者称在其测过的硬件上,Llama 3.1 70B 对 Harry Potter 的提取仍是确定的。
- 作者没有报告统计显著性检验,也没有报告本文新做的人工评估。
有什么可以进一步探索的点?
作者认为功能标准会随提取技术变化,并建议修改法律以减少这种不确定性。
作者指出的局限与后续方向
- 政策上不令人满意:摘要与 Part II.E 认为,“只有容易提取才算副本”是现行法律下最可能的结果,但作为政策不令人满意。作者建议考虑修改法律,使结论不完全取决于当下的提取是否直接了当。
- 测量不精确:Part I.B 认为,没有单一答案能说明记忆了多少、何时以及为何发生,部分原因是测量工具至多只是不精确的。新的提取方法会揭示旧方法看不到的材料,因此很难有把握地说某一训练样本肯定没有被记忆。
- 回吐研究很少:Part I.B 认为,非有意回吐的频率了解不够,文献中不常研究;作者点名的例外只有非常有限的受控研究设置。
- 科学上仍未解决的存储位置:Part I.A 认为,即使建模者通常也不知道模型保留了哪些信息、存在哪里;作者称这是仍在进行的科学问题,并提到机制可解释性研究。
实验覆盖范围
- 本文的例证:集中在 Llama 3.1 70B 上的三个文本例子:Harry Potter and the Sorcerer’s Stone、A Case for Reparations,以及未提取出近似正文的 Sandman Slim(Figure 1–3,Part I.B)。
- 作者声明的范围:技术讨论以自回归 LLM 为主;作者写明记忆也出现在图像与代码中,但本文不展开这些形态,并称扩散语言模型虽然增多,自回归仍是当前主流。
- 转述的生产系统:文中点名 ChatGPT 3.5、ChatGPT 4.1、Claude 3.7 Sonnet、Grok 3 与 Gemini 2.5 Pro 的既有提取结果,但没有在本文报告这些系统上的提取比例或查询次数。
- 法律论证:作者讨论了美国版权法上的副本与固定,并对照德国 GEMA 案与英国 Getty 案;作者称美国法院尚未直接判决模型本身是否为副本。
- 未报告的项:论文未报告本文新做的重复实验、统计显著性检验,也未报告与人工判定的一致性。
总结一下论文的主要内容
记忆使部分作品可以从权重中提取;作者认为现行法律只会把容易提取的那些当成模型内的副本。
Lemley 与 Cooper 认为,生成式模型的权重是否构成受保护作品的版权法“副本”,取决于该作品能否被直接了当地从输出中提取。
- 问题:超过一百起诉讼已经争议训练与输出。德国法院认定 ChatGPT 包含歌词副本,英国法院认定 Stable Diffusion 本身不是 Getty 图像的侵权副本。若美国法把权重本身当成副本,制作或下载模型即使不生成侵权输出也可能侵权。
- 技术要点:记忆是训练完成后权重所定义的分布性质:某些训练序列的概率高到占主导。提取是这一性质在输出中的表现,失败不能证明没有记忆。解码可以是确定的,也可以是概率的;部署系统还可以用过滤挡住已记忆的内容。
- 例证:Llama 3.1 70B 用开篇短片段即可近似生成 304 页的 Harry Potter,与 Books3 正文的语法相似度为 99.2%(Figure 2);仅用第一句,同一流程从 Coates 的文章生成超过 10,000 词。同一流程对确在训练数据中的 Sandman Slim 没有产生近似正文(Figure 3)。
- 法律结论:作者认为法规没有直接回答,法院最可能采用功能标准:容易、稳定地提取整部或大部分作品时,模型包含该作品的副本;只有大量重复采样或特殊手段才偶尔出现时,模型本身较不可能被认定为副本。作者认为这一标准会随提取技术改变,政策上不令人满意,并建议修改法律,但认为它仍是现行法律下最可能的结果。