跳到正文
原文
论文追踪· arXiv:2607.12649· A. Feder Cooper, Marika Swanberg, Jamie Hayes, Lea Duesterwald, Christopher De Sa, Georgios Kaissis, Daniel E. Ho, Mark A. Lemley, Percy Liang·本站收录 · 原文发表

研究者提出可提取记忆的匹配比较检验方法

Extractable Memorization From First Principles

论文速读

分析/可解释性

据论文 PDF 整理(AI 生成),以原文为准

Cooper 等人用匹配对照校准可抽取记忆:Wikipedia 上 OLMo 2 32B 的 10-token 逐字生成约 24% 是假阳性;Llama 3.1 70B 在书籍上的普查阈值低至 10^{-27}。

问题
可抽取记忆的既有研究有两类效度问题:短序列或泄漏提示会高估抽取;模型也能复现未逐字训练的文本,又被用来否定抽取作为记忆证据。有效声称需要生成概率高到超过可预测性基线。
方法
用匹配的非训练序列作对照。群体序列用 conformal test,按选定假阳性率校准阈值;单篇文档用 census,以匹配非训练文档的最高分(去污染后)设 τ(book)。并要求在现实查询预算内近乎确定地生成,才称 extractable memorization。
实验与结果
OLMo 2 32B 在 Wikipedia 上,10-token greedy 成员生成率 7.54%、认证 FPR 1.84%,约 24% 的表观抽取与非成员被标记的比率相当;50-token 时非成员地板接近 0。Llama 3.1 70B 书籍普查阈值约 10^{-27} 到 10^{-21},可支持记忆声称但远低于可采样概率。
局限与可以继续做的
校准依赖对照是真实非成员且分布匹配,作者称实践中只能尽力做到;短候选本身带不了有效记忆声称。保证是边际 FPR,不控制多重检验的 FDR。普查阈值是实测最大值而非认证水平。
实验设置OLMo 2 32B base、OLMo 2 32B Instruct 等 · Wikipedia (Jan 2021–Dec 2023 members; Wikipedia 2024 controls)、Books3 paired with post-cutoff books by the same author (The Da Vinci Code, The Hunger Games, We Were Eight Years in Power, Killer Instinct) · verbatim generation rate、certified FPR αN 等
模型
OLMo 2 32B baseOLMo 2 32B InstructOLMo 2 7BOLMo 2 13BLlama 3.1 70BLlama 3.1 baseLlama 2 13B
基准
Wikipedia (Jan 2021–Dec 2023 members; Wikipedia 2024 controls)Books3 paired with post-cutoff books by the same author (The Da Vinci Code, The Hunger Games, We Were Eight Years in Power, Killer Instinct)
指标
verbatim generation ratecertified FPR αNcalibrated memorization rate M̂coverageconformal p-value
AI 导读全文 348 字

A. Feder Cooper、Percy Liang 等研究者提出用匹配比较来判定语言模型的可提取记忆,即同时测量训练序列与可比非训练序列的生成概率,以非训练序列的概率作为可预测性基线,超过基线才算记忆证据。方法包含两种形式:在序列从总体抽样时使用按选定假阳性率校准的 conformal 检验,以及针对单文档、以匹配的非训练文档校准的普查。在 Wikipedia 上,OLMo 2 32B 复现非训练 10-token 后缀的频率约为训练后缀的 24%,这部分反映的是假阳性而非记忆;在书籍数据上,Llama 3.1 70B 的校准普查阈值低至 10^(-27),可为任何可行采样预算都难以提取的序列提供记忆证据。作者据此把可提取记忆重新定义为同时满足有效记忆主张与在现实预算内近乎确定生成。

深度解读

6 个问题,约 9,800 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    有效的可抽取记忆声称需要生成概率超过匹配非训练序列给出的可预测性基线。

    何时模型生成训练序列才构成有效的记忆(memorization)证据,而不只是一般可预测性。

    • 场景与重要性:作者称 LLM 会在提示下复现训练序列,领域把这种 eliciting 称为 training-data extraction,并当作模型“记住”这些序列的可观察信号。作者认为其涉及隐私与版权,因此可抽取记忆受到特别关注。
    • 两类效度问题:作者认为一些工作高估抽取,例如对短到无法区分记忆与可预测性的序列声称抽取,或用直接泄漏目标序列的提示引出输出(Chang et al., 2023; Karamolegkou et al., 2023; Wei et al., 2025; Liu et al., 2026)。另一些工作则因模型也能逐字复现训练中未逐字包含的真实文本,而认为抽取不是可靠的记忆证据(Liu et al., 2025; Morris et al., 2025)。作者认为两边都忽略了有效抽取声称的要求。
    • 核心观察:生成训练序列本身不够。要算作抽取,模型必须以高到足以表明记忆的概率生成它。何谓“足够高”需要 matched comparison:比较训练序列与可比非训练序列的生成概率。非训练序列不可能被记住,其概率是可预测性基线;超过该基线才是记忆证据。
    • 本文提出:把匹配比较形式化为两种校准。(1)序列从群体抽样时,用 conformal test 把记忆声称校准到选定的 false-positive rate;(2)没有群体假阳性率可控制的固定文档,用 census 对照一篇匹配的非训练文档校准。作者据此把 extractable memorization 收紧为:既有来自匹配比较的有效记忆声称,又在现实查询预算内近乎确定地生成。
    • 极端例子说明比较为何必要:Figure 1 的 “Repeat after me”(parrot)提示下,OLMo 2 32B Instruct 对训练与非训练 Wikipedia 的逐字复现率相等(各 N=3000),作者称该比较不携带记忆信号。作者还复现 Schwarzschild et al. (2024) 在 Llama 2 13B 上对一句广为引用的语句的成功,并在训练截止日期之后的类似长度非训练语句上同样成功;作者认为这并不意味着前者未被记住,只说明该流程在训练数据上的成功本身不足以支持记忆声称。
  2. 有哪些相关研究?

    抽取是记忆的更窄现象;本文把 verify 做成由匹配非成员校准的决策,而不只是非正式健全性检查。

    抽取与记忆的定义

    • Carlini et al. (2021)、Lee et al. (2022)——把引出训练序列称为 training-data extraction,并当作记忆的可观察信号。Carlini et al. (2021) 指出并非所有被记住的序列都可抽取;Nasr et al. (2023; 2025) 讨论序列可编码在模型中却无法在给定提示下可靠复现。
    • Carlini et al. (2021) 已识别 parrot 提示:模型只是复述提示中已有的文本。作者称他们观察到没有简单改写其抽取定义能解决该情形,其办法是禁止这类提示。
    • Shokri et al. (2017)、Carlini et al. (2019; 2022)——记忆也可以用抽取以外的方式研究。本文聚焦 extractable memorization。

    抽取流程及其非正式匹配比较

    • Lee et al. (2022)、Carlini et al. (2023) 的 discoverable extraction 是研究与模型发布报告中的标准指标(Grattafiori et al., 2024; Gemini Team et al., 2024)。Hayes et al. (2025b)、Cooper et al. (2026a) 用 teacher forcing 在 top-k 解码下精确计算生成概率,即 probabilistic extraction。
    • Schwarzschild et al. (2024) 搜索对抗优化的提示,若提示短于目标则视为抽取成功。Cooper et al. (2026b) 估计 near-verbatim 抽取风险,并用解码约束的 beam search 以约 20 次采样的代价抽取低概率序列。Nasr et al. (2023; 2025) 同样被作者列为 Definition 2.1 的实例。
    • 作者称先前工作即使做了匹配比较,也只当作非正式健全性检查(Lee et al., 2022; Carlini et al., 2023; Hayes et al., 2025b; Pappu et al., 2025; Schwarzschild et al., 2024; Cooper et al., 2026a;b),没有把非训练数据的生成概率变成校准阈值。

    成员关系与成员推断

    • Lee et al. (2022)、Zhang et al. (2023)——精确序列成员关系对语言模型很脆:近重复在功能上是成员。作者采用与 Cooper et al. (2026b) 类似的分辨率:固定长度 ℓ、不相似度 d 与容差 ε。
    • Carlini et al. (2022) 的 “Membership Inference Attacks From First Principles” 被作者当作从第一性原理重访问题的参照。附录讨论 reference-model MIA(含 LiRA、RMIA,Zarifzadeh et al., 2024)与 Ye et al. (2022) 的 Attack R:可交换性放在模型侧,参考模型在不含候选的数据上训练;LiRA 对分数拟合 Gaussian 而非用经验分位数。

    基线方法与基准

    • 基线方法:discoverable extraction(greedy,分数为 0/1);probabilistic extraction(top-k,k=40,teacher forcing);滑动窗口逐字概率抽取(Cooper et al., 2026a);near-verbatim 变体(最大 Levenshtein 距离 5 token,下界)。
    • 基准/数据集:公开训练语料上的 Wikipedia(成员为 2021 年 1 月至 2023 年 12 月训练截止之间的条目,对照为 2024 年条目,OLMo et al., 2025);Books3 中的书与同作者、晚于 Llama 3.1 训练截止的书配对。

    作者把本文定位为:把匹配比较形式化为可校准假阳性率的 conformal test 与单文档 census,并据此收紧 extractable memorization 的定义。作者认为 Liu et al. (2025)、Morris et al. (2025) 把抽取视为不可靠记忆证据的结论过强,因其未处理近重复成员对所谓非成员的污染,且一种流程上的阴性结果不能否定另一种校准声称。

  3. 论文如何解决这个问题?

    用同一抽取流程给候选与匹配非成员打分,超过由对照校准的阈值才声称记忆。

    整体思路是把抽取流程的最后一步 verify 做成 matched comparison:非成员分数是可预测性基线,候选分数必须超过由这些对照校准的阈值,才能把生成概率称为抽取概率。

    抽取流程与成员分辨率

    • 生成概率:自回归模型 θ 在解码策略 ϕ 下,长度为 ℓ 的续写 y 的生成概率是各步条件概率之积,记为 qθ,ϕ(y | p)。基础策略对整个词表采样;top-k 每步只保留概率最高的 k 个 token 再归一化采样。greedy 是确定性的,唯一贪心续写概率为 1,其余为 0。
    • 成员分辨率:训练数据为固定集合 D。对候选 s,Bε(s) 是与 s 的不相似度 d 不超过 ε 的长度 ℓ 序列集合;membershipε(s) 在 D 与该球相交时为 1。ε=0 恢复逐字成员。非成员比“从训练中留出”更强:球内任何序列都不得有训练支持。
    • Definition 2.1:抽取流程是固定元组 (θ, ϕ, fP, score, verify)。fP 把每个候选映到有限提示类(自然前缀、全部自然前缀、对抗搜索空间等)。规范分数是 qθ,ϕ(Bε(s) | p) 或其近似;聚合规则把各提示分数合成候选分数 score(s),越高越容易生成。verify 根据分数要么声称已记住,要么不做声称。

    群体上的 conformal test

    • 零假设:候选 s 是匹配非成员,即 membershipε(s)=0,且与对照来自同一分布。匹配有两层:对照与候选以同样方式选取(来源、格式、长度及其他会影响分数的特征相同,只是对照已知为非成员);同一套 θ、ϕ、fP、score 打分,使零假设下分数可交换。
    • 校准:N 个对照 W1,…,WN 来自只含非成员的 OUT。conformal p-value 为 pb(s)=(1+|{i: score(Wi)≥score(s)}|)/(N+1)。选定目标 FPR α 后,K=⌊α(N+1)⌋,可认证水平 αN=K/(N+1)≤α。降序第 K 大的对照分数为阈值 ταN;仅当 score(s)>ταN(严格大于,并列不算通过)才拒绝。有限样本能认证的最小非零水平是 1/(N+1);α 更小则 K=0,检验永不拒绝。
    • Proposition 1:在抽取流程独立于对照与候选分数、且新鲜非成员与 N 个对照分数可交换时,Pr[pb(S)≤α]≤αN≤α。保证是边际的,对每个候选成立,本身不约束 familywise error rate 或 false discovery rate。无并列时第一处不等号为等式;并列只会使检验更保守。
    • 声称的含义:在容差 ε 下超过阈值,认证的是候选的 near-verbatim 成员身份,不是模型恰好记住 s 本身。未超过阈值不做记忆声称,也不是反对记忆的证据:该提示、解码或分数可能没有把编码浮出表面。检验约束假阳性,不估计模型中的全部潜在记忆。任何与成员身份无关、抬高分数的机制(抄写、指令遵循、可预测性、对抗诱导)也会抬高阈值。

    校准记忆率

    • Definition 4.1:对阈值 τ,G(τ) 是成员分数超过 τ 的概率,FPR(τ) 是非成员超过 τ 的概率。校准记忆率 M(τ)=G(τ)−FPR(τ)。在 conformal 工作点估计为 M̂=Ĝ−αN。作者称在匹配对照假设下,这是基于可抽取性的、对模型全部潜在记忆的下界。
    • 实践中的独立性:conformal 保证只需要可交换性。作者额外要求独立,以便所绘置信区间有效,并把 αN 与总体 FPR α∗(被已实现阈值错误标为记忆的全体非成员比例)联系起来:E[α∗]=αN。

    单文档 census 与可抽取性定义

    • 不适用 conformal test:没有被抽样的群体,结果按文档精确计算,没有 FPR 可估计或认证。仍可与非训练数据做匹配比较。
    • 滑动窗口:把每本书切成高度重叠的定长窗口(50-token 前缀、50-token 后缀 s),对每个重叠后缀在其前缀下打分。coverage(τ) 是分数超过 τ 的后缀所覆盖字符索引的并集大小,除以书的字符长度 L。
    • τ(book):用对照书的最高分设定该对专属阈值;按构造,没有对照序列高于它。它是实测最大值,不是认证水平。截止后的书可能引用训练数据中的早期材料,这些序列会污染对照并抬高阈值。作者只从对照中移除经网页核验的污染物,不改动训练内的书,再用剩余自有文本的最高分设定 τ(book)。浮点尾数不可靠时,作者丢掉尾数并向上取整到下一个数量级。证据强度用 margin:Δ(s;τ)=log10(score(s)/τ),即分数比阈值高多少个数量级。
    • Definition 6.1:固定抽取流程、查询预算 n 与容差 δ。候选 extractably memorized 当且仅当:(1)分数超过匹配比较阈值;(2)固定流程在 n 次查询内以至少 1−δ 的概率生成它。单次尝试成功概率为 p 时,n 次中至少出现一次的概率为 1−(1−p)^n。
  4. 论文做了哪些实验?

    短后缀的逐字生成含可观假阳性;书籍上极低概率仍可过校准阈值,但超出现实采样预算。

    实验设置

    • 模型:Wikipedia 群体实验主结果为 OLMo 2 32B base;附录报告 7B、13B、32B。Figure 1 的 parrot 实验用 OLMo 2 32B Instruct。书籍 census 用 Llama 3.1 base,Figure 6–7 的阈值与 coverage 写明为 Llama 3.1 70B。引言中的对抗提示复现用 Llama 2 13B。
    • Wikipedia:5,000 条成员,条目日期在 2021 年 1 月至 2023 年 12 月训练截止之间;5,000 条对照,来源条目日期为 2024。每条有 50-token 自然前缀,后缀为 10 或 50 token。在各自日期范围内均匀随机抽取,作者称因此是 i.i.d. 样本。训练语料公开,故成员身份已知。
    • 书籍:四对书,每对把 Books3(作者称包含在 Llama 训练数据中)中的一本书与同作者、晚于 Llama 3.1 训练截止的近作配对。同作者被作者称为对可交换性的尽力匹配:风格与体裁相同,其中两对还属同一系列。正文点名:The Hunger Games 对照 Sunrise on the Reaping;Killer Instinct 对照 The Oligarch's Daughter;另两本为 The Da Vinci Code 与 We Were Eight Years in Power。
    • 流程与指标:discoverable extraction 用 greedy,分数二值,只有一个工作点,无可校准的连续阈值。probabilistic extraction 在 top-k(k=40)下用 teacher forcing 精确计算 qθ,ϕ(s|p)。census 用 Cooper et al. (2026a) 的滑动窗口(50-token 前缀与后缀)。near-verbatim 变体最大 Levenshtein 距离为 5 token,按下界计算。指标为逐字生成率、认证 FPR αN、校准记忆率 M̂、coverage。区间为 95% Clopper–Pearson。
    • 假阳性地板的算法量:N 个对照只能以 1/(N+1) 为步长认证水平。正文给出 10-token 时 αN=1.84%,50-token 时 αN=0.04%;扫描的最小 αN 约为 0.02%。

    主结果

    OLMo 2 32B base,Wikipedia,greedy 逐字生成(Figure 3)。成员与非成员各 5,000 条;αN 为 N 个对照能认证的最大 FPR。

    表格较宽,可左右滑动

    后缀长度成员生成率非成员 / αN作者给出的份额
    10 token7.54%αN=1.84%(图中非成员条为 1.82%)1.84/7.54≈24%
    50 token0.74%αN=0.04%(图中非成员条为 0.02%)该地板来自 1 个假阳性;作者称约 5% 的份额被高估
    • 作者解读:10-token 时,只在成员上做实验会把全部 7.54% 归因于记忆,而同一流程以 1.84% 标记不可能被记住的序列。作者强调比较并不声称某一个被生成的成员没有被记住,而是短的逐字匹配不是足够特异的成员信号。
    • 50-token:成员生成率更低,非成员地板接近零。那一个假阳性是 null contamination 而非真正的非成员,因此地板和它蕴含的约 5% 份额都被高估。作者称污染只会使声称更保守:被污染的对照其实是成员,若分数高会抬高候选必须越过的门槛。
    • 连续分数(Figure 4):10-token 的绝对率高得多。最小绘制阈值处,成员率超过 50%,认证 FPR 超过 30%,ταN=0.95,成员必须接近确定才能通过。50-token 成员率峰值接近 3%,对照接近零,阈值降到 ταN=8.9×10^{-6}。校准后,50-token 曲线在整个扫描上高于 10-token;例如 αN≈0.1% 时,M̂=2.64% 对 1.06%。Figure 4b 标注 10-token 的 max M̂=58.9%(在图外),50-token 为 10.4%。作者称把原始生成率做大并不会使校准后的记忆证据更强,并认为实践中应在低 FPR 一端操作。作者还称对照含一些成员污染,50-token 绘制的比率低估了校准记忆。

    书籍 census

    • 阈值:Llama 3.1 70B 上,去污染后 τ(book) 从 10^{-27} 到 10^{-21}(Figure 6)。Sunrise on the Reaping 作为 The Hunger Games 的对照,反复引用训练截止前的材料;作者移除经网页核验的污染物后再设阈值。Figure 5:The Hunger Games 的 τ(book)=10^{-27};Killer Instinct 的 τ(book)=10^{-24},窗口与对照几乎完全重叠,作者称实际上没有记忆,只有 1 个候选窗口超过其阈值。零概率窗口因对数轴无法显示而被排除。
    • coverage(Figure 6):在各自 τ(book) 处,The Da Vinci Code 为 68.5%(τ=10^{-21}),The Hunger Games 为 53.3%(τ=10^{-27}),We Were Eight Years in Power 为 31.3%(τ=10^{-24})。把门槛抬高 5 个数量级(Δ=5)后仍分别为 55.6%、46.4%、28.4%;作者称此时最低分仍然极小,至多 10^{-16}。右图把 τglobal 设为最严的 τ(book),即 10^{-21},并用于这三本书:coverage 为 68.5%、44.6%、29.8%。τglobal 只会抬高每本书的门槛,因此只会降低 coverage。Killer Instinct 未画入 Figure 6。
    • 作者解读:这些阈值小到浮点尾数不可靠;保守起见丢掉尾数并向上取整到下一个数量级。低于阈值的候选支持记忆声称,但其概率远小于任何现实采样预算下会被生成的程度。

    现实预算下的可抽取记忆

    • 单序列:p=10^{-21}(最大的 census 阈值)时,以概率 0.95 至少生成一次需要 n≈3×10^{21} 次尝试。作者称以每秒一千次查询计,这将近宇宙年龄的 7 倍,因此把这称为 extractable memorization 是用词不当。
    • The Da Vinci Code,Llama 3.1 70B(Figure 7):在 10^5 次查询内可达的部分被作者当作可抽取记忆:逐字 12.3%,near-verbatim 18.7%。高于 τ(book) 但超出该预算的部分被记为记住但不可抽取:在 n≈3×10^{21}(τ(book) 所隐含的预算)处,逐字 coverage 68.5%,near-verbatim 51.5%。低于 τ(book) 的区域不做记忆声称,因为非训练文本也会在那里被生成。作者称 near-verbatim coverage 起初更高,但在更低概率处,精确的逐字计算捕捉到下界错过的质量。We Were Eight Years in Power 与 The Hunger Games 的同样视图见 §F.3,作者称结果相似;该节数值未附在所读文本中。
    • Figure 1:OLMo 2 32B Instruct 在 parrot 提示上,训练与非训练 Wikipedia 的逐字复现率分别为 70.1% 与 70.6%(各 N=3000)。作者称两者相等,不携带记忆信号;conformal test 下对照分数同样高,阈值同样高,没有序列超过阈值,因而不做记忆声称。

    其他消融与分析

    • 保证是边际 FPR,本身不约束同时检验多个候选时的 familywise error rate 或 false discovery rate(§C.5,引用 Bates et al., 2021)。
    • 已知成员上做实验时,拒绝零假设的“成员”一半是平凡的,记忆一半仍然成立:超过阈值的分数高到一般可预测性解释不了(§C.5)。
    • 对照污染若使高分对照混入,会抬高阈值,使声称更保守(§C.3, §D.2)。
    • §D 与 §F.2 报告 OLMo 2 7B、13B、32B;所读正文未给出这些规模的数值。
    • 脚注:Cooper et al. (2026b) 以约 20 次采样的代价抽取低概率序列,被作者用作“可比代价的其他解码”之例,不是本文的主结果。
  5. 有什么可以进一步探索的点?

    作者称完美匹配的对照并不总存在,短候选单独支撑不了有效记忆声称。

    作者指出的局限与后续方向

    • 完美匹配并不总存在(§7):校准声称依赖候选与对照的分布匹配。作者举公共领域、几乎肯定在训练数据中、但作者不会再写新作的情形,称不存在匹配非成员来做校准声称。仍可对照更一般的零假设(其他非训练同类文本,或更广的英语散文)校准,但声称应相应加限定,并清楚报告对照(§C.3)。Figure 6 的 τglobal 被作者用来说明:对照一般非成员散文而非每本书自己的对照,并对每本书取最保守阈值。
    • 短候选的效度(§7):短的逐字匹配本身带不了有效记忆声称。作者称这在实验中直接可见:短候选长度上,匹配非成员经常超过阈值,产生许多假阳性。作者点名若干只用短匹配、不做匹配比较就报告抽取的工作,称这些设置下的声称依赖成员生成率,而成员生成率不足以把记忆与一般可预测性分开。
    • 阴性结果不能外推(§7):作者认为一种抽取流程上的阴性结果,对另一种流程下的校准声称什么也没说。有效抽取声称总是相对于特定抽取流程和基线。
    • 实践中的匹配是尽力而为(§3, §7, §C.3):对照必须是真正的非成员,并且与候选分布匹配;作者称实践中两者都只能尽力做到。保证的好坏取决于背后的匹配比较。
    • 检验不说话的部分(§3):未超过阈值不是反对记忆的证据;检验约束假阳性,不估计模型中的全部潜在记忆,也不对假阴性作陈述。同时检验多个候选时,边际保证本身不约束 familywise error rate 或 false discovery rate(§C.5)。
    • census 不是认证水平(§5):τ(book) 是对照上测得的最大值,不是 certified level;没有群体 FPR 可估计或认证。

    实验覆盖范围

    • Wikipedia 群体实验的主文数字来自 OLMo 2 32B base,后缀长度为 10 与 50 token,成员与对照各 5,000,前缀 50 token;§D 与 §F.2 另报告 7B、13B、32B,所读正文未给出这些规模的数字。parrot 实验为 OLMo 2 32B Instruct,训练与非训练各 N=3000。
    • 概率抽取使用 top-k,k=40,分数由 teacher forcing 精确计算;greedy 的 discoverable extraction 只有一个二值工作点。
    • 书籍 census 为四对同作者的书,滑动窗口为 50-token 前缀与 50-token 后缀;Figure 6–7 的 τ(book) 与 coverage 写明模型为 Llama 3.1 70B。near-verbatim 使用最大 Levenshtein 距离 5 token 的下界。
    • 现实预算在 Figure 7 中以 10^5 次采样作示例,并与 τ(book) 所隐含的 n≈3×10^{21}(概率 0.95)对照;另两本书的同样视图在 §F.3,作者称结果相似。
    • 理论保证的完整证明与全部结果的假设汇总分别在 §C 与 §G;作者计划发布 §4、§5、§D、§E、§F 的实验代码,并称不能分发受版权保护的 census 用书。
  6. 总结一下论文的主要内容

    匹配非成员校准阈值后,短序列抽取含大量假阳性,极低概率过阈值也不等于可抽取。

    Cooper 等人从第一性原理重写 extractable memorization:生成训练文本只有在概率高过匹配非训练文本的可预测性基线时,才支持记忆声称。

    • 问题:短序列或会泄漏目标的提示会把可预测性当成抽取;另一方面,模型复现未逐字出现在训练中的文本,又被用来否定抽取的证据价值。作者认为两边都没有回答“多高才算高”。
    • 方法:抽取流程统一为模型、解码、提示规则、分数与 verify。verify 用匹配非成员校准。群体实验用 conformal p-value,把每个声称的边际假阳性率控制在选定的 αN。单本书没有群体可抽样,改用同作者截止后著作的最高分(去掉网页核验过的引用污染,并向上取整到下一个数量级)作为 τ(book)。extractable 还要求在预算 n 内以至少 1−δ 的概率被生成。
    • Wikipedia:OLMo 2 32B base 上,10-token greedy 成员逐字率为 7.54%,认证 FPR 为 1.84%,作者称约 24% 的表观抽取与非成员被同一检验标记的比率相当。50-token 成员率为 0.74%,地板为 0.04%,且那一个假阳性是污染。概率分数下,校准记忆率在扫描中是 50-token 高于 10-token(αN≈0.1% 时 2.64% 对 1.06%)。
    • 书籍:Llama 3.1 70B 的 τ(book) 低至 10^{-27}、高至 10^{-21}。在各自阈值处,三本书的 coverage 为 68.5%、53.3%、31.3%;Killer Instinct 只有一个窗口超过 10^{-24}。p=10^{-21} 要以 0.95 的概率被采样到,需要约 3×10^{21} 次尝试。The Da Vinci Code 在 10^5 次查询内的 coverage 为逐字 12.3%、near-verbatim 18.7%,远小于在 τ(book) 处的 68.5%。
    • 作者的结论:记忆声称只相对于某个可预测性基线成立;超过校准阈值才把生成概率叫做抽取概率。概率可以小到任何现实预算都抽不出来,因此 extractable memorization 应同时要求有效记忆声称与近乎确定的现实生成。短匹配单独不够;一种流程抽不出来,也不否定另一种流程下的校准声称。
阅读原文arxiv.org