跳到正文
原文
论文追踪· arXiv:2610.01365· Jianhong Li , Jiahao Chen , Yuwen Pu , Chunyi Zhou , Oubo Ma , Zhou Feng , Hangtao Zhang , Jichao Bi , Chunqiang Hu·本站收录 · 原文发表 精选关注度30

ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联

Sleeping Secrets: How Fine-Tuning Reawakens Privacy Risks in Language Models

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

作者提出无真实私有监督的恢复攻击 ReGap,在 GPT-2 Medium 上将目标关联恢复率从 42.0% 提升至 63.0%(Figure 2)。

威胁模型攻击者知晓关联模式与答案格式,可查询目标模型 Mh、评估 token 级似然并进行微调。

问题
语言模型在持续训练后先前记住的敏感隐私关联可能直接查询不可得,现有恢复攻击往往假设攻击者持有训练集同分布的真实私有数据。论文探讨在没有真实私有监督且无目标答案的情况下,能否仅靠模型自身生成的数据重新唤醒这些潜在隐私关联。
方法
提出无需真实私有监督的攻击 ReGap,包含生成、筛选、微调三阶段:由目标模型生成候选关联,利用该冻结模型自身的答案 token 负对数似然挑选候选,随后在选出的伪数据上训练 LoRA 适配器更新模型,促使目标关联损失下降。
实验与结果
在 GPT-2、OPT 和 Qwen3 的 6 个模型上,ReGap 使目标关联恢复率提高 6–21 个百分点(Figure 2)。在未见身份对照中,GPT-2 Medium 恢复率仍提升 15.3 个百分点且生成池无目标答案重放(Table 1);但在未接触过目标的模型上无提升(Table 3)。
局限与可以继续做的
作者指出 ReGap 依赖已知关联模式与答案格式,且针对白盒似然评分与可微调开源模型。实验显示方法在不透明随机绑定与显式 NPO 遗忘下几乎无恢复增益(Table 19),且主要评估集中于单一 Enron 基准与 6 个模型。
实验设置GPT-2 Small、GPT-2 Medium 等 · Enron email corpus (LLM-PBE)、WikiText-2 等 · Target-association recovery (Rec)、Answer-token negative log-likelihood (Lsel) 等
威胁模型
攻击者知晓关联模式与答案格式,可查询目标模型 Mh、评估 token 级似然并进行微调。微调使用辅助键 Xaux 与模型自生成答案,无需外部目标答案或真实私有数据,不要求辅助数据与目标分布匹配(data-free 监督),无正确性标签、恢复反馈及原始模型 Mm。目标感知设置下 Xaux 可含目标键;未见身份对照中则完全不相交。
模型
GPT-2 SmallGPT-2 MediumGPT-2 LargeOPT-1.3BQwen3-1.7BQwen3-4B
基准
Enron email corpus (LLM-PBE)WikiText-2Controlled EnronNon-Enron-domain subsetOpaque random-binding benchmark
指标
Target-association recovery (Rec)Answer-token negative log-likelihood (Lsel)Gradient cosine similarity
AI 导读和推荐理由全文 397 字

研究者提出 ReGap,一种无需真实隐私监督的微调恢复攻击,用目标模型自身生成的候选答案构造监督数据,再按答案 token 似然筛选并训练新的 LoRA 适配器。在 GPT-2 Small/Medium/Large、OPT-1.3B 和 Qwen3-1.7B/4B 六个设置上,一轮 ReGap 使目标关联恢复率比微调后模型提升 6 至 21 个百分点,GPT-2 Medium 从 42% 升至 63%,GPT-2 Large 从 55% 升至 72%。在适配身份与所有记忆及评测身份完全不重叠、生成候选池和选中样本中均无精确目标答案的对照下,GPT-2 Medium 和 Large 仍分别提升 15.3 和 14.0 个百分点。同一适配器只在曾接触过目标的检查点上带来提升,在未接触目标的匹配检查点上无增益,说明恢复依赖此前的目标暴露。该效果在随机绑定结构和 NPO 遗忘处理后明显减弱。

推荐理由论文给出无需真实隐私监督即可重新提取模型已学隐私关联的微调方法,并附跨模型成功率与失效边界。

深度解读

6 个问题,约 6,500 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    探究在缺乏真实私有数据监督的现实条件下,能否仅凭模型自身生成的数据通过微调重新恢复语言模型中潜在的隐私关联。

    核心问题:语言模型在后续持续训练导致敏感私有信息可访问性下降后,能否在没有外部真实私有监督的条件下,仅凭模型自生成数据通过微调恢复先前习得的私有实体-属性关联。

    • 应用场景与持续适应风险:语言模型在生命周期中常经历下游微调或持续适应,先前预训练阶段记住的敏感个人身份信息(PII)或实体-属性关联可能在直接查询下难以输出,形成行为上的隐性记忆(hidden memories)。
    • 现有恢复攻击的数据假设过强:现有针对后训练或遗忘模型的恢复攻击(如 Janus)假设攻击者能获得来自目标训练分布的真实私有参考样本;但在攻击者仅持有发布模型的现实场景中,外部真实私有数据通常不可获得。
    • 核心观察与研究假设:作者认为直接查询失败并不等同于内部记忆被彻底删除;模型自生成的候选输出在结构上仍包含先验任务信息,通过特定似然度筛选可以构建有效伪监督,引导梯度更新并降低目标关联损失。
    • 论文提出的解决方案:作者提出了数据无关(data-free)的恢复攻击框架 ReGap,通过“生成–筛选–微调”流程,仅依靠冻结目标模型自身的生成与打分来恢复潜在的私有实体-属性关联。
    • 威胁模型:
      • 攻击者目标:恢复目标模型 Mh 在后训练之前记忆但当前直接恢复率较低的目标私有实体-属性关联集 Dtar。
      • 攻击者知识:知晓任务关联模式与答案格式,不掌握目标真实答案,没有外部真实私有参考数据,亦无原始记忆模型 Mm。
      • 攻击者能力:可黑盒查询目标模型 Mh、评估 token 级别似然度,并拥有对目标模型进行低秩适配(LoRA)微调的白盒参数更新权限。
      • 受害系统:经历非目标数据(如 WikiText-2)持续训练或显式遗忘处理后发布的自回归语言模型 Mh。
  2. 有哪些相关研究?

    梳理了模型记忆提取、行为遗忘以及后适应微调隐私风险等研究,将本文定位为无需真实私有监督的后适应恢复攻击。
    • 记忆化与行为可访问性:
      • Carlini et al. (2019, 2021, 2022) 与 Tirumala et al. (2022) 研究了语言模型对训练数据的精确记忆,分析了重复次数、模型规模与训练动态对记忆的影响;Zhou et al. (2024) 将记忆分析进一步拓展到实体-属性关联。
      • Jang et al. (2021) 与 Jagielski et al. (2022) 研究了后续更新对模型记忆提取的影响,指出模型在更新后对先前学习信息的输出行为会发生改变。
      • Duan et al. (2025)、Goel et al. (2026b) 与 Cohen et al. (2026) 探讨了行为遗忘与信息真正消除的区别,指出即便直接访问能力下降,潜在记忆仍可能保持可解码或可恢复。
    • 语言模型隐私提取:
      • Carlini et al. (2021)、Lukas et al. (2023) 与 Nasr et al. (2025) 主要在推理阶段通过提示词设计、提示词优化或大规模查询,从固定的静态模型检查点中提取记忆文本与 PII。
      • Luo et al. (2026) 与 Pu et al. (2025) 探讨了私有属性预测与逐项记忆的关系,指出词汇与分布线索也能辅助重构,说明结构化关联即使在缺少目标真实答案时也存在统计规律。
    • 后适应阶段隐私风险与微调攻击:
      • Chen et al. (2024)(Janus)使用真实私有实体-属性关联对模型进行微调以恢复先前习得的 PII;作者指出其假设攻击者能获得来自目标训练分布的真实私有记录。
      • Wang et al. (2025) 研究了下游微调能够逆转机器遗忘带来的表观遗忘,探讨了对后续微调保持不变性的遗忘方法。
      • Rashid et al. (2025) 研究了恶意修改的预训练模型可利用机器遗忘在受害者后续微调过程中放大隐私泄露。
    • 基线方法与基准:
      • 实验对比了微调前直接评估基线 Hidden、同候选池随机采样的 Matched Random、使用 50 条真实私有样本微调的 Genuine-Private LoRA,以及基于上下文学习的 ICL(1/5/10/20-shot);主要基准为基于 Enron 邮件语料构建的人名-邮箱关联数据集。
    • 本文定位:作者将 ReGap 定位为无需外部真实私有监督的后适应恢复攻击;既不修改原始模型植入漏洞,也不设计防御算法,而是探索仅利用目标模型自身生成的候选伪监督,重新激活直接访问受阻的隐私关联。
  3. 论文如何解决这个问题?

    提出由生成、筛选、微调构成的 ReGap 流程,基于冻结模型似然挑选高支持度伪监督,以 LoRA 降低目标关联损失。

    作者提出无真实私有监督的恢复攻击框架 ReGap,采用“生成–筛选–微调”(Generate–Select–Adapt)三阶段流程,利用冻结目标模型自身的生成与似然评分构建伪监督,通过轻量级微调更新模型以降低目标损失。

    问题设定与理论依据

    • 形式化目标:设目标关联集为 Dtar,包含 N 个键值对 (xi, yi),经固定模板构造查询 qi。后训练模型 Mh 的直接恢复率低于原始记忆模型 Mm。目标关联恢复率定义为:

    Rec(M) = 1/N ∑i=1N 1[Norm(yi) ≠ ϵ ∧ Norm(yi) ⊆sub Norm(ŷi(M))] 其中 Norm 表示转小写、去除首尾空白并合并连续空格,⊆sub 表示连续子串包含。

    • 局部梯度对齐:定理 1 分析了单步梯度更新对目标损失 LT 的影响,对于参考梯度步 δ = −η gS(η > 0),在 β-光滑条件下有:

    LT(−η gS) ≤ LT(0) − η/(N|S|)∑i=1N ∑z∈ S κh(ti, z) + (βη2)/2|gS|22 其中 κh(ti, z) = ⟨ g(ti), g(z) ⟩ 为梯度对齐核。只要辅助梯度 gS 与目标梯度 gT 正向对齐足够大,即使候选样本与目标答案没有重合,也能降低目标损失。

    阶段一:候选样本生成(Generate)

    • 候选生成协议:针对辅助键集合 Xaux,使用冻结的目标模型 Mh 作为生成器。对每个查询生成 1 个贪心补全和 5 个随机采样补全(J=5)。
    • 解码超参数:随机采样采用温度 0.7、top-p 为 0.9、重复惩罚系数 1.05,最大生成 token 数为 64。
    • 规则格式过滤:仅依据已知答案格式剔除空回复、格式残缺或重复输出,完全不核对候选输出是否匹配真实答案,由此得到包含 m 个候选对的候选池 C。

    阶段二:基于冻结模型支持度的筛选(Select)

    • 观测代理选择:由于攻击者无法直接计算未知的目标梯度,ReGap 采用冻结目标模型 Mh 下候选答案的平均负对数似然损失作为可观测代理指标。
    • 全局排序截断:在整个候选池中计算每个候选样本的答案 token 平均交叉熵损失,按损失由小到大排序,保留损失最低的 K=min(K0, m) 个样本(主实验设预算 K0=50)构成自适应数据集 Daux=S。

    阶段三:轻量化微调适配(Adapt)

    • 适配器配置:从目标模型 Mh 出发初始化全新的 LoRA 适配器,对注意力与前馈投影层进行参数高效微调,防止全参数微调导致表示崩塌。
    • 优化细节:仅在选出样本的答案 token 上计算因果交叉熵损失,提示词 token 予以掩码。训练采用学习率 5e-5、batch size 为 1、梯度累积步数为 8、梯度裁剪为 1.0,共微调 3 个 epoch;LoRA 秩设为 16,缩放系数 alpha 设为 32,dropout 设为 0.05。
  4. 论文做了哪些实验?

    作者在 6 个模型上测试了 ReGap,恢复率提升 6–21 个百分点,对照实验显示其依赖先验暴露且对不透明绑定失效。

    实验设置

    • 被测模型:覆盖 3 个家族共 6 个开源自回归模型,参数量约 0.1B–4B,包括 GPT-2 Small、GPT-2 Medium、GPT-2 Large、OPT-1.3B、Qwen3-1.7B 和 Qwen3-4B。
    • 基准与规模:主基准为从 Enron 邮件语料中提取的 3,000 个结构化人名-邮箱关联(LLM-PBE 管线),划分出 50 个真实私有参考样本、100 个恢复目标样本、2,850 个非目标池(其中 300 个用于非目标评测);采用 WikiText-2 进行非目标持续训练以构建后训练模型 Mh。
    • 对比基线:评估前直接测试基线 Hidden、同候选池随机采样等量样本微调的 Matched Random、使用 50 条真实私有样本微调的 Genuine-Private LoRA,以及基于 1/5/10/20-shot 的上下文学习(ICL)。
    • 评测指标:核心指标为目标关联恢复率(Rec),即 100 个目标答案在规范化后作为子串出现在模型生成延续中的百分比。
    • 评测协议:采用贪心解码生成最多 48 个新 token;随机实验基于 42、43、44 三个随机种子,报告均值或均值±样本标准差。真实答案仅用于最终评估与事后审计,不参与生成与筛选。

    主结果

    表格较宽,可左右滑动

    被测模型Hidden (%)Matched Random (%)ReGap (%)Genuine-Private LoRA (%)
    GPT-2 Small23.039.040.346.3
    GPT-2 Medium42.053.063.066.3
    GPT-2 Large55.060.072.077.0
    OPT-1.3B21.023.330.069.7
    Qwen3-1.7B52.057.358.074.0
    Qwen3-4B40.050.353.366.0*

    注:据 Figure 2、Table 9 与 Table 12。Qwen3-4B 的 Genuine-Private LoRA 标*表示论文明确指出该项为未匹配的描述性参考。

    • 作者指出单轮 ReGap 在全部 6 个模型设定中均高于未微调的目标模型 Hidden,增加了 6 到 21 个恢复关联;增益在 GPT-2 Medium 上最大(从 42/100 增至 63/100),在 GPT-2 Large 上从 55/100 增至 72/100。
    • 对比真实私有监督,作者指出 ReGap 在 GPT-2 Medium 和 Large 上与真实私有微调的差距分别收窄至 3.3 和 5.0 个百分点,表明自生成监督无需外部真实私有记录即可恢复大量隐藏关联。
    • Matched Random 在所有模型上也均优于 Hidden(增益 2.3 至 16.0 个百分点),作者据此认为候选生成本身提供了实质恢复信号,而冻结模型似然筛选起到了进一步放大的作用(增益额外增加 0.7 至 12.0 个百分点)。

    未见身份对照实验

    • 实验设计:在辅助键中采用与记忆池、目标集及评估集完全不重叠的人名进行候选生成与微调,测试恢复是否依赖目标身份重合。
    • 实验结果:GPT-2 Medium 恢复率从 42.0% 升至 57.3±1.5%(净增 15.3 个百分点),GPT-2 Large 从 55.0% 升至 69.0±1.0%(净增 14.0 个百分点)(Table 1);事后审计显示生成池与选定样本中目标身份重合数与目标答案命中数均为 0(Table 22)。
    • 作者解读:作者认为恢复并不要求在微调阶段输入目标特定身份或重放确切答案,模型可利用共有的人名-邮箱任务结构实现恢复。

    先验暴露对照实验

    • 实验设计:将针对曾暴露于目标的 GPT-2 Medium 训练好的 LoRA 适配器,直接转移至从未接触过 100 个目标关联的同构对照检查点,不重新训练或生成候选。
    • 实验结果:在曾接触目标的检查点上恢复率从 42.0% 提升至 63.0%,而在未暴露于目标的对照检查点上微调前后均保持在 13.0%(Table 3、Table 23)。
    • 作者解读:作者认为仅靠微调本身不足以产生所观察到的恢复增益,后适应恢复强烈依赖于模型在训练历史中曾接触过目标数据。

    边界条件与防御压力测试

    • 实验设计:在去除语义联系的不透明随机绑定基准以及经过负偏好优化(NPO)显式遗忘的模型检查点上测试 ReGap。
    • 实验结果:在不透明随机绑定中,GPT-2 Medium 恢复率仅为 2.0%(历史协议,Table 17)或维持 1.0%(当前协议,Table 20);在 NPO 遗忘模型上,中度遗忘检查点微调后为 71.3±0.6%(微调前 71.0%),重度遗忘检查点微调后维持 32.0%(Table 19)。
    • 作者解读:作者认为模型自生成监督无法通用地恢复任意隐藏关联,且显式针对目标抑制的机器遗忘机制比普通非目标持续训练对后续恢复更具抵抗力。

    其他消融与分析

    • 查询信息消融:打乱实体对应关系的查询恢复率为 63.0±1.0%,而替换为无实体通用查询后恢复率降至 41.0±0.0%(Table 1/Table 5.3)。
    • 提示词表述鲁棒性:How 句式与英文改写 A 恢复率为 61.7±1.2%,改写 B 为 54.7±2.3%,中文提示词降为 41.7±0.6%(Table 2)。
    • 多轮微调动态:在 GPT-2 Medium 和 Large 上首轮微调即达最高恢复率(63.0% 与 72.0%),第二、三轮均连续回落(Table 10)。
    • LoRA 与全参数微调对比:全参数微调在 GPT-2 S/M 上恢复率高 2.3 与 6.4 个百分点,但在 GPT-2 L 和 OPT-1.3B 上分别低 11.0 与 22.0 个百分点(Table 11)。
    • 上下文学习(ICL):在 GPT-2 Medium 和 Large 上 1/5/10/20-shot 的 ICL 恢复率最高仅为 22.0% 与 33.0%,均低于未微调基线(Table 13)。
    • 事后梯度余弦相似度:GPT-2 Medium 上候选兼容性与目标梯度余弦呈正相关(r=0.747),选定样本集余弦为 0.633,随机样本为 0.029(Table 14、Figure 5)。
  5. 有什么可以进一步探索的点?

    作者指出当前研究聚焦于结构化 Enron 数据与开源模型,未来需探索低结构化隐私、受限微调接口及更多防御机制。

    作者指出的局限与后续方向

    • 主基准单一性:主要评估集中在 Enron 衍生的人名-邮箱关联上,未确立所有现实世界人名-邮箱分布均支持同等强度恢复的结论(第 5.1 节、附录 A.5)。
    • 弱结构化私有信息拓展:当前任务具备较强词汇与组合结构,未来需将分析拓展至结构化程度较低的私有信息领域(第 6 节)。
    • 更多遗忘与隐私防御:当前遗忘测试仅涉及单一方法,未来需评估更多机器遗忘算法及其他隐私保护防御措施(第 6 节)。
    • 受限微调接口分析:当前实验集中于允许 token 级似然打分与参数高效微调的开源模型,未来需研究访问受限的微调接口(第 6 节)。
    • 非通用恢复机制:在不透明随机绑定与非 Enron 域子集上恢复效果减弱,表明该方法并非恢复任意隐藏关联的通用机制(第 6 节、附录 E.3)。

    实验覆盖范围

    • 被测模型覆盖 GPT-2(Small、Medium、Large)、OPT-1.3B、Qwen3-1.7B 和 Qwen3-4B 共 6 个开源模型,参数量在 0.1B 至 4B 之间(第 5.1 节)。
    • 评测基准主要为 Enron 邮件人名-邮箱关联(3,000 条隐私池,100 条恢复目标),辅助对比包含 714 条非 Enron 域关联与 757 条 Controlled Enron 关联(第 5.1 节、附录 A)。
    • 遗忘防御压力测试仅覆盖 GPT-2 Medium 上的负偏好优化(NPO)单一方法及其设置的两种遗忘强度(附录 E.4)。
    • 恢复评测采用贪心解码且生成上限为 48 token,主实验统一采用单轮自适应微调及 K=50 样本预算(第 5.1 节、附录 B)。
    • 论文未报告闭源 API 模型或限制 logit 输出接口下的攻击表现,亦未报告目标梯度的实际在线估计方法(第 6 节、附录 D)。
  6. 总结一下论文的主要内容

    提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。
    • 一句话定位:研究大语言模型在后训练导致隐私可访问性下降后,能否在无外部真实私有监督下通过微调恢复先前习得的私有实体-属性关联。
    • 核心问题与动机:现有恢复攻击通常假设攻击者持有训练集同分布的真实私有参考数据,但在仅获发布模型的实际场景中该假设难以成立;作者探究模型能否仅凭自身生成的数据唤醒隐性隐私记忆。
    • 方法核心:提出数据无关的 ReGap 攻击框架,通过冻结目标模型生成候选补全,依据答案 token 负对数似然挑选 top-K 高支持度样本,利用轻量化 LoRA 微调促使模型更新并降低目标损失。
    • 主要实验发现:
      • 在 GPT-2、OPT 和 Qwen3 的 6 个模型设置中,单轮 ReGap 将目标关联恢复率提升 6 到 21 个百分点(Figure 2),在 GPT-2 Medium 上从 42.0% 升至 63.0%。
      • 未见身份对照中,使用完全不相交的人名仍能在 GPT-2 Medium 上取得 15.3 个百分点的恢复增益,且生成池和选定监督中确切目标答案命中数为 0(Table 1、Table 22)。
      • 先验暴露对照中,同一适配器转移至未暴露于目标的同构模型上恢复率维持 13.0% 无增益,表明恢复增益强烈依赖于历史训练暴露而非微调自身伪造记忆(Table 3)。
      • 边界测试表明,在消除语义规律的不透明随机绑定和显式 NPO 遗忘模型上,ReGap 几乎无法产生额外恢复增益(Table 17、Table 19)。
    • 作者结论与启示:作者指出直接查询不可得并不意味着记忆已真正被抹除,常规的下游微调和自生成数据可能重新唤醒潜在的隐私风险,呼吁在模型发布后全生命周期中持续评估隐私安全。
阅读原文arxiv.org