ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联
提出ReGap,用自生成伪监督微调恢复模型中的隐私关联
- 一句话定位:研究大语言模型在后训练导致隐私可访问性下降后,能否在无外部真实私有监督下通过微调恢复先前习得的私有实体-属性关联。
- 核心问题与动机:现有恢复攻击通常假设攻击者持有训练集同分布的真实私有参考数据,但在仅获发布模型的实际场景中该假设难以成立;作者探究模型能否仅凭自身生成的数据唤醒隐性隐私记忆。
- 方法核心:提出数据无关的 ReGap 攻击框架,通过冻结目标模型生成候选补全,依据答案 token 负对数似然挑选 top-K 高支持度样本,利用轻量化 LoRA 微调促使模型更新并降低目标损失。
- 主要实验发现:
- 在 GPT-2、OPT 和 Qwen3 的 6 个模型设置中,单轮 ReGap 将目标关联恢复率提升 6 到 21 个百分点(Figure 2),在 GPT-2 Medium 上从 42.0% 升至 63.0%。
- 未见身份对照中,使用完全不相交的人名仍能在 GPT-2 Medium 上取得 15.3 个百分点的恢复增益,且生成池和选定监督中确切目标答案命中数为 0(Table 1、Table 22)。
- 先验暴露对照中,同一适配器转移至未暴露于目标的同构模型上恢复率维持 13.0% 无增益,表明恢复增益强烈依赖于历史训练暴露而非微调自身伪造记忆(Table 3)。
- 边界测试表明,在消除语义规律的不透明随机绑定和显式 NPO 遗忘模型上,ReGap 几乎无法产生额外恢复增益(Table 17、Table 19)。
- 作者结论与启示:作者指出直接查询不可得并不意味着记忆已真正被抹除,常规的下游微调和自生成数据可能重新唤醒潜在的隐私风险,呼吁在模型发布后全生命周期中持续评估隐私安全。