生成图像更易被遗忘:面向合成图像检测的机器遗忘视角
Generated Images Are Easier to Forget: A Machine Unlearning Perspective for Synthetic Image Detection
作者用机器遗忘检测生成图像:剪枝或优化 DINOv2 后,生成图特征相似度下降更快,在 ImageNet 上 data-driven 平均 AUROC 为 98.29%。
- 生成图像检测多依赖标注数据训练二分类器,遇到未见生成模型和自然图像分布偏移时泛化变差。自然图像主导预训练的大规模视觉模型对自然图和生成图损失都低,难以直接区分。
- 作者观察到遗忘过程中生成图特征退化快于自然图。Data-free 方法剪枝 DINOv2 小幅值权重,用原模型与剪枝模型的特征余弦相似度打分;Data-driven 方法用 LoRA 拉开生成图特征、保留自然图特征,再用同一相似度判定。
- ImageNet 上 Data-free 平均 AUROC/AP 为 92.20%/91.45%,Data-driven 为 98.29%/98.33%(Table 1)。Sora 与 Open Sora 上 Data-driven AUROC 为 95.89% 与 97.03%(Table 12)。Chameleon 上最高 ACC 为 72.89%(Table 2)。
- 作者在附录 A.2 指出,方法依赖自然图像主导的预训练;若未来预训练语料中合成图像变多,data-free 所利用的方向敏感性差距可能减弱。附录还报告弱模型上 data-free 性能下降,并讨论对骨干的敏感性。
- 模型
- DINOv2 ViT-S/14DINOv2 ViT-B/14DINOv2 ViT-L/14DINOv2 ViT-g/14CLIP ViT-L/14CLIP RN50×64MoCoSwAVDINO
- 基准
- ImageNetGenImageDiffusionForensicsChameleonLSUN-BEDROOMDRCT-2MSoraOpen Sora
- 指标
- AUROCAPACC
研究者提出把生成图像检测重构为机器遗忘问题:在大规模视觉模型(LVMs)的遗忘过程中,生成图像的特征退化速度快于自然图像,据此设计了无数据检测(剪枝模型参数诱发遗忘)和数据驱动检测(优化 LVMs 遗忘生成图像相关知识)两种方法。在多个基准上的实验显示,这种基于遗忘的方法优于传统检测方法。
深度解读
这篇论文试图解决什么问题?
把生成图像检测改写成对预训练视觉模型的选择性遗忘,以减轻对标注训练分布的依赖。
生成图像检测依赖标注数据学习决策边界,难以泛化到未见生成分布;作者问:大规模视觉模型(LVM)何时、如何对自然图与生成图表现出不同的特征捕获行为。
- 场景与风险:作者称生成模型已能产出人眼几乎难以区分的图像,误用可涉及虚假信息、隐私侵犯和身份欺诈,因此需要稳健检测(引言)。
- 现有方法的不足:常见做法是用标注的自然图与生成图训练二分类器(式 (1))。作者称其受两方面域偏移限制:训练所用生成模型覆盖不到新模型时会失败;测试中的自然图像也可能偏离训练集。增强(如 JPEG)和对抗训练的迁移仍然有限(第 2 节)。
- 核心观察:作者报告,在自然图像主导数据上预训练的 LVM 对两类图像都能拟合到相近的低损失(Figure 1),直接用于判别的区分能力有限。用剪枝做受控遗忘后,生成图提取特征的退化快于自然图(Figure 2)。作者把这称为 disparate forgetting dynamics。
- 作者提出的方法:不从头学习边界,而在预训练 LVM 上做遗忘。Data-free detection 用幅值剪枝诱导遗忘、无需数据;data-driven detection 在有生成图时优化模型,使其遗忘与生成图相关的知识。检测分数是原模型与遗忘模型的特征余弦相似度(式 (4))。
- 作者的定位:作者称这把检测任务改写成 machine unlearning,并称在多个基准上优于常规检测,且在不可访问的生成模型(Sora)图像上仍优于已有方法(Table 12)。
有哪些相关研究?
相关工作分生成图像检测与机器遗忘两条线;本文用稀疏化做遗忘式检测。
生成图像检测
- 早期监督分类器:CNNspot(Wang et al., 2020)用自然图与生成图训练二分类器,并以 JPEG 与 Blur 做数据增强以提高鲁棒性。
- 表示空间与扩散检测:UniversalFakeDetect(Ojha et al., 2023)在 CLIP 表示空间上训练分类器,作者称其在更广的生成架构上表现更好。Gendet(Zhu et al., 2023a)用对抗的教师–学生差异框架;LaRE2(Luo et al., 2024)用潜空间重建误差引导特征精炼,面向扩散模型生成图。
- 免训练与近期方向:作者称依赖训练的方法仍面临泛化与计算成本问题。AEROBLADE(文中 Related Work 写作 Tan et al., 2024;参考文献条目为 Ricker et al., 2024)用 LDM 自编码器的重建误差做免训练检测,作者称其限于基于 LDM 的生成模型。Nie et al. (2025) 用自然图像预训练模型的认知不确定性;Zhang et al. (2025) 拟合自然图像分布;Cai et al. (2025) 探索可泛化检测器。作者称本文的遗忘方法同样可免训练,并可泛化到多种生成模型。
机器遗忘
- 选择性清除与采样:Golatkar et al. (2020) 清洗权重中关于特定训练数据的信息;Nguyen et al. (2022) 用基于 MCMC 的参数采样做遗忘。作者称这些方法在效率与模型性能之间折中。
- 置零与稀疏化:Golatkar et al. (2021) 将一部分权重置零,以去掉非核心数据中的信息并尽量少损失性能。Jia et al. (2023) 用权重剪枝缩小精确遗忘与近似遗忘的差距。作者称本文通过稀疏化执行机器遗忘。剪枝对长尾样本影响更大的观察来自 Hooker et al. (2019),写在方法节而非 Related Work。
基线方法与基准
- 基线:第 4.1 节列出 CNNspot、UnivFD、DIRE、NPR、PatchCraft、FatFormer、DRCT、AIDE、AEROBLADE;部分基准还比较 FreDect、Fusing、Durall、LNP、F3Net、SelfBlend、GANDetection、LGrad、Spec、GenDet、GramNet、SAFE。
- 基准:ImageNet、GenImage、DiffusionForensics、Chameleon、LSUN-BEDROOM、DRCT-2M,以及用 Sora 与 OpenSora 生成的图像。
作者把本文放在免训练检测一侧,区别是不学习自然图与生成图之间的边界,而是利用预训练 LVM 在遗忘中的差异动态。
论文如何解决这个问题?
用原模型与剪枝或 LoRA 遗忘模型的特征余弦相似度打分,生成图预期更不相似。
整体思路是:不重新训练二分类边界,而让预训练 LVM 发生选择性遗忘,再用原模型与遗忘模型特征的余弦相似度区分自然图与生成图。
任务设定与朴素遗忘目标
给定测试图像 x,判断它来自自然图像分布还是生成模型。常规做法在标注集上最小化分类损失,得到特征提取器 F 与分类器 D(式 (1)),再用固定阈值 τ 把分数 s(x) 判成 generated 或 natural(式 (2))。
作者给出的朴素遗忘目标把 D_forget 对应生成图、D_retain 对应自然图:对遗忘分布最大化均匀预测(推动忘记),对保留分布做标准交叉熵,并用 λ 平衡(式 (3))。作者称式 (3) 需要收集两类图像并微调,有额外计算成本;因此另外设计不访问生成图的 data-free 做法。
Data-free:幅值剪枝
- 依据:作者引用 Hooker et al. (2019),压缩对低频、长尾样本的影响大于高频样本。DINOv2、CLIP 的预训练语料以自然图为主,生成图相对稀少或分布偏移,剪枝可能对生成图影响更大。Figure 4 的文字称,扰动 DINOv2 权重后生成图的特征位移更大;Figure 2 用 t-SNE 展示不同遗忘程度下的特征分布,作者称生成图特征退化更快。图中具体坐标与簇间距在文本中不可读。
- 剪枝定义:绝对幅值低于阈值 ϵ 的权重置零,其余保留(式 (6));剪枝方向 Δθ = θ − θ′。实现上,学得模型为完全参数化的 DINOv2 ViT-L/14(24 个 transformer block)。遗忘模型剪掉其第 16 个 block 的 fc2 层中幅值最小的 90% 权重。超参用 ImageNet 抽样的 1k 张自然图和 ProGAN 生成图选择。该方法 training-free、data-free。
- 分数:s(x) = cos(F(x; θ_F), F(x; θ_F′))(式 (4))。作者称生成图上原模型与剪枝模型的特征相似度更低,因此该分数可作检测依据。硬判定仍用式 (2);计算 ACC 时阈值由验证集确定。
局部扰动分析
作者用表示函数 f(x; θ) 的雅可比分析剪枝引起的输出差。定义分布 D 上的剪枝输出差 Δ^D_out 为原模型与剪枝模型特征的均方距离。Assumption 3.3 假设沿剪枝方向,生成图的方向表示敏感度比自然图至少大 ω∥Δθ∥²₂。Proposition 3.4 称:若 f 对 θ 二阶可微且二阶导局部有界,则在该假设下,当 ω > C_f∥Δθ∥₂ 时,生成图的输出差大于自然图。证明在附录 A.3。附录还给出以风险与 Hessian 曲率差为条件的补充分析,作者称它是剪枝方向上的局部扰动分析。Assumption 3.3 被作者描述为假设,经验上与 Figure 2、Figure 4 一致。
Data-driven:边际分离
有生成图时,在遗忘参数 θ_F′ 上优化:自然图(X¹)上,遗忘模型特征与原模型特征的 L_CE 要小;生成图(X⁰)上,用 max(0, γ − L_CE) 要求两者差距至少达到边际 γ(式 (14))。L_CE 作用在 ℓ₂ 归一化特征上,一个向量当 logits、另一个当软目标。γ 设为 20。微调用 LoRA,加在 DINOv2 的 q_proj 与 v_proj 上,lora_r 与 lora_α 均为 8。得到遗忘模型后仍用式 (4) 打分、式 (2) 判定。
与学习式检测的关系
作者称结构上仍是“特征提取器 + 分类器”,但提取器直接用大规模预训练视觉模型,分类器权重被实例化为遗忘模型在该测试样本上的输出特征,因此是逐样本的动态分类器(Figure 3)。作者列出两点区别:特征来自大规模自然图预训练而非有限样本重训;划分不依赖训练时固定的自然/生成样本。
论文做了哪些实验?
主实验在 ImageNet 等六个公开基准及 Sora/Open Sora 上比较 AUROC、AP 或 ACC,并做剪枝与 LoRA 消融。
实验设置
- 被测骨干:主实验为 DINOv2 ViT-L/14。消融还包括 DINOv2 ViT-S/14、ViT-B/14、ViT-g/14,CLIP ViT-L/14、CLIP RN50×64,以及 MoCo、SwAV、DINO(Table 6、Table 9)。检测对象是各生成器产出的图像,不是对这些生成器做参数攻击。
- 基准与生成器:ImageNet 子集含 ADM、ADMG、LDM、DiT、BigGAN、GigaGAN、StyleGAN XL、RQ-Transformer、Mask GIT(Table 1;附录写 DiT-XL-2)。GenImage 含 Midjourney、SD V1.4、SD V1.5、ADM、GLIDE、Wukong、VQDM、BigGAN,自然图来自 ImageNet(Table 3)。LSUN-BEDROOM 含 ADM、DDPM、iDDPM、StyleGAN、Diffusion-Projected GAN、Projected GAN、Unleashing Transformers。DiffusionForensics 含 ADM、DDPM、iDDPM、LDM、PNDM、VQ-Diffusion、sdv1、sdv2。DRCT-2M 自然图来自 COCO,生成器含多种 SD/LCM/Ctrl/DR 变体。Chameleon 中生成图均通过人类感知测试,标注者把它们误标成自然图。另有从公开 Sora 视频与 Open Sora 视频抽帧的专有集,自然图来自 Laion-400M。各基准样本量论文未全部写明。
- 基线:见第 4.1 节列表。Table 1 将 AEROBLADE 与 Data-free 归为 training-free,其余为 training methods。
- 指标:AP、AUROC、ACC。ACC 的阈值由验证集确定,阈值敏感性在 Table 13,正文未给出该表数字。论文未报告重复次数,也未报告统计显著性检验。
- 实现:Data-free 剪第 16 个 block 的 fc2、剪枝比例 90%。Data-driven 用 LoRA(r=8,α=8,γ=20)。超参选择用 1k 张 ImageNet 自然图与 ProGAN 生成图。
主结果
Table 1 在 ImageNet 上报告各生成器 AUROC/AP 及平均。下表只保留平均与若干生成器,单位为百分比,据 Table 1。
表格较宽,可左右滑动
方法 ADM AUROC DiT AUROC BigGAN AUROC 平均 AUROC 平均 AP AEROBLADE 55.61 85.88 44.36 57.87 57.85 Data-free Unlearning 91.97 85.74 96.37 92.20 91.45 FatFormer 91.77 86.93 98.76 93.68 93.11 AIDE 90.87 89.87 88.48 93.71 92.87 Data-driven Unlearning 96.86 96.25 99.96 98.29 98.33 - 作者的解读:遗忘方法优于学习式方法;即使不用生成图引导,剪枝也能取得较好结果,加入生成图后进一步提高(第 4.2 节)。Table 1 中 Data-free 的平均 AUROC 92.20 高于 AEROBLADE 的 57.87,低于 FatFormer 93.68 与 AIDE 93.71;Data-driven 的平均 98.29/98.33 为该表最高。DiT 上 Data-free 的 AUROC 85.74 低于 AEROBLADE 的 85.88。
- Figure 7:作者称在 ADM、BigGAN、DDPM、Midjourney 上,自然图在学得模型与遗忘模型之间的特征相似度高于各生成图,该差异用于区分两类图像。图中具体柱高文本不可读。
- 其他主表的平均:GenImage 上 ACC(Table 3),Data-free 平均 81.8,Data-driven 平均 89.7;DRCT 平均 89.4,FatFormer 88.9。Data-driven 在 Midjourney 为 90.8,低于 FatFormer 92.7、DRCT 91.5、SAFE 98.3;在 BigGAN 为 85.1,高于表中其余方法。Chameleon 的 ACC(Table 2)整体较低:Data-free 在三种训练集下均为 59.17;Data-driven 在 ProGAN / SD v1.4 / All GenImage 上为 60.59 / 71.15 / 72.89,All GenImage 一列为该表最高。
Sora 与 Open Sora
Table 12 用 AUROC/AP 评测从视频抽帧的图像。Data-free:Sora 90.89/90.18,Open Sora 90.00/89.10,平均 90.45/89.64。Data-driven:Sora 95.89/95.54,Open Sora 97.03/95.70。作者称在这些未知生成模型上该方法最好。同表中 AIDE 平均 AUROC 为 90.62(Sora 91.76、Open Sora 89.47),高于 Data-free 平均、低于 Data-driven。CNNspot、DIRE、NPR 的 AUROC 约在 50–53。
与线性分类及扰动鲁棒性
- 同一骨干的学习式对照(Table 4):在 DINOv2-L/14 上用 UnivFD 训练集并加 JPEG 与 Blur,线性分类在 ImageNet 上 AUROC/AP 为 87.83/86.49,在 LSUN-BEDROOM 上为 84.72/83.57;Data-free 为 92.20/91.45 与 91.66/90.58。作者称同一骨干上遗忘方法也优于该学习方法。
- 扰动(Figure 8):作者按 JPEG 质量、高斯模糊标准差、高斯噪声标准差评估,并称该方法在不同扰动下检测最好。图中曲线数值文本不可读。
- 计算开销(Table 11,ImageNet):Data-free 训练 0.0 小时、推理 100 张 2.5 秒;Data-driven 训练 1.5 小时、推理 2.5 秒。对照中 DRCT 训练 25.4 小时,AEROBLADE 推理 17.6 秒。Table 10:LoRA 的 AUROC/AP 为 98.29/98.33、训练 92 分钟;全量微调 98.37/97.72、152 分钟;线性探测 87.83/86.49、34 分钟。
其他消融与分析
- 剪哪些参数(Table 5,指标未另行注明基准):Query/Key/Value/fc1/fc2/all 的 AUROC 为 87.55/88.21/90.08/88.19/92.20/88.81,AP 为 85.06/86.02/88.77/87.07/91.45/87.13;fc2 最高,与主实验设置一致。
- 预训练模型(Table 6):DINOv2 ViT-S/14、B/14、L/14、g/14 的 AUROC 为 74.01、85.74、92.20、88.12;CLIP ViT-L/14 为 85.92,RN50×64 为 80.03。作者称顶层 block 剪枝会明显变差(Figure 5,数值未在正文列出),剪枝比例过低时原模型与剪枝模型特征几乎相同、性能下降(Figure 6)。
- 微调缓解骨干敏感(Table 8):Data-driven 在 ViT-L/14、ViT-g/14、CLIP ViT-L/14 上 AUROC 为 98.29、97.96、97.63,高于对应的 Data-free(92.20、88.12、85.92)。
- 弱模型(Table 9):MoCo、SwAV、DINO 的 Data-free AUROC/AP 为 72.69/70.15、77.85/75.64、74.79/71.88。作者称性能明显下降,并称用小模型做检测是可探索方向。
- LoRA 超参(Table 7,AUROC/AP):r=8、α=8 为 98.29/98.33,与主实验一致;表中九组均在 98.01–98.79 / 98.20–98.83。作者称对 γ 稳健(Figure 9,曲线数值未列出)。
- 中间层相似度(Table 18,列与 Table 1 相同):block 16 平均 AUROC/AP 为 79.92/80.66,block 23 为 92.20/91.45,与 Table 1 的 Data-free 平均相同。论文未在正文解释该表与主剪枝设置的对应关系。
Table 14、15、16(DRCT-2M、LSUN-BEDROOM、DiffusionForensics)在所给文本中不完整,具体数字不写。Table 12 后半行在文本中被截断,只采用截断前已对齐的单元格。
有什么可以进一步探索的点?
作者明确写出的局限是:预训练语料若不再由自然图像主导,data-free 的敏感性差距可能减弱。
作者指出的局限与后续方向
- 预训练分布假设(附录 A.2):方法依赖预训练数据由自然图像主导的视觉基础模型。作者称,若未来预训练语料中合成图像越来越多,data-free 所利用的方向敏感性差距可能减弱,效果可能下降。
- 小模型(附录 A.5):在 MoCo、SwAV、DINO 上 Data-free 性能下降后,作者称这指出了一个用小模型做检测的方向。该句是对实验结果的延伸说明,不是单独的 Limitations 节条目。
- 社会影响(附录 A.1)描述的是缓解虚假信息、增强对深度伪造的识别,不列出可复现的部署结论。结论节(第 6 节)重申差异遗忘与跨基准优于已有方法,未另列未来工作清单。
实验覆盖范围
- 骨干与两种检测:主结果用 DINOv2 ViT-L/14;Table 6 与 Table 8 还报告 DINOv2 的 S/B/g 与 CLIP ViT-L/14、RN50×64,Table 9 报告 MoCo、SwAV、DINO 上的 Data-free。Data-driven 用 LoRA 加在 q_proj 与 v_proj。
- 基准:公开基准为 ImageNet、GenImage、Chameleon、LSUN-BEDROOM、DiffusionForensics、DRCT-2M;另有 Sora 与 Open Sora 抽帧,自然图来自 Laion-400M(第 4.1–4.2 节、附录数据集说明)。
- 指标与对照:报告 AUROC、AP、ACC;ACC 阈值由验证集确定。对照包括 training-free 的 AEROBLADE 与多种训练式检测器,以及同一 DINOv2 上的线性分类(Table 4)和全量微调、线性探测(Table 10)。
- 扰动与消融:Figure 8 评 JPEG 压缩、高斯模糊、高斯噪声。消融包括剪枝 block(Figure 5)、剪枝比例(Figure 6)、被剪参数类型(Table 5)、边际 γ(Figure 9)、LoRA 的 r 与 α(Table 7)。
- 论文未报告的设置:正文未给出各基准的测试样本量,未报告重复次数,未报告 AUROC/AP 的统计显著性检验。Table 13 被提到用于阈值敏感性,所给文本没有该表数字。DRCT-2M、LSUN-BEDROOM、DiffusionForensics 的完整对照表在所给文本中不完整。
总结一下论文的主要内容
作者用剪枝或 LoRA 遗忘拉开生成图与自然图的特征相似度,并在多个检测基准上报告结果。
这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。
- 问题:监督检测器受训练所用生成模型和自然图分布约束。作者观察到 DINOv2 等模型对两类图像都能给出较低损失(Figure 1),于是用幅值剪枝制造能力下降,记录特征相似度的变化(Figure 2)。
- 方法:Data-free 剪掉 DINOv2 ViT-L/14 第 16 个 block 的 fc2 中最小 90% 权重,分数为原特征与剪枝特征的余弦相似度。Data-driven 用 LoRA(r=8,α=8)和边际 γ=20,让自然图特征保持接近、生成图特征拉开,再用同一分数和验证集阈值判定。局部分析在“生成图对剪枝方向更敏感”的假设下给出输出差更大的条件。
- 结果:ImageNet 上 Data-free 平均 AUROC/AP 为 92.20%/91.45%,Data-driven 为 98.29%/98.33%(Table 1)。GenImage 平均 ACC 分别为 81.8% 与 89.7%(Table 3)。Chameleon 上 Data-driven 在 All GenImage 训练设置下 ACC 为 72.89%(Table 2)。Sora / Open Sora 上 Data-driven AUROC 为 95.89% / 97.03%,Data-free 平均 AUROC 为 90.45%(Table 12)。同一骨干的线性分类在 ImageNet 上为 87.83%/86.49%(Table 4)。弱预训练模型上 Data-free AUROC 为 72.69%–77.85%(Table 9)。
- 作者的结论:作者称生成图的特征退化快于自然图,基于这一动态的遗忘检测在多个基准上优于已有方法,并在不可访问生成模型的图像上仍然更优。附录 A.2 写明,该信号依赖自然图像主导的预训练;合成图像若在未来语料中变多,data-free 的方向敏感性差距可能减弱。