SAGE:基于相似度从少量已验证样本中清洗中毒训练数据
SAGE: Similarity-Based Cleaning of Poisoned Training Data from Verified Examples
SAGE 用少量已核验的干净与中毒样本,在 CIFAR-10 上把无触发 clean-label 攻击的 ASR 压到至多 5%。
攻击者向训练集注入 clean-label 投毒(加性扰动或局部补丁,标签不变),使测试目标被分成 yb,且整体准确率大致不受影响。
- clean-label 投毒把恶意样本混入训练数据。现有清洗要么不依赖真值、精度偏低,要么需要大量已核验干净样本,核验成本高且污染会破坏防御。
- SAGE 在独立数据集上训练特征提取器,检测时用已核验的干净与中毒样本做非参数、按相似度加权的预测,ĝi ≥ 0.5 则剔除,不在已核验集上拟合参数。
- 在 CIFAR-10 上,SAGE 把三种无触发攻击的 ASR 压到至多 5%,平均找回至少 480/500 个毒样本,删除不到 2% 训练数据。对四种后门攻击也能压低 ASR,同时干净准确率高于靠大量删除压低 ASR 的基线。作者称已核验干净样本的类别分布比数量更重要。
- 作者指出未评估 Gclean 被污染时的退化,也未评估自适应攻击;特征提取器在 CIFAR-100 上训练后直接复用,作者认为目标域偏离自然图像时性能可能下降。实验覆盖 CIFAR-10 与 Tiny ImageNet 上的七种 clean-label 攻击。
- 威胁模型
- 攻击者向训练集注入 clean-label 投毒(加性扰动或局部补丁,标签不变),使测试目标被分成 yb,且整体准确率大致不受影响。防御者只见 D′,不知 m、哪些样本被投毒、xt、yb、ϵ 及攻击类型;另有很小的已核验集 G = Gclean ∪ Gpoison ⊂ D′,|G| ≪ n。
- 模型
- ResNet-18VGG-16
- 基准
- CIFAR-10Tiny ImageNetCIFAR-100
- 指标
- ASRclean test accuracyTPremoved samplesfalse-positive rate
针对数据投毒防御普遍依赖大量可信干净样本的问题,研究者提出 SAGE——在一个独立数据集上训练通用特征提取器,再用基于少量已验证样本的非参数化相似度加权预测标记中毒训练样本。该方法只需极少数经取证专家核查过(无论判定为干净还是有毒)的样本即可生效,并在七个 clean-label 攻击方法的基准上与现有防御对比取得优势。实验还发现,已验证干净样本在各类别间的分布比其总数更重要。
深度解读
这篇论文试图解决什么问题?
少量已核验的干净与中毒样本,能否检出 clean-label 投毒。
在只需很少已核验样本(同时含干净与中毒)时,如何从训练数据中检出 clean-label 投毒。
- 场景:作者称机器学习越来越依赖公开、不可信数据,投毒可让指定测试样本被误分类。Carlini 等人表明,控制 LAION-400M 这类网络规模数据的 0.01% 就可能达成误分类目标。clean-label 攻击只扰动特征、不改标签,视觉上与干净数据难以区分;作者引用的检查中,专业检查者漏掉超过 86% 的特征扰动投毒。
- 现有方法的不足:作者把清洗方法分成三类。依赖全部标签的方法在标签被篡改时没有优势。不依赖真值的统计离群方法精度偏低,且往往过度过滤。依赖已核验干净基集的方法需要的规模从 100 到 1,000,乃至 De-Pois 默认 20% 训练数据(CIFAR-10 上为 10,000 张);该比例降到 0.5% 时,准确率与 F1 从大约 0.9 降到 0.7。作者还称,基集中不足 1% 被污染时,五种代表性基集防御的性能会崩溃。
- 核心观察:作者认为,认真核验既会确认干净样本,也会确认中毒样本;后者标出攻击所针对的特征区域,信息多于只知道干净分布。直接在几十个已核验样本上训练分类器会过拟合,在固定特征上拟合分类器又面临维度灾难。因此检测不应在该小集合上拟合任何参数。
- 本文提出:SAGE(Similarity-based Approach for Ground-truth-driven Exclusion)。在另一数据集上训练特征提取器,再用已核验集做非参数、按相似度加权的预测,标出其余训练样本中的投毒。
- 威胁模型:
- 受害系统:防御者在数据集 D = {(xi, yi)}(yi ∈ {1, …, K})上训练分类器 fθ。攻击者把 m ≪ n 个基样本 xbj 换成毒样本 xpj。毒样本是满足 ∥δj∥∞ ≤ ϵ 的加性扰动,或覆盖小区域的局部补丁;标签不变,ypj = ybj。
- 攻击者目标:使在被污染数据 D′ 上训练的模型把选定测试输入集 T 分成攻击者选定的标签 yb,其余输入上的行为及整体测试准确率大体不受影响。定向攻击中 T = {xt} 且 yt ≠ yb,测试时不再修改输入。后门攻击中 T 是带触发补丁的输入,攻击者控制的是输入空间的一片区域。
- 攻击者知识:随具体攻击而变(见第 4 问的攻击设置)。防御侧,攻击者构造毒样本时不知道哪些样本会进入 G。
- 防御者知识与目标:防御者只观察到 D′,不知道 m、哪些样本被投毒、xt、yb、ϵ,也不知道用了哪种攻击;同一流程用于所有攻击。另有很小的真值集 G = Gclean ∪ Gpoison ⊂ D′,|G| ≪ n;gj ∈ {0, 1} 为核验标签,gj = 1 表示中毒,q = |Gpoison|。作者假设 Gclean 按类均衡,K 个类各有 c 个已核验干净样本。清洗后得到 D̂ ⊆ D′ 及 θ(D̂),同时满足:fθ(D̂)(xt) ≠ yb;在清洗数据上的准确率接近在原始干净 D 上训练的水平;丢弃量 |D′ \ D̂| 较小。xt、yb 与毒样本集合 P 均不可见。
有哪些相关研究?
相关工作按无目标/定向、翻标签/clean-label,以及三类防御来组织。
作者在第 II 节把投毒攻击与防御按假设分组,并说明 SAGE 与三类防御的差别。
数据投毒攻击
- 综述与分类:Tian 等人(2022)、Goldblum 等人(2022)、Biggio 等人讨论投毒相对逃避攻击发生在训练阶段、影响更持久。作者沿两轴分类:无目标攻击降低整体性能,定向攻击使特定测试样本被误分类;翻标签攻击改标签,clean-label 攻击只扰动特征、保留原标签,因而更隐蔽。
- 大规模可行性:Carlini 等人表明,对手可通过购买数据集所索引的过期域名,控制 LAION-400M 或 COYO-700M 的 0.01%,从而实施投毒。
- 本文采用的三类代表性 clean-label 定向攻击:feature collision 使毒样本在特征空间与目标碰撞;bullseye polytope 用毒样本的凸包包围目标;gradient matching 使毒样本梯度与对抗目标的梯度对齐。
投毒防御
- 依赖标签的防御:信任整个训练集的类别标签。Deep k-NN 在某点的标签与其特征空间 k 近邻的多数标签不一致时标为中毒。作者称该假设适合标签按构造为正确的 clean-label 攻击,此时 Deep k-NN 是强基线;标签本身被篡改时没有优势。
- 不依赖真值的防御:用统计、离群或聚类标准找毒样本,包括 spectral signatures、activation clustering、基于梯度的 core-set 选择。作者称 Meta-Sift 在 CIFAR-10 上用五项标准评估,没有一种能以足够精度分离干净数据,其中若干在至少一种攻击下差于随机选择;实践中这些方法倾向过度过滤。
- 基集防御:假设有一批已核验干净样本作参照。频率检测器与 MW-Net 用 100 个样本;MNTD、Neural Cleanse、I-BAU 用 1,000 个;De-Pois 默认核验 20% 训练数据(CIFAR-10 上 10,000 张),并报告该比例缩向 0.5% 时准确率与 F1 从大约 0.9 降到 0.7;DUTI 同样依赖大量已核验干净样本。Zeng 等人表明,五种代表性基集防御在基集中不足 1% 被污染时性能崩溃;对频率检测器,100 张中混入 1 张毒样本就会使性能低于随机基线。作者还引同一工作:48 名专业标注者检查 16 种攻击,漏掉超过 86% 只扰动特征、不改标签的投毒,接近随机。
基线方法与基准
- 基线:无触发实验使用 Deep k-NN、EPIC、Meta-Sift、Confusion Training;后门实验使用 Activation Clustering、SPECTRE、Confusion Training、FLARE。基准为 CIFAR-10 与 Tiny ImageNet;特征提取器在 CIFAR-100 上训练。无触发攻击遵循 Schwarzschild 等人的基准协议。
作者把 SAGE 与三类都区分开:不信任不可信数据的标签,并非完全没有真值,也不假设基集纯净;它假设一个很小的已核验集,其中样本被标成干净或中毒,并且两者都用。相对依赖标签的防御,它用少得多的完整性判断换掉大量假定正确的类别标签;相对不依赖真值的防御,它提供那些方法缺少的锚点;相对基集防御,它取消纯净性要求,因为已核验的毒样本被明确标出,而不是被假定不存在。
论文如何解决这个问题?
先在 CIFAR-100 上训练相似度特征提取器,再用已核验集做加权插值。
SAGE 分两阶段:先在 CIFAR-100 上训练特征提取器 ϕ,使同标签图像在特征空间靠近;检测时冻结 ϕ,按与已核验干净/中毒样本的相似度做插值。因为不在已核验集上拟合参数,集合大小只影响分辨精细程度,不影响过拟合风险。
问题设定
- 清洗目标:在未知毒样本集合 P ⊂ D′ 的条件下,同时压低攻击成功率、保持干净准确率接近在原始干净数据上训练的水平,并少丢数据。作者称这三项相互牵制,因此全文同时报告攻击成功与丢弃量。
- 默认已核验集:CIFAR-10 上 c = 2(10 类各 2 个干净样本)、q = 2(从基类抽出的已确认毒样本),|G| = 22。毒样本与干净样本都从被污染训练集本身抽取,G ⊂ D′,不假设外部数据。Gclean 中的样本无论预测如何都保留。
特征提取器
- 结构:不用预训练视觉模型,而是在独立数据集上从头训练。作者给出的理由是:已核验集太小,不能直接训练表示;预训练模型是为线性分类优化的,而 SAGE 用余弦相似度比较样本;自训练还可以直接设定输出维度。骨干为 ResNet-18,池化特征 r(x) ∈ R^512,再加两层头:
z = φ(x) = W2 σ(BN(W1 r(x) + b1)) + b2 其中 σ 为 sigmoid,BN 为批归一化,隐藏宽度 h = 512,输出维度 d = 256。同时学习尺度 τ > 0,初始化为 1,控制预测集中在最相似参照上的程度。
- 训练数据:在 CIFAR-100 上训练 200 个 epoch,与被攻击的 CIFAR-10、Tiny ImageNet 不相交。优化为 SGD(学习率 0.1、动量 0.9、权重衰减 5×10^−4、余弦退火),随机裁剪与水平翻转。作者期望该空间能迁移,理由是三个基准都是视觉统计大体相近的标准图像基准,且对 100 个类训练可避免 ϕ 只专精少数类别。提取器只训练一次,之后跨攻击、数据集和已核验集配置复用。
与检测一致的训练目标
- 划分与相似度:每个 batch 分成参照集 R(标签已知)和查询集 Q(标签只由 R 经相似度预测)。查询 i 与参照 j 的余弦相似度为 sim(zi, zj) = zi⊤zj / (∥zi∥∥zj∥)。预测是参照标签的相似度加权平均:
ŷi = ∑j ∈ R exp(τ · sim(zi, zj)) yj / ∑j ∈ R exp(τ · sim(zi, zj)) 训练时 yj 是 CIFAR-100 的 one-hot 标签。损失 L 是 Q 上 ŷi 与查询自身类别的交叉熵。梯度同时流过 R 与 Q 的特征,并联合更新 ϕ 与 τ。作者称,只有同标签参照获得高相似度权重时查询才会被分对,因此最小化损失会把同标签样本拉近。
- 按类分层抽样:作者称均匀划分时,多数查询在同一步没有本类参照,式 (3) 无法给没见过的类赋权,损失被封顶,训练无进展。因此每步抽 k = 4 个按类分层的子集,每子集每类 s = 2 张,即每子集 200 张、每步 800 张,约每 epoch 62 步。轮流让一个子集当 R、其余当 Q,使每个样本在两种角色中都出现。训练时 |R| = 200。作者称 τ 按训练时的 |R| 标定后在检测时原样复用,|R| 与 |G| 差太大时 τ 会不匹配,因此把 |R| 当超参数,并在附录 B 报告一组取值。
作为投毒检测器
- 复用同一规则:检测时 ϕ 与 τ 冻结,不在目标数据集上训练或微调。参照集改为 R = G,标签由 one-hot 类别换成标量 gj ∈ {0, 1}。每个参照图像仍保留自己的类别标签和中毒状态。对其余每个候选 xi,式 (5) 给出 ĝi ∈ [0, 1],即参照集中已核验毒样本的相似度加权比例,作为估计的中毒概率。ĝi ≥ 0.5 则从训练集删除。此阶段不算损失、不更新参数。
- 维度与 |R| 的选定:附录在干净 CIFAR-100 测试集上、用与检测相同的相似度加权规则选 d 与 |R|,且这两项在见到任何投毒数据之前就固定。Table IV 中 d = 256 的交叉熵最低(2.0417)、准确率最高(0.7328),τ 在各维度上为 13.03–13.56,d = 256 时最大;故全部实验用 d = 256。Table V 中 |R| = 200 的准确率最高(0.7350,τ = 3.5260);|R| = 22 时准确率 0.5166、τ = 0,作者称此时 100 类只覆盖约五分之一,多数查询没有同类参照,预测接近均匀平均。
论文做了哪些实验?
CIFAR-10 上无触发攻击的防御后 ASR 至多 5%,并找回至少约 480/500 个毒样本。
实验设置
- 数据与硬件:CIFAR-10 有 50,000 张训练图像、10 类;Tiny ImageNet 有 100,000 张、200 类。特征提取器只在 CIFAR-100 上训练。硬件为 64 核 2.4 GHz AMD EPYC 与一张 24 GB 的 NVIDIA RTX A5000。作者称提取器训练约 30 分钟,对 50,000 张训练集做一次 SAGE 检测约 4 分钟。
- 受害模型:过滤后重新训练。CIFAR-10 上,Feature Collision 与 Bullseye Polytope 用 ResNet-18 做白盒迁移学习(40 epoch,SGD,学习率 0.1,批大小 128);Gradient Matching 从零训练 ResNet-18(200 epoch,同一优化器设置)。Tiny ImageNet 上从零训练 VGG-16(200 epoch,学习率 0.1,批大小 64)。四种后门攻击统一从零训练 ResNet-18(SGD,学习率 0.1,动量 0.9,权重衰减 5×10^−4,余弦退火,批大小 128,100 epoch,随机裁剪与翻转)。
- 无触发攻击:遵循 Schwarzschild 等人的超参数、优化器与评测协议,报告 20 组不同 base–target 对。ϵ ∈ {8, 16, 22}。每个设置在 CIFAR-10 上生成 500 个毒样本,在 Tiny ImageNet 上生成 250 个。Feature Collision 与 Bullseye Polytope 的攻击者知道受害者将微调的预训练特征提取器;Gradient Matching 只知道架构与训练流程,不知道得到的权重,并针对从零训练。
- 后门攻击:用各作者发布的实现与默认超参数。Narcissus 在不知道受害者训练集的情况下优化全局触发:在公开的分布外数据集上训练代理模型,追加目标类,再搜索把输入强烈推向该类的扰动。Wicked Oddities 固定触发、选择目标类中哪些图像来投毒;实验用 Wicked-BadNets、Wicked-Blended、Wicked-SIG 三种实例。每种攻击投毒攻击者所选目标类的 10%,即全训练集的 1%。ASR 在目标类之外的 9,000 张加触发测试图像上测量。结果为 10 次运行的均值 ± 标准差。
- 基线:无触发为 Deep k-NN(k 取每类样本数)、EPIC、Meta-Sift(按默认选出 1,000 张,丢掉排名最低的 1,000 张)、Confusion Training。后门为 Activation Clustering、SPECTRE、Confusion Training、FLARE。这些基线不使用 SAGE 的已核验集。
- 指标:ASR 与干净测试准确率。三种定向攻击的 ASR 是 20 个被污染数据集中、单张目标图 xt 被分成攻击者所选基类标签的比例;准确率在标准测试划分上、于清洗后训练的模型上测量,并给均值 ± 标准差。另报告训练集被删除比例,以及被删样本中的假阳性率(被删样本实为良性)。
主结果
Table I 为无触发攻击在防御后的 ASR 与干净准确率,20 个被污染数据集的平均。下表只列 CIFAR-10 上各防御的 ASR;准确率与 Tiny ImageNet 在表后说明。
表格较宽,可左右滑动
攻击 ϵ 无防御 SAGE Deep k-NN Meta-Sift EPIC Confusion Training FC 8 / 16 / 22 15% / 25% / 35% 0% / 0% / 0% 0% / 10% / 10% 15% / 25% / 35% 0% / 0% / 0% 5% / 5% / 20% BP 8 / 16 / 22 100% / 100% / 95% 0% / 0% / 0% 20% / 0% / 10% 25% / 35% / 40% 10% / 15% / 0% 45% / 70% / 25% GM 8 / 16 / 22 75% / 95% / 100% 0% / 5% / 5% 10% / 10% / 5% 20% / 40% / 60% 10% / 5% / 5% 10% / 15% / 15% - ASR:作者称在 CIFAR-10 上 SAGE 在每个设置(含并列)都取得最低 ASR:Feature Collision 与 Bullseye Polytope 的三个 ϵ 均为 0%;Gradient Matching 为 0–5%。EPIC 在 Feature Collision 的三个预算上也是 0%。无防御时 Bullseye Polytope 为 95–100%,Gradient Matching 为 75–100%,Feature Collision 只有 15–35%,作者称后者应相对其较低的无防御 ASR 来理解。
- 准确率:迁移学习下 EPIC 的干净准确率为 0.9455–0.9466,Deep k-NN 为 0.9389–0.9481,SAGE 为 0.9258–0.9428。从零训练的 Gradient Matching 上顺序反过来:SAGE 为 0.8980–0.9033,EPIC 为 0.8787–0.8806,Confusion Training 最高,为 0.9040–0.9122。相对无防御模型,SAGE 损失 0.3–5.1 个百分点,从零训练时降幅最大。
- Tiny ImageNet:只评测 Bullseye Polytope、ϵ = 8、VGG-16。无防御 ASR 30%、准确率 0.6153±0.0047。SAGE 把 ASR 降到 10%,准确率升到 0.6169±0.006。Deep k-NN 的 ASR 为 20%、准确率 0.5584;EPIC 的 ASR 仍为 30%、准确率 0.5569;Meta-Sift 的 ASR 为 50%、准确率 0.5869;Confusion Training 的 ASR 为 25%、准确率 0.6025。作者称这是该设置下唯一没有造成准确率损失的防御。
后门攻击
Table II 在 CIFAR-10 上报告四种 clean-label 后门,10 次运行。SAGE 的结果为:Narcissus 的 ASR 从 0.9120±0.0010 降到 0.1310±0.0017,准确率从 0.9521±0.0004 降到 0.9281±0.0030(作者称降 2.40 个百分点);Wicked-BadNets 的 ASR 从 0.8970±0.0035 降到 0.2720±0.0048,准确率 0.9494±0.0022;Wicked-Blended 的 ASR 从 0.9383±0.0007 降到 0.4620±0.0030,准确率 0.9467±0.0007;Wicked-SIG 的 ASR 从 0.9372±0.0018 降到 0.3400±0.0157,准确率 0.9401±0.0022。作者称 Wicked 变体上干净准确率至多降 0.50 个百分点,且三种上 SAGE 的准确率都高于 0.94。
- 更低 ASR 的代价:Narcissus 上 Activation Clustering(0.0431)、SPECTRE(0.1235)、Confusion Training(0.0987)的 ASR 低于 SAGE,但干净准确率也更低(0.9023、0.9045、0.9149)。FLARE 在三种 Wicked 变体上 ASR 最低(0.0699、0.1023、0.0717),四个攻击上的干净准确率为 0.4586–0.5507,SAGE 为 0.9281–0.9494。作者称 SAGE 并非整体 ASR 最低,但在四个攻击上都压低了 ASR,并保持高于 FLARE 的干净准确率。
- Activation Clustering 与 SPECTRE 在 Wicked 上:Wicked-BadNets 上二者 ASR 为 0.8915 与 0.8959,接近无防御的 0.8970;Wicked-SIG 上 Activation Clustering 为 0.9382,也接近无防御的 0.9372。
删除精度与已核验集构成
Table III 报告被标为中毒的样本数(20 次均值 ± 标准差)。CIFAR-10 上每个设置有 500 个毒样本,Tiny ImageNet 上有 250 个。
- CIFAR-10:SAGE 的真阳性为 480.4±13.5 至 500.0±0.0,总删除 769.2±13.8 至 995.1±34.1,即训练集的 1.5–2.0%,假阳性占被删样本的 35.4–50.8%。Meta-Sift 每次删 1,000 张,真阳性最高 105.1±59.8(Bullseye Polytope、ϵ = 22),作者称召回至多 21%。EPIC 在迁移学习下删除 9,189.5–9,290.0 张;从零训练时删除约 19,405.1–20,174.2 张,约占数据集 38.8–40.3%,且找回的毒样本少于 100。Deep k-NN 删除最少,205.3–406.4 张,其中 46.1–90.7% 为假阳性。Gradient Matching、ϵ = 16 时 SAGE 与 EPIC 的 ASR 都是 5%,但平均删除 896.9 与 20,174.2 张。
- Tiny ImageNet:SAGE 删除 187.0±50.4 张,其中真阳性 126.0±38.5(250 个中),作者称召回 50.4%、被删样本中 32.6% 为良性,是所评防御中删除精度最好的。尽管只删掉约一半毒样本,ASR 仍从 30% 降到 10%。作者认为这说明该攻击依赖保留足够大比例的毒样本。Deep k-NN 的真阳性为 77.7±11.8、总删除 220.4±18.4;Meta-Sift 真阳性 3.3±3.4;EPIC 真阳性 87.4±5.3、总删除 40,036.0±945.1。
- 已核验集构成:Figure 1 在增加已核验毒样本数量时比较两种抽样。作者称,干净样本按类均衡时,BP-8、FC-8、GM-8 只需两个已核验毒样本就能找回大部分毒样本;不分层抽样大约需要五个才能达到相近召回。假阳性上,按类均衡大约删除 180–220 张干净图像,不分层大约删除 1,500–2,200 张,即便召回更低。作者据此称,干净类的均衡覆盖对控制假阳性很重要,已核验干净样本的分布比数量更重要。图中实线为按类均衡,虚线为不分层;图例含 BP-8、FC-8、GM-8。具体端点数值论文未在正文逐点列出。
其他消融与分析
- 输出维度 d(附录 A,Table IV,干净 CIFAR-100 测试集):d = 64 / 128 / 256 / 512 的损失为 2.3252 / 2.2413 / 2.0417 / 2.1955,准确率为 0.7020 / 0.7146 / 0.7328 / 0.7242;τ 为 13.5630 / 13.0431 / 13.0456 / 13.0370。
- 训练参照集大小 |R|(附录 B,Table V,同一预测规则):|R| = 22 / 100 / 200 / 500 的准确率为 0.5166 / 0.6386 / 0.7350 / 0.6867,τ 为 0.0000 / 1.2895 / 3.5260 / 2.0171。
- 自适应攻击:第 VII-A 节只讨论可能的攻击方式,没有给出实验结果。作者考虑降低毒样本与 Gpoison 的相似度,或提高与 Gclean 的相似度,但称攻击者若没有 ϕ 的权重就不能直接计算或对该相似度求导;即便白盒知道 ϕ,也不知道哪些样本会进入 G,因此只能针对干净与中毒嵌入的分布。作者明确不对“构造毒样本时已知 G”的攻击者作鲁棒性声称。更根本的攻击是提高毒样本之间的多样性,使已核验毒样本不再代表未核验毒样本;作者称这一路线不被对 ϕ 或 G 的不确定性挡住。
有什么可以进一步探索的点?
作者把自适应攻击和 Gclean 污染留作后续,提取器跨域复用也未加保证。
作者指出的局限与后续方向
- 自适应攻击尚未评估(第 VII-A 节):作者称评估这些自适应策略是未来工作的重要方向。一种做法是在 Bullseye Polytope 或 Gradient Matching 的目标里加入逃避项,惩罚靠近已核验集;另一种是构造多样性正则的攻击变体,并测量攻击效果与可检测性之间的折中。作者同时写明,不对知道 G 后再构造毒样本的攻击者作鲁棒性声称。
- 假定已核验集正确(第 VII-B 节):SAGE 不要求大基集纯净,但假定被标为干净的样本确实干净。误入 Gclean 的毒样本会给相似度加权预测提供错误参照。作者称该假设在他们的规模上更容易满足,因为认证几十个样本比认证成百上千个更可行,但实验没有在任何规模上评估 Gclean 的污染。测量这种污染下性能如何退化,被作者留作未来的鲁棒性实验。
- 特征提取器跨数据集复用(第 VII-B 节):ϕ 在 CIFAR-100 上训练,不微调即用于 CIFAR-10 与 Tiny ImageNet。作者称这样避免为每个数据集重训,但嵌入反映的是 CIFAR-100 而非目标数据集的类结构。已评设置中该嵌入能分开干净与中毒样本,不过方法不保证在其他地方也能分开。作者认为目标域偏离自然图像(例如医学影像)时性能可能下降,扩展到非视觉模态需要单独评估。
实验覆盖范围
- 被测受害模型为 CIFAR-10 上的 ResNet-18(迁移学习或从零训练,视攻击而定)和 Tiny ImageNet 上从零训练的 VGG-16;后门统一用从零训练的 ResNet-18。特征提取器为在 CIFAR-100 上从头训练的 ResNet-18 加两层头。
- 无触发攻击为 Feature Collision、Bullseye Polytope、Gradient Matching,ϵ ∈ {8, 16, 22},CIFAR-10 上每种 500 个毒样本、20 组 base–target;Tiny ImageNet 只报告 Bullseye Polytope、ϵ = 8、250 个毒样本。
- 后门为 Narcissus 与 Wicked Oddities 的三种实例(Wicked-BadNets、Wicked-Blended、Wicked-SIG),各投毒目标类的 10%,Table II 为 10 次运行。
- 默认已核验集在 CIFAR-10 上为每类 c = 2 个干净样本、q = 2 个已确认毒样本,|G| = 22,且 G ⊂ D′。第 VI-D 节与 Figure 1 改变已核验毒样本数量,并比较按类均衡与不分层抽样。
- 防御基线在无触发设置中为 Deep k-NN、EPIC、Meta-Sift、Confusion Training,在后门设置中为 Activation Clustering、SPECTRE、Confusion Training、FLARE。论文未报告自适应攻击的实验结果,也未报告 Gclean 被污染时的数字。附录 A、B 只在干净 CIFAR-100 测试集上比较 d 与训练时的 |R|。
总结一下论文的主要内容
SAGE 用 22 个已核验样本做相似度检测,在 CIFAR-10 上把无触发 ASR 压到至多 5%。
SAGE 是针对 clean-label 投毒的训练数据清洗方法:不假定大批纯净基集,而是用一个很小的、同时含已核验干净样本和已核验毒样本的集合做参照。
- 问题:公开数据上的 clean-label 投毒不改标签,肉眼难辨。依赖全部标签、完全不依赖真值、或依赖成百上千张已核验干净样本的清洗方法,分别受标签篡改、过度过滤或核验成本与基集污染的限制。作者把检测写成在极少已核验样本上的二分类,并认为此时不应再拟合参数。
- 方法:在与被攻击数据不相交的 CIFAR-100 上,用 ResNet-18 加两层头训练特征提取器。训练时把 batch 按类分成参照与查询,用余弦相似度对参照标签做加权平均来预测查询,交叉熵回传到提取器和温度 τ。检测时冻结该提取器,把已核验的干净/中毒标签代入同一规则,ĝi ≥ 0.5 则删除。CIFAR-10 上默认为 10 类各 2 张干净样本加 2 张已确认毒样本,共 22 张,且都来自被污染训练集本身。
- 无触发结果:CIFAR-10、20 组试验中,SAGE 把 Feature Collision 与 Bullseye Polytope 在 ϵ = 8、16、22 的 ASR 都降到 0%,Gradient Matching 降到 0–5%(Table I),并平均找回至少 480/500 个毒样本,总删除约占训练集 1.5–2.0%(Table III)。Gradient Matching、ϵ = 16 上 SAGE 与 EPIC 的 ASR 同为 5%,但平均删除约 897 张与 20,174 张。Tiny ImageNet 上,VGG-16、Bullseye Polytope、ϵ = 8,SAGE 把 ASR 从 30% 降到 10%,准确率从 0.6153 到 0.6169,找回 126/250 个毒样本。
- 后门结果:CIFAR-10、10 次运行中,SAGE 把 Narcissus 的 ASR 降到 0.1310,三种 Wicked 变体降到 0.2720、0.4620、0.3400,干净准确率保持在 0.9281–0.9494。FLARE 的 ASR 更低,但干净准确率落在 0.4586–0.5507(Table II)。
- 作者的结论:知道少数毒样本的价值不成比例地高,核验精力更适合用来同时识别两类样本,而不是去凑一个被假定为干净的更大集合。已核验干净样本跨类的分布比数量更要紧。作者同时把自适应攻击、Gclean 被污染时的退化,以及偏离自然图像或非视觉模态上的表现,留作未评估的问题。