研究者提出用零空间投影净化 LoRA 微调 LLM 的后门
Backdoor Purification for LoRA-Tuned LLMs via Null-Space Projection
对 LoRA 微调 LLM 做后门净化:在不依赖触发词、干净参考或对嫌疑适配器再训练的前提下,用合成变体估计后门方向并做零空间投影,把多种攻击的 ASR 从 100% 降到个位数,同时保留基座与下游能力。
攻击者对公开基座 θ0 有 white-box 访问并控制 LoRA 微调的投毒策略,后门只写入 LoRA、θ0 不变。
- LoRA 微调让后门能以很小的参数改动植入 LLM。已有净化方法通常依赖触发词知识、干净参考模型或再训练,而且很少同时检查适配器新学到的下游能力。
- 作者提出零空间投影:在同一基座上用随机触发–行为对训练合成后门变体,在 LoRA 更新空间用共识聚合估计共享的低秩后门方向,再把嫌疑适配器投影到输入、输出通道的正交补空间;生成任务默认全投影,分类任务用部分投影,全模型时再加按头和多阶段投影。
- 在 LLaMA2-7B/13B-Chat 的 Sentiment Steering 与 Targeted Refusal 上,五种攻击的无防御 ASR 为 100%;投影后平均 ASR 为 2.80%–8.50%,GSM8K 下游分数接近无防御。作者称相对剪枝、量化、CROW、Vaccine 等基线,ASR 与下游效用同时更好;CleanASR 始终低于 1%。
- 作者把保证限定在低秩 LoRA 适配器;高秩(r≥32)、跨任务和最坏自适应攻击者仍更难,边界写在附录 G.1。实验覆盖 7B/13B 的开源对话与代码模型、五种攻击和三种任务,并用合成变体与验证集选择投影。
- 威胁模型
- 攻击者对公开基座 θ0 有 white-box 访问并控制 LoRA 微调的投毒策略,后门只写入 LoRA、θ0 不变。防御者只拿到 θ0 与嫌疑适配器 ϕ⋆,不知触发规则、恶意输出或投毒数据,也没有干净参考适配器;可在 θ0 上用合成数据做辅助 LoRA 微调,但不允许对嫌疑适配器做事后再训练,也不允许改基座。
- 模型
- LLaMA2-7B-ChatLLaMA2-13B-ChatQwen2-7B-InstructMistral-7B-Instruct-0.1CodeLLaMA-7B-InstructCodeLLaMA-13B-Instruct
- 基准
- GSM8KBoolQRTEHellaSwagWinoGrandeARC ChallengeARC EasyOpenBookQAPIQAMMLUMT-BenchHumanEvalMBPPAlpaca
- 指标
- ASRUdownUbaseCleanASRpass@1
研究者提出一种针对 LoRA 微调大语言模型的后门净化方法,通过零空间投影将攻击成功率从接近 100% 降至 10% 以下。该方法不依赖触发器先验知识、干净参考模型或对可疑参数的重新训练,而是通过数据整理与特征近似提取高保真后门方向,在每一层或每个注意力头的输入与输出通道上构造正交零空间,再将 LoRA 更新投影到该空间。作者通过一系列消融实验,将方法从文本分类的单层设置逐步扩展到生成任务的全参数 LLM,并称在降低攻击成功率的同时保留了基座模型的通用能力和适配器学到的下游技能。
深度解读
这篇论文试图解决什么问题?
在不知触发词、无干净参考、不重训嫌疑适配器的条件下,净化 LoRA 后门并保住基座与下游能力。
在不知道触发词、没有干净参考适配器、也不对嫌疑适配器做事后再训练的前提下,如何去掉 LoRA 微调 LLM 里的后门,同时保住基座原有能力和适配器新学到的下游技能。
- 场景与重要性:作者认为,后门把特殊输入模式(触发)与恶意输出绑在一起,触发出现时才激活,否则几乎与干净模型一致。LLM 的输入–输出空间很大,后门更容易泛化;LoRA 只改一小部分参数,植入更省。作者认为这对安全部署构成更严重的威胁。
- 现有方法的不足:作者把防御分成数据中心(拿到可能被投毒的数据后从头训练)和模型中心(净化已有模型、没有原始训练样本)。本文关注后者。作者称已有净化常至少依赖其一:事先知道触发或做昂贵的触发反演、用干净参考模型做中和或蒸馏、或不同程度再训练。作者还称近期不依赖这些假设的工作(Li and Kim [30]、CROW [44])仍主要只评基座能力,忽略攻击过程中新学到的知识。
- 核心假设:触发与恶意行为的关联落在一个紧凑特征子空间里,并且会同时出现在激活和参数更新中。作者认为现代 LLM 的激活空间和全参数空间都极高维,激活还受残差混合,所以转向只看 LoRA 更新:有效更新已在低秩空间,后门更新的内在秩还受 LoRA 秩约束。
- 本文提出什么:给定基座和一个被后门的 LoRA 适配器,先用自建混合数据和随机触发在同一基座上微调 N 个后门变体,再在参数更新空间提取共享方向、按层或按头构造正交零空间,最后把原适配器投影到这些零空间。作者称该流程不需要知道触发、不需要辨认确切的触发–行为对、不需要干净参考适配器(只需对基座做 black-box LoRA 微调),也不重训嫌疑参数;对常用基座,零空间可离线预计算,部署时一次投影。
- 威胁模型:
- 受害系统:公开预训练基座 θ0 上做 LoRA 下游适配;攻击发生在适配阶段,防御者事后拿到可能被后门的适配器并试图净化。
- 攻击者知识与能力:对 θ0 有 white-box 访问,并控制 LoRA 微调过程,具体是投毒策略(如何构造带触发样本及其目标行为)。攻击只改 LoRA 适配器,θ0 保持不变。
- 防御者知识:拿到 θ0 和嫌疑适配器 ϕ⋆,但没有触发规则、确切恶意输出、任何投毒数据或干净参考适配器。
- 防御者能力:可以在 θ0 上用合成数据做辅助 LoRA 微调;不允许对嫌疑适配器做事后再训练(某些基线放宽此限制);防御只在 LoRA 参数空间进行,不允许改基座(某些基线放宽此限制)。目标是 ASR(ϕ̃) ≪ ASR(ϕ⋆),同时 Ubase 与 Udown 都近似保持。
有哪些相关研究?
作者把相关工作分成数据中心防御、依赖强假设的模型净化,以及不依赖触发或干净参考的近期净化。
作者在引言和第 5 节把相关讨论放在附录 A,正文只给出分组和与本文的对照。按正文实际讨论过的内容,可分成下面几组。
后门攻击与 LoRA 植入
- 经典与文本后门:Gu 等人的 BadNets [18]、BadNL [8] 以及综述 [35, 70] 描述训练期植入触发–行为关联,无触发时几乎与干净参考一致。作者引用的后续文本攻击包括句法触发 Hidden Killer [48]、BITE 迭代注入 [64]、VPI 虚拟提示注入 [65]、复合触发 CTBA [22]、多触发 MTBA [33] 和 Sleeper Agents [23]。
- LLM 与 PEFT:作者称新兴工作认为后门因 LLM 巨大的输入–输出空间更容易泛化 [23, 63];Dong 等人 [14] 与 Hu 等人的 LoRA [21] 被用来说明只改一小部分参数就能更省地植入。指令微调投毒 [54, 59]、权重投毒 [28] 和 RLHF 投毒越狱后门 [50] 也在参考文献中出现,正文未逐篇展开。
依赖触发、干净参考或再训练的防御
- 数据中心:拿到可能被投毒的数据集后从头训练干净模型,代表包括 Anti-Backdoor Learning [31]。作者把这类与本文的模型中心净化分开。
- 模型中心但假设更强:作者点名两类不足:许多方法需要事先知道触发,或依赖昂贵的触发反演 [6, 53];另一些假设有干净参考模型做中和或蒸馏,并在一定程度上再训练 [36, 68]。ONION [47]、Neural Attention Distillation [34]、Fine-mixing [68]、CleanGen [36] 属于这一谱系,正文未逐项给数字对比。
不依赖触发知识与干净参考的近期净化
- Vaccine 与 CROW:Li and Kim [30](作者自己的前作,ICLR 2026)和 Min 等人的 CROW [44] 被作者称为注意到上述约束并设计了相应防御。作者称它们和多数先前工作一样,主要只评后门注入之前的基座能力,忽略攻击期间新学到的知识 [70]。变体共享方向的想法也与 Li and Kim [30] 相同;作者把与该工作的区别放在附录 A.1。
- 编辑与剪枝类基线:实验里还对比了干净样本微调 [49]、幅度剪枝 [19, 61]、Fine-Pruning [37]、激活上的 PCP [29]、4-bit 量化 [27, 36]。AlphaEdit [16] 用零空间约束做知识编辑,出现在参考文献中;正文未把它当作净化基线展开。
基线方法与基准
- 基线方法:Finetuning、Magnitude-based Pruning、Fine-Pruning、PCP on Activations、4-bit Quantization、CROW、Vaccine。作者称筛选标准是:不需要触发知识,且不依赖外部干净参考模型。Vaccine 被作者称为近期 state-of-the-art。
- 基准/数据集:下游效用主要报 GSM8K;基座效用用 BoolQ、RTE、HellaSwag、WinoGrande、ARC Challenge、ARC Easy、OpenBookQA、PIQA、MMLU,以及开放式的 MT-Bench。代码场景用 HumanEval 与 MBPP。消融数据还包括自建常识问答、颜色分类和 Alpaca 随机样本。
作者把本文定位为:上述约束都不需要,并且在压低 ASR 的同时显式评估净化对新学技能的影响,作者称这种影响是无害的。零空间可对常用基座离线预计算,部署时一次投影。
论文如何解决这个问题?
用合成变体估计共享后门方向,再把嫌疑 LoRA 更新投影到输入与输出通道的正交零空间。
整体思路是 Null-Space Projection(零空间投影):不从嫌疑适配器本身拆后门,而用同一基座上、不同触发–行为对训练出的合成变体,估计共享的低秩后门方向,再把嫌疑 LoRA 更新投影到该方向的正交补。消融从单层分类逐步放到全层生成,策略按 Table 1 累加。
问题设定与形式化
- LoRA 更新:层 ℓ 的权重写成 Wℓ ↦ Wℓ + ΔWℓ,ΔWℓ = sℓ Bℓ Aℓ,秩至多为 rℓ。适配器记为 ϕ = {(Aℓ, Bℓ, sℓ)}。
- 后门定义:注入算子 inj 把触发 t 插入良性提示得到 xtrig。ϕ⋆ 被后门化需同时满足良性一致性(无触发时近似良性适配器)和触发激活(带触发时输出落入攻击目标集合 Satk 的概率 ≥ τ)。ASR 是触发分布上该事件的期望,见式 (4)。
- 两类效用与目标:Ubase 是微调前已在基座里的能力,Udown 是适配器应学到的下游能力,见式 (5)。净化算子 Π 把 ϕ⋆ 映到 ϕ̃,要求 ASR 明显下降,两类效用都近似保持。
Oracle 分解与投影
- 分解:作者假设 ΔWℓ⋆ = ΔWℓ,benign + ΔWℓ,bd。由秩不等式,更新秩不超过 LoRA 秩。对 ΔWℓ⋆ 做 SVD 后,作者假定后门集中在一小片奇异向量上(例如 |Kℓ,bd| = 1),且与良性分量的 Frobenius 内积接近 0。Figure 1 画的是双侧全投影:输出空间的 Uℓ,bd 与输入空间的 Vℓ,bd 被抑制,正交补被保留。
- 零空间与全投影:取后门方向的单位向量,做成输入、输出通道上的正交投影 Pℓin、Pℓout,零空间投影是单位阵减去它们。净化更新为 ΔW̃ℓ = (I − Pℓout) ΔWℓ⋆ (I − Pℓin),即式 (14)。作者称这会去掉落在任一通道后门子空间里的分量。在 oracle 假设下,后门项投影后约为 0,良性项近似保留,见式 (15)。
- 部分投影:良性更新与估计出的后门子空间可能不正交。Figure 2 把这种纠缠画成部分投影。作者用 α ∈ [0, 1] 做插值:ΔW̃ℓ(α) = (1 − α) ΔWℓ⋆ + α Pℓout,null ΔWℓ⋆ Pℓin,null,α = 0 是原更新,α = 1 是全投影。投影后用截断 SVD 把更新重新分解成 LoRA 因子(附录 B.7)。非正交边界放在附录 B.3 与 B.4。
四组消融如何把方向估出来
- Ablation I(单层、无新知识):只训练一个 MLP 的 up-projection,例如 model.layers.12.mlp.up_proj,秩 8,学习率 5×10−5,10 个 epoch。良性标签由基座贪心解码自生成,再做成 True/False 单 token 判断,使更新主要由后门目标主导。从该更新取 top-1 左右奇异向量构造零空间并全投影(α = 1)。Figure 3 中,无新知识的奇异值谱比有新知识更集中。
- Ablation II(单层、有新监督):作者认为一旦更新里混有下游方向,就不能再从嫌疑更新本身抽“纯”后门方向。假设是:同一攻击目标下,不同触发–行为对会诱导相同或相近的参数空间方向。于是训练 N 个合成变体,每个用不同触发–行为对,目标行为仍是单 token;良性数据仍按 Ablation I 生成,使变体更新由后门机制主导。三种聚合(pre-avg、proj-mean、consensus,算法 1–3)估计共享的 rank-1 方向,主结果用 consensus。同时加入分布外的颜色单 token 分类,用来测新学到的技能。全投影会伤到下游,因此改用部分投影。
- Ablation III(单层、生成式):良性数据改为 800 条 Alpaca 随机样本加 GSM8K 数学题。变体只从 Alpaca 采样,标签由基座贪心解码(附录 E.1)。下游改报 GSM8K。作者称自由生成下,变体估计的方向对任务分量的泄漏小于单 token 分类,全投影即可;部分投影仍作为后备。
- Ablation IV(多层):同一基座、同一混合生成数据和同一后门构造,比较四个 LoRA 表面:S1 单个 MLP 块;S2 连续 12 个 MLP 块;S3 连续 12 个块、Attention 与 MLP 都加 LoRA;S4 全部 Transformer 块的 Attention 与 MLP。S3 上层级投影后 ASR 上升,作者推测注意力应按头而不是按层组织,于是对注意力改成按头提取子空间并投影(附录 E.2,算法 4–6)。S4 在按头投影后仍有残留;作者比较变体在早(约 100 步)、中(约 400 步)、晚(约 900 步)检查点以及多组学习率和 epoch 下的子空间,发现不同检查点激活的评测样本不同,尤其是早与晚。因此按三个超参组,把早、中、晚检查点的投影依次施加(附录 E.2、Figure 7)。
完整流程与成功判定
- 三步:Table 1 的 Overall 是 Basic + Variant + Partial + Head-wise + Multi-stage + Val Select。(1) 匹配嫌疑适配器的 LoRA 层,在后门信号占主导的混合数据上,用多样化触发–行为对训练 N 个变体;(2) 对每层收集变体的低秩更新,用 consensus 得到共享的 rank-k(通常 rank-1)方向及其正交零空间,CTBA 一行改用 pre-avg 或 proj-mean 且 k=4;(3) 对真实适配器做零空间投影,生成任务实验中通常 α = 1,纠缠的分类任务 α ∈ [0.2, 0.4]。多阶段时用目标任务的留出验证集做选择。
- 主实验训练:除非另说,真实后门适配器学习率 3×10−5、8 个 epoch。生成任务 α 默认 1;纠缠分类在仅良性的验证集上按 0.1 步减小 α(附录 B.5)。
- 判定:ASR 按式 (4),看触发输入的输出是否落入 Satk(附录 D.4)。CleanASR 是良性提示上的假阳性率,作者用它排除关键词匹配伪影。Udown 在 GSM8K 等下游任务上计算,Ubase 在九个封闭基准加 MT-Bench 上计算。附录给出变体构造、聚合算法和评测规则,不在此复述其中的触发字符串或目标输出。
论文做了哪些实验?
五种攻击、三种任务上,投影把 ASR 从 100% 降到平均 2.80%–8.50%,GSM8K 接近无防御。
实验设置
- 被测模型:通用指令跟随用 LLaMA2-7B-Chat、LLaMA2-13B-Chat、Qwen2-7B-Instruct、Mistral-7B-Instruct-0.1。代码只在代码注入场景加 CodeLLaMA-7B-Instruct 与 CodeLLaMA-13B-Instruct。消融沿用同一基座,正文未在消融小节单独写出模型名。
- 任务与攻击:Sentiment Steering(触发出现后翻转或引导回复情感)、Targeted Refusal(触发下系统性拒答)、Code Injection(代码生成中插入恶意片段)。五种攻击:BadNets [18]、CTBA [22]、MTBA [33]、Sleeper [23]、VPI [65],覆盖 token 级、span 级和提示级投毒。
- 基线:Finetuning、Magnitude-based Pruning、4-bit Quantization、CROW、Fine-Pruning、Vaccine、PCP。作者称只纳入不需要触发知识、也不依赖外部干净参考的方法,并对部分基线放宽“不重训嫌疑适配器”和“不改基座”。
- 数据与训练:真实适配器默认学习率 3×10−5、8 epoch;LoRA 层与变体数据沿用 Ablation III/IV。Ablation I/II 的单层为 rank-8、5×10−5、10 epoch。Ablation I 的 ASR 划分是 train 500/500、val 100/100、test 200/200(干净/触发)。变体个数 N 的具体取值论文在正文未给出数字。
- 指标:ASR 越低越好,Udown、Ubase 越高越好。Sentiment Steering 与 Targeted Refusal 的 Udown 是 GSM8K。Ubase 为 BoolQ、RTE、HellaSwag、WinoGrande、ARC Challenge、ARC Easy、OpenBookQA、PIQA、MMLU 的平均,另加 MT-Bench。CleanASR 为良性提示上的假阳性率。代码场景的指标在附录,正文主表未单列 pass@1 的定义细节。
- 评审:ASR 与 CleanASR 按规则判定输出是否属于攻击目标(附录 D.4)。论文未报告人工一致性或 LLM 评审模型。投影强度与多阶段由目标任务的留出验证集选择。重复次数论文未报告。
主结果
主表是 LLaMA2 上 Sentiment Steering(Table 2)和 Targeted Refusal(Table 3),格子为 ASR / GSM8K 上的 Udown。CTBA 用 pre-avg 或 proj-mean 且 k=4,其余行为 consensus。CleanASR 在干净、被攻击和净化模型上始终 < 1%。
表格较宽,可左右滑动
模型与任务 无防御 ASR / Udown Ours ASR / Udown Vaccine ASR / Udown 出处 7B Sentiment 平均 100.00 / 27.81 2.80 / 27.93 7.40 / 15.58 Table 2 13B Sentiment 平均 100.00 / 34.01 4.00 / 33.81 9.80 / 18.76 Table 2 7B Refusal 平均 100.00 / 27.53 5.20 / 27.68 13.90 / 13.17 Table 3 13B Refusal 平均 100.00 / 33.92 8.50 / 33.82 17.80 / 20.16 Table 3 7B Sentiment 最差单攻击 Sleeper 以外均为 100 / 约 28 MTBA 0.00 / 28.55;最高残留 BadNets 5.00 / 28.34 Sleeper 14.50 / 16.02 Table 2 13B Refusal 最差单攻击 均为 100.00 MTBA 14.5 / 33.84 BadNets 21.00 / 19.21 Table 3 - 作者的解读:作者称主要困难不是单纯压 ASR,而是不能毁掉 LoRA 里与任务相关的适配。Pruning、CROW、Fine-Pruning 更强地压后门时,下游掉得更多;Quantization 与 PCP 更保效用,但 ASR 仍然不低。作者称本文在 ASR 和 Udown 上都优于全部基线,Udown 接近无防御。
- Table 2 的反例需要单独看:LLaMA2-7B-Chat 的 VPI 上,CROW 的 ASR 为 4.00,Vaccine 为 4.50,本文为 3.00,三者接近;Sleeper 上本文 1.50,低于 Vaccine 的 14.50 和 CROW 的 76.50。13B 的 VPI 上本文与 CROW 同为 8.50。作者写的是平均意义上同时更好,不是每一个格子都是全表最低。
- Ubase:作者称各防御的基座效用大体相当,差异主要在 ASR 与 Udown;具体分数在 Table 5,正文未列出逐项数字。Qwen2 与 Mistral、代码注入和更多消融在附录 F.1–F.8,作者称在 Mistral 和 Qwen2 上“even more effective”,附录数字未在正文展开。
消融 I–IV
- 测了什么 → 结果:Ablation I 在单层、无新知识、α = 1 时,作者称 ASR 从近 82% 降到 1%(Figure 4a 标注 Before ASR 82.0、After 1.0),Ubase 平均从 63.4 到 63.5。Ablation II 在 α = 0.3 时,Figure 4b 标注 ASR 从 76.5 到 0.0,Ubase 从 64.4 到 64.3。Figure 5 中 α = 1 时 True/False 与颜色分类都掉到红色虚线以下;作者称 α 大致在 [0.2, 0.4] 时 ASR 可降到与全投影相近的低水平,两项准确率大体保留。作者推测原因是单 token 输出空间很小,良性与后门在更新空间重叠。
- 生成式单层:Figure 6 标注 Ablation III 净化前 ASR 为 45.0,净化后未在图注中给出端点数字;Ubase 从 63.4 到 63.7,GSM8K 从 31.0 到 30.2。作者称全投影既明显降低 ASR,又大体保住下游,并认为自由生成下后门方向对任务分量的泄漏更小。
- 多层:S1、S2 投影后 ASR 降到 0% 或很接近 0%,Ubase 与 Udown 基本不变。S3 用原来的按层投影后 ASR 上升;改成按头后 ASR 再次接近 1%,两种效用保持稳定。S4 按头后仍有残留;多阶段(早/中/晚检查点 × 三组超参)后 ASR 降到与 S1–S3 相同的个位数,效用基本不变。作者认为不同检查点捕捉到互补的后门分量。
自适应攻击与谱
- 测了什么 → 结果:作者称对压平 LoRA 谱或提高 LoRA 秩的自适应攻击者,使用秩匹配的合成变体后,ASR 从 100% 降到 0.5%(附录 F.9)。Figure 3 对比无新知识与有新知识的奇异值能量:无新知识时谱更集中。
- 作者的解读:作者把跨任务(拒答与情感引导)、跨规模(7B 与 13B)和五种攻击上的同类优势,解释为 LoRA 更新空间里后门由一小段方向介导,而不是依赖模型特定的启发式。偶发的 Udown 高于无防御,作者归因于投影额外去掉了后门带来的离任务干扰,并称为初步观察,更严格的机制研究留给未来(附录 G.3)。
其他消融与分析
- 聚合:主结果用 consensus;CTBA 用 pre-avg 或 proj-mean、k=4(Table 2 脚注);另外两种聚合的趋势放在附录 F,正文称三种方案趋势一致。
- 投影强度:生成任务默认 α = 1;分类在良性验证集上按 0.1 步下调(附录 B.5)。Ablation II 报告中间强度约 α ∈ [0.2, 0.4]。
- 检查点:变体早/中/晚约 100、400、900 步,各自投影仍有残留,激活样本尤其在早、晚之间不同(第 3.6 节)。
- CleanASR:Table 2、Table 3 的设置下,干净、被攻击、净化模型均 < 1%。
- 几何证据与 NSP 高于干净微调的讨论分别在附录 G.2、G.3;高秩与跨任务的操作边界在附录 G.1。
- 负面结果:S3 按层投影后 ASR 上升;S4 单次按头投影后仍有非零残留;Ablation II 全投影同时伤两类下游准确率;13B Targeted Refusal 的 MTBA 上本文 ASR 为 14.5,高于同表若干更易攻击(如 CTBA 的 3.50)。
有什么可以进一步探索的点?
作者把保证限定在低秩 LoRA;高秩、跨任务和最坏自适应攻击仍更难,机制研究留待以后。
作者指出的局限与后续方向
- 保证的范围:第 5 节写明,保证限定在具有低秩后门结构的 LoRA 适配器;高秩(r ≥ 32)、跨任务,以及最坏情况的自适应攻击者仍然更难,操作边界在附录 G.1 明确报告。(第 5 节 Limitation)
- 机制尚未做完:第 4.1 节把“投影有时让 Udown 高于干净或微调基线”称为初步观察,并把更严格的机制研究推迟到未来工作(附录 G.3)。这是作者明确标成 future work 的一项,不把它当成已完成的解释。
- 相关工作与更广影响:作者称相关工作和更广影响放在附录 A 与 H,正文没有再列其他局限条目。(第 5 节)
论文没有单独的 Future Work 小节。伦理或更广影响附录若只描述研究做法,这里不收录。
实验覆盖范围
- 模型:正文主实验为 LLaMA2-7B-Chat 与 LLaMA2-13B-Chat 的完整表;另包括 Qwen2-7B-Instruct、Mistral-7B-Instruct-0.1,以及仅用于代码注入的 CodeLLaMA-7B/13B-Instruct。Qwen2、Mistral 与代码注入的数字在附录 F.1–F.8,正文未列出。
- 攻击与任务:五种攻击(BadNets、VPI、Sleeper、CTBA、MTBA)和三种任务(Sentiment Steering、Targeted Refusal、Code Injection)。主表只展开前两种任务的 ASR 与 GSM8K。
- 防御比较:同一表内比较无防御、Finetuning、Pruning、Quantization、CROW、Fine-Pruning、Vaccine、PCP 与本文。CleanASR 在这些表的设置下报告为 < 1%。
- 方法变体:消融覆盖单层到全部 Transformer 块(S1–S4)、按层与按头、部分投影 α、以及早/中/晚检查点的多阶段投影。自适应设置(压平谱或提高秩,匹配秩变体)的结果在附录 F.9,ASR 从 100% 到 0.5%。
- 论文未报告的项:正文未给出变体数量 N 的具体数字、ASR 评测的重复次数,也未报告人工与规则判定的一致性;Ubase 的逐基准分数指向 Table 5,正文未抄出。高秩 r ≥ 32 的结果按作者所说放在附录 G.1 的边界里,而不是主表。
总结一下论文的主要内容
零空间投影用合成变体去掉 LoRA 后门方向,五种攻击上 ASR 降到个位数且 GSM8K 接近原适配器。
Null-Space Projection 面向已经做完 LoRA 微调、手里只剩基座和嫌疑适配器的净化:不查触发词、不用干净参考、也不重训这块嫌疑适配器。
- 问题:攻击者在适配阶段控制投毒,后门只写进 LoRA。已有净化往往要触发知识、干净参考或再训练,而且很少同时检查适配器新学到的下游技能。作者假设后门落在 LoRA 更新的一小段方向上,并且不同触发–行为对会共享相近方向。
- 做法:在同一基座上用随机触发训练合成变体,用 consensus(CTBA 用另两种聚合且 k=4)估计每层或每个注意力头的共享方向,把嫌疑更新投影到输入、输出通道的正交补。生成任务用全投影,单 token 分类因方向纠缠改用 α 约 0.2–0.4 的部分投影;适配面扩到全模型时,再串上早、中、晚检查点的多阶段投影,并用留出验证集选择。
- 主结果:LLaMA2-7B-Chat 上,Sentiment Steering 五种攻击平均 ASR 从 100.00% 到 2.80%,GSM8K 从 27.81 到 27.93;Targeted Refusal 平均 ASR 到 5.20%,Udown 27.68(无防御 27.53)。13B 上两组平均 ASR 分别为 4.00% 与 8.50%,Udown 为 33.81 与 33.82,对应无防御 34.01 与 33.92(Table 2、Table 3)。同表中 Vaccine 的平均 ASR 更高,且 GSM8K 明显更低。CleanASR 始终 < 1%。
- 消融与自适应:单层无新知识时 ASR 从约 82% 到 1%(Figure 4a)。按层投影在注意力表面上曾使 ASR 上升,改成按头后回到约 1%。压平谱或提高秩的自适应攻击,在秩匹配变体下 ASR 从 100% 到 0.5%(附录 F.9)。
- 作者的结论:作者认为同一套投影能同时处理拒答和情感引导、7B 与 13B、五种攻击,是因为后门由 LoRA 更新空间里的少量方向介导。保证限于低秩结构;r ≥ 32、跨任务和最坏自适应攻击者仍然更难。