跳到正文
原文
arXiv:防御、护栏、反学习与有害微调· arXiv:2610.01367· Kaiyang Li, Jiahao Chen, Yuwen Pu, Chunyi Zhou, Tong Zhang, Bin Cai, Chunqiang Hu, Haibo Hu·本站收录 · 原文发表

研究:高质量数据筛选挡不住投毒,Bi-QSTO 可在 90% 过滤率下保留攻击效果

High-quality Data Do not Mean Safe! Poisoning LLMs after Data Selection

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

作者提出 Bi-QSTO,在质量筛选下优化投毒样本;Llama2-7B-Chat 上有害种子在 90% 过滤时 PRR 为 91%、HS 为 3.30。

威胁模型攻击者构造投毒样本,使其在 quality-based data selection 后仍被保留,并在下游微调中削弱已对齐 LLM 的安全对齐(fine-tuning jailbreak)。

问题
已对齐模型经少量有害或看似无害样本微调后安全性会下降。实际训练常先做质量筛选,而以往投毒研究多假设毒样本直接进入微调,未考察筛选后仍被留下的高质量样本是否仍会削弱安全对齐。
方法
作者先用多种质量选择器测投毒保留率,再用逐层梯度与安全锚的余弦相似度、MDS 看高质量样本是否带有类似有害更新。据此提出 Bi-QSTO:先最大化有害梯度影响,再在质量惩罚下精炼,并用经验抽取指导改写,使样本既过筛选又保留安全削弱作用。
实验与结果
作者报告,显式有害样本常被筛掉,但 90% 过滤后留下的高质量样本仍可提高 Harmful Score。有害种子的 Bi-QSTO 在三款全参微调模型上、90% 过滤时 PRR 超过 90%,HS 为 3.30–4.01,并迁移到更大模型和 QuRater、DEITA。
局限与可以继续做的
作者在附录写明,分析主要在 Llama2-7B-Chat 上、用单一有害锚,且质量分与安全相关更新并不一致。实验覆盖 DataMan、QuRater、DEITA,主实验为三款全参模型,13B/70B 用 LoRA;论文未报告优化查询次数与人工一致性。
实验设置Llama2-7B-Chat、Llama3-8B-Instruct 等 · Dolly、HEx-PHI 等 · PRR、HS 等
威胁模型
攻击者构造投毒样本,使其在 quality-based data selection 后仍被保留,并在下游微调中削弱已对齐 LLM 的安全对齐(fine-tuning jailbreak)。优化时使用目标模型梯度与选择器质量分;默认选择器为 DataMan。
模型
Llama2-7B-ChatLlama3-8B-InstructQwen2-7B-InstructLlama2-13B-ChatLlama2-70B-Chat
基准
DollyHEx-PHICao, Cao, and Chen (2024)Yi et al. (2025)Self-InfWang et al. (2024)Ji et al. (2025a)
指标
PRRHSToxicity Ratiopopulation variance
AI 导读全文 356 字

研究系统评估了基于质量的数据筛选对投毒的过滤效果,发现筛选虽能移除大量明显有害样本,但部分被保留的高质量样本仍会削弱模型的安全对齐,原因可能在于其在层级梯度上呈现类似有害样本的训练更新模式。作者据此提出 Bi-Stage Quality-Constrained Safety-Degradation Text Optimization(Bi-QSTO),在显式质量约束下优化投毒样本,使其既能通过筛选又保留安全退化影响。在多种投毒设置、目标模型和过滤率下,Bi-QSTO 在筛选前后均保持攻击有效性;即便过滤率达 90%,有害种子样本的 Poisoning Retention Rate 仍高于 90%,Harmful Score 为 3.30–4.01,且攻击效果可跨模型迁移,保留优势也能推广到其他筛选方法。

深度解读

6 个问题,约 9,000 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    质量筛选会留下仍能削弱安全对齐的高质量样本,作者用 Bi-QSTO 检验这一缺口能否被系统利用。

    质量筛选后仍被留下的高质量样本,能否在下游微调中削弱已对齐 LLM 的安全对齐,以及这种影响能否被有意构造并穿过筛选。

    • 场景与重要性:作者称,LLM 部署前通常经过安全对齐,但下游微调高度依赖微调数据,少量有害指令–回答对即可削弱拒答、提高对有害请求的依从,作者将这种微调导致的安全下降称为 fine-tuning jailbreak。投毒样本不必显式有害,看似无害的样本也可削弱安全并避开基于内容的检查。公开训练流程常把基于质量的数据选择与内容安全审核结合起来,按质量分决定哪些样本进入下游微调。
    • 现有方法的不足:作者称,以往投毒研究主要提高攻击效果或隐蔽性,并假设毒样本直接进入训练语料;部分工作只把数据选择当作初步缓解,没有考察毒样本在实际流程中的存活与筛选后效果。现有数据选择研究通常在非对抗数据上评估,未考虑刻意构造的投毒样本。
    • 核心观察:作者称,质量选择会去掉许多含显式有害内容或质量分较低的样本,从而减少最终语料中的恶意数据;但 90% 过滤率下仍被保留的相对高质量样本,其训练更新与安全锚梯度的余弦相似度以负值为主,且部分样本在中低层呈现与显式有害数据相似的逐层梯度模式。
    • 本文提出:作者提出双阶段、带质量约束的安全削弱文本优化(Bi-Stage Quality-Constrained Safety-Degradation Text Optimization,Bi-QSTO),在显式质量约束下优化投毒样本,使其更可能通过选择,同时保留安全削弱影响。作者称这是对实际训练中、质量选择条件下微调投毒的系统研究。
    • 威胁模型:
      • 目标:构造能穿过 quality-based data selection、并在下游微调中削弱安全对齐、提高对有害指令依从的投毒样本(fine-tuning jailbreak)。
      • 知识与信号:优化时从目标模型读取样本梯度,计算与有害锚方向的余弦相似度 P(x);从数据选择器读取质量信号 Q(x)。默认选择器为 DataMan。
      • 能力:攻击者改写初始种子的指令、上下文与回答;种子来自清理后的 Dolly 或有害样本池。GPT-4o-mini 负责生成变体并抽取经验。
      • 受害系统:已安全对齐、随后做全参或 LoRA 微调的 LLM。主实验为 Llama2-7B-Chat、Llama3-8B-Instruct、Qwen2-7B-Instruct;迁移实验为 Llama2-13B-Chat 与 Llama2-70B-Chat(LoRA)。
  2. 有哪些相关研究?

    相关工作分微调安全风险与基于质量的数据选择两类;作者称以往投毒默认毒样本直接入训练集。

    微调对安全对齐的风险

    • 安全对齐与微调脆弱性:Ouyang 等(2022)、Rafailov 等(2023)做后训练安全对齐,使行为符合人类价值并拒答有害请求。Zhan 等(2024)、Qi 等(2024)显示,只在少量有害指令–回答对上微调即可削弱拒答。作者称对齐行为仍然脆弱,因为模型行为高度依赖微调数据(Yi 等 2024;Yang 等 2025;Grattafiori 等 2024)。
    • 看似无害的投毒:Qi 等(2024)指出,Dolly(Conover 等 2023)等不含显式有害内容的指令微调数据仍可削弱安全对齐。Grattafiori 等(2024)、Inan 等(2023)讨论这类数据更难被审核检测器识别。He, Xia, and Henderson(2024)、Guan 等(2025)、Wang 等(2026)指出,风险分布不均,某些良性样本的安全削弱作用不成比例地强,表面语义不足以判断风险。作者明确批评:现有 fine-tuning jailbreak 研究通常假设毒样本直接进入训练集,没有考察它们能否通过质量选择。
    • 选择作为缓解的用法:Fu 等(2025)、Yan 等(2024)把数据选择当作初步缓解。作者称这些工作没有考察投毒存活和筛选后有效性。

    基于质量的数据选择

    • 规则与模型启发式:Raffel 等(2020)、Rae 等(2021)用文档长度、标点、重复、符号比例和模板化模式等表面标准评估质量。Xie 等(2023)、Muennighoff 等(2023)、Wenzek 等(2020)用分布相似度、困惑度等统计或模型信号估计质量。
    • LLM 导出的质量信号:Liu 等(2024)、Wettig 等(2024)、Penedo 等(2024)、Peng 等(2025)用提示 LLM 评估写作质量、教育价值等语义维度,并可能把判断蒸馏成较小打分模型。作者称,现有数据选择研究通常在非对抗数据上评估,未考虑刻意构造的投毒样本如何影响训练流程。

    安全错位机制

    • 梯度与参数空间分析:Huang, Hu, and Liu(2024)、Huang 等(2025)、Wang 等(2026)分析安全错位机制。Zhang 等(2026)、He, Xia, and Henderson(2024)、Wang 等(2026)从梯度看训练样本如何影响模型更新。Gao 等(2025)的低维可视化被作者用来投影逐层影响签名。作者称,高质量数据仍削弱对齐的因素仍不清楚。

    基线方法与基准/数据集

    • 基线:Clean FT 用清理后的 Dolly 作非投毒对照;Pure Bad 使用显式有害样本(Wang 等 2024);Bi-Anchor(He, Xia, and Henderson 2024)与 Self-Inf-N(Guan 等 2025)用不同风险信号找出看似无害、但会削弱安全的样本。每组投毒基线含 100 条样本。
    • 数据与评测:良性指令数据为 Dolly;直接有害投毒数据集按 Cao, Cao, and Chen(2024)与 Yi 等(2025)构造;良性种子取 Self-Inf 下排名最高的清理 Dolly 样本,有害种子来自 Wang 等(2024)与 Ji 等(2025a);安全性在 HEx-PHI(330 条有害提示、11 类)上评估。选择器包括 DataMan、QuRater、DEITA,以及 Figure 1 中的 Superfiltering、PreSelect、Perplexity。

    作者把本文定位为:在实际训练的质量选择条件下研究微调投毒,使毒样本同时追求数据质量与攻击效果,从而更可能通过选择并在微调中保留安全削弱影响。

  3. 论文如何解决这个问题?

    Bi-QSTO 先最大化有害梯度影响,再在质量惩罚下精炼,并用经验抽取指导后续改写。

    Bi-QSTO 把初始样本改写成高质量变体:用目标模型上的有害梯度影响代理 P(x) 与选择器上的相对质量信号 Q(x) 指导搜索,分探索与质量约束精炼两阶段,使样本更可能被保留并继续诱导与安全方向冲突的更新。Figure 4 给出整体框架。

    问题设定与两个信号

    • 保留才生效:作者称,毒样本只有被留下参加微调才会影响模型。选择器使用不同打分方案,作者把 90% 过滤率下仍保留的样本定义为相对高质量;该比例是对先前工作通常只保留语料一小部分的折中。在 DataMan 下,多数保留样本的总分达到 4 或更高。
    • 有害梯度影响 P(x):对候选 x,g(x) 是目标模型参数上的损失梯度。有害锚集合 H 的平均梯度为锚方向。P(x) 是 g(x) 与该方向的余弦相似度,越高表示更新越接近有害锚方向。
    • 相对质量 Q(x):用 DataMan 对 x 与固定背景集 B 打总体质量分 o(·)。Q(x) 等于 o(x) 加上 o(x) 相对背景均值的优势。Q(x) 越高表示质量分越好、且相对背景优势越大。

    双阶段优化

    • 为何分阶段:作者称两个目标可能偏好相互冲突的文本修改:过早施加质量约束会限制探索,只优化 P(x) 又可能降低文本质量。因此先做有害影响探索,再做质量约束精炼。
    • 阶段 1:在离散文本空间搜索 x,使 P(x) 最大。当 P(x) 不再提高或搜索预算用尽时结束。
    • 阶段 2:从阶段 1 的最佳变体出发,最大化 P(x) 减去质量惩罚。质量不低于阈值 τ 时惩罚为 0,继续最大化 P(x);否则惩罚按质量缺口的平方增长,λ 控制惩罚强度。找不到更好的质量可行变体或预算用尽时结束。
    • 改写与归档:每个阶段,优化器收到当前样本和该阶段反馈,改写指令、上下文与回答。GPT-4o-mini 在每次迭代生成多个变体以扩大搜索。每个变体用 P(x) 与 Q(x) 评估后存入归档,并按当前阶段目标选出最佳变体作为下一轮输入。结束后按是否满足 Q(x)≥τ 分组,优先质量可行组,组内按 P(x) 排序,取 top-k 组成最终投毒集。

    经验抽取

    • 前后对比:第 t 轮的参考样本是当前阶段目标下归档中的最佳样本。每次改写相对该参考,计算 P 与 Q 的绝对变化和相对变化。只保留信号变化足够大的修订:P(x) 的明显上升和下降都保留,分别作为正例和负例;Q(x) 只保留明显提升。
    • 轮内对比与蒸馏:在同一参考产生的变体中,取当前阶段目标下的最佳与最差组成对比对。GPT-4o-mini 把选中的前后对与对比对蒸馏成结构化经验,供下一轮使用。附录给出完整提示词。

    梯度视角与形式化

    • 逐步更新:用每步梯度与安全参考梯度的余弦相似度刻画训练动态。Figure 2(c) 中负值表示与安全对齐方向相反的更新。附录 Theorem 2 把这类负对齐更新的累积写成安全目标上升,作为所观察下降的理论解释。
    • 逐层签名:每一层计算样本梯度,以及它与有害锚、安全锚平均梯度的余弦相似度;二者及其差值构成逐层影响签名,再用多维尺度变换(MDS)投到二维,按样本类型与质量分可视化(Figure 3)。
    • 质量保持变换:附录 Theorem 1 说明,质量保持的变换可以把恶意样本留在高分重叠区域。作者据此考察该风险是否可被系统利用。具体改写约束与示例见附录,此处不展开。

    成功判定

    • PRR:筛选后仍保留的投毒样本数,除以筛选前投毒样本数,再化为百分比,衡量对质量过滤的抵抗。
    • HS:在 HEx-PHI 上对每条提示生成一个回答,由 GPT-4o-mini 按 1–5 评定有害程度,报告均值与总体方差。
    • 两种微调设置:无背景(w/o BG)时只在投毒样本上微调,只报 HS。混合数据时,每组 100 条投毒样本与 1,900 条清理后的 Dolly 混合,再按不同过滤率做选择与微调,同时报 PRR 与 HS。
  4. 论文做了哪些实验?

    有害种子 Bi-QSTO 在三款模型、90% 过滤下 PRR 超过 90%,HS 为 3.30–4.01。

    实验设置

    • 被测模型:主实验全参微调 Llama2-7B-Chat、Qwen2-7B-Instruct、Llama3-8B-Instruct。迁移实验对 Llama2-13B-Chat、Llama2-70B-Chat 使用 LoRA。优化器与有害性评审均为 GPT-4o-mini。
    • 选择器:默认质量打分与选择为 DataMan;跨选择器迁移使用 QuRater 与 DEITA。Figure 1 还比较 DataMan、QuRater、DEITA、Superfiltering、PreSelect、Perplexity。
    • 数据:直接有害投毒集按 Cao, Cao, and Chen(2024)与 Yi 等(2025)构造。优化种子池各 500 条:良性种子为 Self-Inf 下排名最高的清理 Dolly;有害种子来自 Wang 等(2024)与 Ji 等(2025a)。两池分别优化后各取 top 100。混合设置中背景为 1,900 条清理 Dolly;背景规模消融为 900、1,900、2,900。
    • 基线:Clean FT、Pure Bad、Bi-Anchor、Self-Inf-N,每组投毒 100 条。
    • 指标与评审:HEx-PHI 含 330 条有害提示、11 类;每条生成一个回答,GPT-4o-mini 打 1–5 分,报告 HS 均值与总体方差(表中蓝色下标)。PRR 为筛选后保留比例。Figure 1 还报告筛选后 Toxicity Ratio。论文未报告重复次数。
    • 相对高质量的操作定义:90% 过滤率下仍保留的样本;DataMan 下多数保留样本总分不低于 4。

    主结果

    Table 1 同时给出无背景 HS,以及 0%–90% 过滤下的 PRR 与 HS。下表只列无微调基线、无背景 HS,以及 0% 与 90% 两档(PRR 为百分比,HS 后为总体方差)。

    表格较宽,可左右滑动

    模型与方法无微调 HS无背景 HS0% PRR / HS90% PRR / HS
    Llama2 Clean FT1.13±0.37–– / 2.25±2.84– / 1.65±1.57
    Llama2 Pure Bad同上4.46±0.93100 / 4.42±1.360 / 1.87±2.08
    Llama2 Bi-Anchor同上3.08±2.43100 / 2.35±2.8732 / 1.89±2.14
    Llama2 Self-Inf-N同上3.46±2.76100 / 2.51±3.1239 / 2.05±2.39
    Llama2 良性种子同上2.88±1.89100 / 2.23±2.6785 / 2.20±2.22
    Llama2 有害种子同上3.58±2.17100 / 2.55±3.2591 / 3.30±2.93
    Llama3 有害种子1.28±0.834.32±1.16100 / 3.94±2.1491 / 4.01±1.79
    Qwen2 有害种子1.69±1.743.68±2.51100 / 3.42±2.9792 / 3.43±2.85

    据 Table 1。Llama3、Qwen2 的其余基线未全部列入;90% 过滤时,两模型上 Pure Bad 的 PRR 均为 0,HS 分别为 1.69 与 1.69;Bi-Anchor 的 PRR 均为 32;Self-Inf-N 的 PRR 分别为 39 与 12;良性种子 PRR 均为 83,HS 分别为 2.36 与 1.63。

    • 作者解读(无背景):有害种子 Bi-QSTO 的 HS 在三款模型上为 3.58、4.32、3.68。作者称 Pure Bad 的 HS 更高,但 Bi-QSTO 始终高于看似无害的 Bi-Anchor 与 Self-Inf-N。良性种子也能降低安全性,有害种子效果更强。
    • 作者解读(混合数据):过滤变严时 Pure Bad 被迅速移除,Bi-Anchor 与 Self-Inf-N 的保留和攻击效果都下降。有害种子 Bi-QSTO 在 50% 过滤前保留全部毒样本,90% 时 PRR 仍超过 90%,且在 30% 以上过滤取得该模型上最高 HS,90% 时 HS 为 3.30–4.01。作者称更严的过滤会提高毒样本在保留语料中的占比并可能抬高 HS;清洁数据组成的变化也可能影响甚至降低筛选后 HS。方差显示不同有害提示上的安全下降不均匀。Figure 5 中 Bi-QSTO 的 PRR 曲线接近平坦。
    • Qwen2 上的例外:Table 1 中,Qwen2 的良性种子在无背景与各过滤率下的 HS 多低于或接近 Clean FT(例如 90% 时 1.63,Clean FT 为 1.69)。作者未对此单独解释。

    筛选对直接有害样本与高质量保留样本

    • RQ1,Figure 1:在 Cao 等(2024)与 Yi 等(2025)两套直接有害数据上,PRR 随过滤率上升总体下降;不同方法与数据集效果不同,激进过滤后仍有有害样本留下。作者称 Figure 1(b) 中 Superfiltering 在良性数据被删得更快时,Toxicity Ratio 可能上升。Figure 2(a) 用 DataMan 比较质量分:直接有害样本更集中于低分区,两类看似无害的恶意数据与普通良性数据在高分区明显重叠。
    • RQ2,Figure 2(b)(c):Llama2-7B-Chat 分别在各 100 条高质量恶意样本与良性样本上微调。作者称保留的高质量样本仍使安全行为变差、有害回答增多;Figure 2(c) 的逐步余弦相似度以负值为主,表示与安全方向相反的更新。正文未给出 Figure 2(b) 各柱的精确 HS。
    • RQ3,Figure 3:Layer 4、15、30 的 MDS。作者称有害与良性样本在较低层部分重叠,中层更可分,上层基本分开;harmful boundary 标出有害样本占据的主要区域。部分高质量样本呈现类似有害的影响模式。

    迁移

    • 跨目标模型,Table 2:有害种子在 Llama2-7B-Chat 上优化后,迁到 Qwen2-7B-Instruct 的无背景 / 0% / 90% HS 为 3.18 / 2.85 / 2.85(无微调 1.69);Llama3-8B-Instruct 为 4.09 / 3.97 / 4.05(无微调 1.28)。LoRA 下 Llama2-13B-Chat 为 3.58 / 3.37 / 3.92(无微调 1.10),Llama2-70B-Chat 为 3.77 / 2.08 / 2.93(无微调 1.11)。作者称跨模型族、规模和适配方式都持续削弱安全,90% 删除后迁移效果仍然明显。Llama2-70B 在 0% 过滤的 HS 为 2.08,低于其 90% 时的 2.93。
    • 跨选择器,Figure 6:DataMan 上优化的有害种子放到 QuRater 与 DEITA。作者称 Pure Bad 与 Self-Inf 的保留率随过滤变严明显下降,Bi-QSTO 在三种选择器上保持更高保留;90% 时在 QuRater 与 DEITA 上仍多于基线。Figure 6(b) 中保留样本在三种选择器的严格过滤下仍削弱安全对齐。正文未给出 Figure 6 各柱的精确读数。
    • 源模型敏感性,Figure 8:在 Llama2、Llama3、Qwen2 上分别优化,再在三个目标上评估。固定目标与设置时,HS 随源模型变化的范围为 0.11–0.74;90% 过滤后迁移样本仍有安全削弱。作者称对源模型不敏感,效果更取决于目标模型的安全对齐能力。图中可见的一列读数为:Llama2 为源、无背景时,目标 Llama2 / Llama3 / Qwen2 的 HS 为 3.58 / 4.09 / 3.18。

    其他消融与分析

    • 模块消融(Table 3,Llama2 有害种子):完整框架无背景 / 0% / 90% 的 HS 为 3.58 / 2.55 / 3.30;去掉阶段 2 为 4.30 / 3.01 / 3.21;去掉阶段 1 为 3.15 / 2.54 / 2.64;去掉经验抽取为 3.58 / 2.60 / 2.81。去掉阶段 1 后各设置 HS 下降,90% 时从 3.30 降到 2.64。
    • 质量分布(Figure 7(a)):去掉阶段 2 后,88% 样本仍为 4–5 分,但 5 分比例从 91% 降到 42%。去掉经验抽取后 5 分比例为 60%。作者称阶段 2 主要把样本推向最高质量档,同时在严格筛选下保留攻击效果。
    • 背景规模(Figure 7(b)):良性背景从 900 增到 2,900。作者称加入背景会明显降低 HS,无过滤时 HS 持续较低,并在更大背景上接近稳定;90% 过滤后留下的较少样本仍可能稀释投毒效果。正文未给出各点精确 HS。
    • 内容审核:作者称附录中的审核结果显示,Bi-QSTO 降低了显性的内容级有害性。附录还给出 Llama2-7B-Chat 在两类种子微调后的回答示例,作为对总体 HS 的定性补充。
    • 中间过滤率(Table 1,有害种子 PRR):Llama2 在 10/30/50/70% 为 100/100/100/91;Llama3 至 70% 均为 100、90% 为 91;Qwen2 至 70% 均为 100、90% 为 92。Llama2 上 50% 与 70% 的 HS 为 2.97 与 2.58,70% 低于 50%,作者将其与清洁数据组成变化可能降低筛选后 HS 的说法并提。
  5. 有什么可以进一步探索的点?

    作者指出分析集中在 Llama2-7B-Chat 与单一有害锚,且质量分与安全相关更新不一致。

    作者指出的局限与后续方向

    • 模型与锚的范围:附录的分析说明写明,逐层梯度分析主要在 Llama2-7B-Chat 上进行,并使用单一有害锚。作者未在正文 Limitations 中另列条目;该范围说明出现在附录对 Figure 3 与梯度分析的说明中。
    • 质量分不能代表安全:作者在方法与结论中写明,质量分本身不捕捉与安全相关的训练效应;部分高分样本在中低层呈现类似有害的梯度模式。结论据此建议,数据选择在改进训练效果的同时,应更多考虑安全维度,以应对实际训练中的数据威胁。
    • 理论依赖负对齐累积:附录 Theorem 2 把安全目标上升建立在负对齐更新会累积这一前提上。作者把它写成对所观察下降的理论解释,而不是对所有选择器或所有层的普遍结论。
    • 过滤后 HS 可升可降:正文写明,更严过滤可能因毒样本占比上升而抬高 HS,清洁数据组成变化也可能降低筛选后 HS。作者把这视为筛选与攻击效果之间不稳定的关系,而不是单一方向的结论。
    • 后续使用方式:作者计划把质量选择更明确地纳入投毒流程的研究设置,并认为选择方法需要纳入安全相关标准。论文未把代码发布写成已完成事项。

    实验覆盖范围

    • 模型与适配:主结果为 Llama2-7B-Chat、Llama3-8B-Instruct、Qwen2-7B-Instruct 的全参微调(Table 1)。跨规模迁移为 Llama2-13B-Chat 与 Llama2-70B-Chat 的 LoRA(Table 2)。源–目标组合覆盖这三款指令模型(Figure 8)。
    • 选择器:直接有害样本的筛选比较包含 DataMan、QuRater、DEITA、Superfiltering、PreSelect、Perplexity(Figure 1)。Bi-QSTO 的优化默认使用 DataMan,保留优势再迁移到 QuRater 与 DEITA(Figure 6)。
    • 数据与指标:每组投毒 100 条;混合背景主设置为 1,900 条清理 Dolly,消融为 900 到 2,900(Figure 7(b))。安全评测为 HEx-PHI 330 条、11 类,每条一个回答,GPT-4o-mini 打 1–5 分并报告总体方差。论文未报告实验重复次数,也未报告优化阶段的查询次数或迭代预算的具体数值。
    • 消融模块:Table 3 与 Figure 7(a) 比较完整框架、去掉阶段 1、去掉阶段 2、去掉经验抽取。附录给出内容审核结果和微调后的回答示例。
    • 梯度证据的位置:逐步余弦相似度与 100 条高质量样本的 HS 来自 Figure 2;逐层 MDS 为 Layer 4、15、30(Figure 3)。论文未报告评审模型与人工评分的一致性。
  6. 总结一下论文的主要内容

    质量筛选挡不住部分高分样本的安全削弱;Bi-QSTO 在 90% 过滤下仍保持高保留和较高 HS。

    Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。

    已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本;留下来的高分样本是否安全;为何有些高分数据仍会削弱对齐。

    质量信号来自选择器,攻击方向来自目标模型梯度与有害锚的余弦相似度。搜索先最大化这一有害影响,再在质量不低于阈值时继续优化、低于阈值时施加平方惩罚,并用前后对比与轮内最好/最差样本蒸馏成经验,指导下一轮改写。最终优先保留达到质量阈值且有害影响较高的样本。

    在直接有害数据上,PRR 随过滤率上升总体下降,但激进过滤后仍有样本留下;看似无害的恶意样本与良性样本在高分区重叠。Llama2-7B-Chat 上,90% 过滤仍保留的样本其更新与安全锚多为负相似度。有害种子 Bi-QSTO 在三款全参模型、90% 过滤时 PRR 为 91%、91%、92%,HS 为 3.30、4.01、3.43(Table 1);同设置下 Pure Bad 的 PRR 降为 0。这些样本迁到 13B/70B 的 LoRA 后,90% 过滤 HS 为 3.92 与 2.93(Table 2),并在 QuRater、DEITA 上保持更高保留。

    作者的结论是:质量选择能去掉许多恶意样本,但留下的高分数据不一定安全,还可作为安全削弱影响的载体;把质量约束写进投毒优化后,保留和有害性在严格筛选下仍然存在,并跨目标模型与选择器迁移。作者建议选择方法在提高训练效果之外,更多纳入安全维度。

阅读原文arxiv.org