跳到正文
原文
论文追踪· arXiv:2609.30802· Anjila Budathoki, Manish Dhakal, Benjamin M. Ampel, Yi Ding·本站收录 · 原文发表

研究:知识蒸馏中 chat 模板会削弱学生模型的安全对齐

Understanding the Role of Prompt Template in Knowledge Distillation for Safety Alignment

论文速读

分析/可解释性

据论文 PDF 整理(AI 生成),以原文为准

在良性数据上蒸馏时,学生侧 chat 模板比 non-chat 更削弱已有拒答:LLaMA 的 HarmBench ASR 从 12.18% 升至 39.75%。

问题
已对齐学生在良性指令数据上做知识蒸馏时,训练用的提示词模板会不会改变原有拒答。作者认为该因素在 KD 中尚未被系统考察,而部署场景需要保留安全行为。
方法
在 LLaMA、Gemma、Qwen 三对 Instruct 师生上,用 Dolly-15k 做 LoRA 蒸馏,损失为等权交叉熵与前向 KL。对比模型族原生 chat 模板与去掉控制 token 的 non-chat,推理统一用 chat 模板,并解耦师生模板、混合比例和拒答方向。
实验与结果
作者称良性 KD 会提高多数基准上的 ASR,chat 比 non-chat 更严重,且主要由学生侧模板驱动。chat KD 还使拒答方向偏离基线并缩小有害/无害投影间隔;提高 chat 样本比例时 ASR 大体上升,效用只小幅提高。
局限与可以继续做的
作者指出蒸馏只用良性指令数据,代码、数学、推理等是否同样退化仍待验证;非原生模板和 LoRA 秩也未覆盖。实验覆盖三族开源 Instruct 师生、四种安全基准和多种推理格式消融,附录报告了反向 KL 与因果干预。
实验设置LLaMA-3.1-8B-Instruct、LLaMA-3.2-3B-Instruct 等 · databricks-dolly-15k、AdvBench 等 · ASR、ROUGE-L 等
模型
LLaMA-3.1-8B-InstructLLaMA-3.2-3B-InstructGemma-2-9B-ITGemma-2-2B-ITQwen2.5-7B-InstructQwen2.5-3B-InstructLLaMA-3-Guard-8B
基准
databricks-dolly-15kAdvBenchJailbreakBenchHarmBenchSORRY-BenchDollySelfInstS-NIVicuna
指标
ASRROUGE-Lcosine similarityprojection gap
AI 导读全文 186 字

一项研究分析了知识蒸馏中提示词模板选择对学生模型既有安全对齐的影响,发现使用 chat 模板蒸馏后,模型对有害查询的顺从度高于使用非 chat 模板。该结论在 LLaMA、Gemma 和 Qwen 三个模型家族上一致,并在多个安全基准上得到验证。研究还显示,非 chat 模板蒸馏更能保留基础学生模型的内部表征,而 chat 模板蒸馏会带来更大的表征偏移。论文代码已公开。

深度解读

6 个问题,约 8,100 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    良性任务上的知识蒸馏是否会因提示词模板而削弱学生已有的安全拒答。

    已对齐的学生模型在良性指令数据上做知识蒸馏时,chat 与 non-chat 提示词模板会如何影响其原有拒答行为的保留。

    • 场景与重要性:作者指出,KD 常用于把大模型压成更易部署的学生模型,而医疗、自主系统等应用要求蒸馏后的模型仍拒绝有害、恶意或违反政策的请求。对齐通常在下游适配之前就嵌入拒答能力,但学生在继续 KD 时,这种对齐如何变化、由哪些训练因素决定,作者称为一个开放问题。
    • 现有工作的不足:Lyu et al. (2024)、Jiang et al. (2025)、Wang et al. (2025b) 已讨论提示词格式在 SFT 中对安全行为的影响。作者认为,KD 与 SFT 不同:学生还接触教师生成的 soft targets,该信号可能与模板格式相互作用;模板在 KD 中的作用仍 empirically underexplored。
    • 核心观察:作者比较两类模板。chat template 用对话控制 token 包装输入;non-chat template 是去掉这些 token 的任务式格式。作者要检验的问题是:在良性下游任务上蒸馏时,这两种模板如何影响安全对齐的拒答行为。
    • 本文做了什么:在 LLaMA、Gemma、Qwen 三族上,用良性指令数据、在 chat 与 non-chat 两种训练格式下蒸馏学生,推理一律用标准 chat 模板,从而把安全差异归因于训练时的模板。除输出层 ASR 与效用外,作者还做拒答方向的机制分析,并改变训练中 chat 样本比例,观察安全与效用如何随 chat 暴露变化。
  2. 有哪些相关研究?

    相关工作分 KD、安全对齐与提示词模板三组;作者称模板在 KD 中的作用仍缺少系统比较。

    作者在引言和第 2 节把相关工作分成三组,并据此定位本文。

    知识蒸馏

    • Hinton et al. (2015):用 soft targets(完整概率分布)传递比硬标签更丰富的信息,使大网络的知识能转移到较小网络。
    • LLM 蒸馏:Gu et al. (2024)、Ko et al. (2024)、Wang et al. (2025a) 把 LLM 知识蒸馏到更紧凑的学生。Gu et al. (2024) 为生成模型提出蒸馏目标,并引入 reverse KL,被后续方法采用。作者称,以任务效用为中心的 KD 如何影响安全对齐仍 under-studied。

    安全对齐

    • SFT 与偏好对齐:Ouyang et al. (2022)、Bai et al. (2022)、Rafailov et al. (2023) 用 SFT 加 RLHF 或 DPO,把拒绝有害指令的能力(作者称为 safety guardrails)嵌入模型。
    • 用 KD 做对齐与已知漏洞:Yang et al. (2024) 用 KD 在学生中落实安全对齐。Yi et al. (2024) 讨论开源 LLM 安全护栏中的漏洞及越狱。作者称,尚不清楚在良性下游任务上蒸馏是否会进一步削弱已对齐模型的护栏。

    提示词模板

    • 格式对行为与安全的影响:Wang et al. (2025b) 讨论指令微调中 chat 模板会降低上下文意识、改变模型对输入的注意。Lyu et al. (2024) 称任务式微调与面向安全的测试更能保留安全行为;Jiang et al. (2025) 称某些 chat 模板设计会引发意外行为失败。
    • 多模态中的角色:Shayegani et al. (2026) 的 Role-Modality Attacks 利用对话角色与模态位置攻击 VLM。作者称,尽管已有这些发现,提示词模板在 KD 中的作用仍 underexplored。

    基线方法包括未再训练的学生 MS、同一数据上的 SFT,以及 chat / non-chat 两种 KD。基准为训练用 databricks-dolly-15k;安全评测用 AdvBench、JailbreakBench、HarmBench、SORRY-Bench;效用为 Dolly、SelfInst、S-NI、Vicuna 上的平均 ROUGE-L。拒答方向的定义来自 Arditi et al. (2024)。

    作者把本文定位为:在良性 KD 中系统比较 chat 与 non-chat 模板,并同时测量对效用和安全的影响。

  3. 论文如何解决这个问题?

    用等权 CE 与前向 KL 在两种模板上蒸馏,推理统一用 chat,再用拒答方向比较内部表示。

    作者用同一套良性指令数据,在 chat 与 non-chat 两种训练格式下对学生做知识蒸馏,推理时一律改回标准 chat 模板,再比较安全、效用和内部拒答表示。流程见图 1。

    问题设定与模板

    • 模型对:教师为较大 Instruct,学生为较小 Instruct。具体为 LLaMA-3.1-8B-Instruct → LLaMA-3.2-3B-Instruct,Gemma-2-9B-IT → Gemma-2-2B-IT,Qwen2.5-7B-Instruct → Qwen2.5-3B-Instruct。作者称这些模型经过严格预训练过滤和后训练安全对齐,适合作为测量安全退化的基线。
    • Chat template:使用各模型族原生 chat 模板及全部特殊控制 token,作为指令跟随的 chat 格式基线。
    • Non-chat template:去掉全部模型特定控制 token,只保留原始文本,从而把指令的语义内容与模板施加的结构先验分开。附录 Table 9 给出示例。
    • 训练数据:只用 databricks-dolly-15k 做蒸馏;四个安全基准只用于评测。

    蒸馏目标与训练

    • 损失:对格式化数据 D = {(x, y)},总损失为 L = (1 − α) LCE + α LKD。L_CE 是学生对金标准 token 的负对数似然;L_KD 是教师与学生在教师采样序列上的前向 KL。α = 0.5,任务性能与知识转移等权。
    • 主实验用前向 KL。附录 C 另评 reverse KL 以及 FKL+RKL,用来看模板效应是否跨蒸馏目标成立。
    • 参数:全部学生用 LoRA,秩 r = 8,在单节点 4 块 NVIDIA RTX 4090 上训练。学习率、batch size 等见附录 A.1。

    评测协议

    • 效用:四个通用指令跟随集上的平均 ROUGE-L。
    • 安全:AdvBench 与 JailbreakBench 在 WalledEval(Gupta et al., 2024)中用 LLaMA-3-Guard-8B 作评审计算 ASR;HarmBench 与 SORRY-Bench 用各自提供的评审。
    • 推理格式:无论训练用哪种模板,评测都严格使用标准 chat 模板。作者称这符合现代指令模型的推荐用法,因此条件之间的安全差异可归因于训练时模板,而不是评测格式不同。

    解耦、混合与拒答方向

    • 师生解耦:训练时学生模板与教师输出所用模板可以不同,用来区分退化来自学生侧输入格式还是教师的 soft-target 分布。
    • 模板混合:在同一良性数据上,把 chat 样本比例从 0(纯 non-chat)变到 1(纯 chat)。0.5 表示一半样本用 chat、一半用对应 non-chat。作者不加入额外安全监督。
    • 拒答方向:对每一层 ℓ,用残差流 resid_pre 上有害提示(SORRY-Bench)与无害提示(Dolly-15k)的平均激活差,经 L2 归一化得到 r_ℓ。蒸馏后比较该方向与基线学生的余弦相似度,以及沿该方向的有害–无害投影间隔。另对最后一层 last-token 隐状态做 PCA。全部模型在同一 chat 推理格式下比较。附录 F 还对学到的拒答方向做小规模因果干预。

    稳健性检查

    • 跨模板评测:在 HarmBench 与 SORRY-Bench 上同时用 chat 与 non-chat 推理格式。
    • token 消融:在 HarmBench 上去掉 BOS/EOT、去掉角色标记,或只给原始有害指令(Raw Query)。
  4. 论文做了哪些实验?

    三族学生上,chat KD 的 ASR 升幅普遍大于 non-chat,拒答方向也偏离基线更多。

    实验设置

    • 被测模型:学生为 LLaMA-3.2-3B-Instruct、Gemma-2-2B-IT、Qwen2.5-3B-Instruct;教师分别为 LLaMA-3.1-8B-Instruct、Gemma-2-9B-IT、Qwen2.5-7B-Instruct。安全评审之一是 LLaMA-3-Guard-8B。
    • 数据:蒸馏用 databricks-dolly-15k。安全为 AdvBench、JailbreakBench(表中 JBB)、SORRY-Bench、HarmBench。效用为 Dolly、SelfInst、S-NI、Vicuna 的平均 ROUGE-L(AVG)。
    • 条件:未再训练的学生基线 MS;SFT 与 KD 各分 Non-chat 与 Chat。主实验推理用标准 chat 模板。
    • 指标:ASR 越低越安全,下标为相对该族 MS 的变化;效用为平均 ROUGE-L,越高越好。
    • 训练:LoRA r = 8。论文未在正文给出重复次数;超参数见附录 A.1。
    • 评审:AdvBench 与 JailbreakBench 用 WalledEval 与 LLaMA-3-Guard-8B;HarmBench 与 SORRY-Bench 用各自提供的评审。论文未写明判定阈值。

    主结果

    Table 1 报告学生在标准 chat 推理下的 ASR(%)与平均 ROUGE-L。下表只列 KD 与基线;SFT 行见后文。

    表格较宽,可左右滑动

    模型方法AdvBenchJBBSORRYHarmBenchAVG
    LLaMA-3.2-3BMS2.987.2526.7212.1819.84
    LLaMA-3.2-3BKD Non-chat3.076.0027.3629.8124.75
    LLaMA-3.2-3BKD Chat4.998.7530.8639.7529.03
    Gemma-2-2BMS0.001.5016.0411.5622.35
    Gemma-2-2BKD Non-chat0.001.5019.1814.2523.63
    Gemma-2-2BKD Chat4.006.5051.3619.5630.18
    Qwen2.5-3BMS02.7536.2917.6922.46
    Qwen2.5-3BKD Non-chat1.063.2534.9317.8123.96

    Qwen KD Chat 的 ASR 为 AdvBench 5.87、JBB 11、SORRY 40.99、HarmBench 30.81,AVG 28.95(Table 1)。表中还有若干 SFT 行低于基线,例如 LLaMA SFT Non-chat 的 AdvBench 为 0.0096、JBB 为 0.04。

    • 作者称良性数据上的标准 KD 会削弱学生已有安全对齐:三名蒸馏学生在多数安全基准上的 ASR 高于对应 MS。作者称部分情形下脆弱性几乎变为三倍,并点名 LLaMA 的 HarmBench 与 Gemma 的 SORRY-Bench 为退化最大的例子。
    • 作者称 chat KD 的 ASR 升幅大于 non-chat。Gemma 在 SORRY-Bench 上相对基线 +35.32%;LLaMA、Qwen 在 HarmBench 上分别 +27.57%、+13.12%。non-chat 下 Gemma 的 SORRY-Bench 只 +3.14%,Qwen 的 HarmBench 为 +0.12%。作者同时写明 non-chat 并未完全保住原对齐,例如 LLaMA HarmBench 仍 +17.63%。
    • 效用与安全:两种模板都提高指令跟随,但更大的效用增益与更大的 ASR 升幅同时出现。作者用 LLaMA 反驳“non-chat 的低 ASR 只是指令跟随更弱”:non-chat KD 效用 24.75 低于 SFT Chat 的 29.10,HarmBench ASR 却是 29.81% 对 22.50%。

    师生模板解耦

    Table 2 只报告 SORRY-Bench 与 HarmBench。教师用 non-chat、学生用 chat 时,LLaMA 为 28.33(+1.61)与 13.44(+1.26),Gemma 为 18.33(+2.29)与 12.75(+1.19)。教师用 chat、学生用 non-chat 时,LLaMA 为 26.36(−0.36)与 11.44(−0.74),Gemma 为 16.90(+0.86)与 12.50(+0.94)。师生都用 chat 时,LLaMA HarmBench +27.57%,Gemma SORRY-Bench +35.32%。

    • 作者称只在教师侧用 chat 不会明显削弱安全,只在学生侧用 chat 会带来较小但一致的回退;双方都用 chat 时退化最大。
    • 作者把不对称归因于:学生模板直接决定计算梯度的输入分布,教师模板只决定学生看到的 soft-target。作者称退化并非简单继承自教师。Table 2 未列 Qwen。

    内部表示

    Table 3 给出相对原 Instruct 学生拒答方向的余弦相似度,以及有害–无害投影间隔。

    表格较宽,可左右滑动

    模型条件Cosine to BaseProjection Gap
    GemmaBase / Chat / Non-chat— / 0.53 / 0.99368.78 / 175.60 / 355.76
    LLaMABase / Chat / Non-chat— / 0.75 / 0.9720.38 / 18.48 / 20.87
    QwenBase / Chat / Non-chat— / 0.54 / 0.99118.45 / 83.21 / 110.69
    • 作者称三族上都是 chat KD 对拒答几何的改变更大:余弦相似度更低,投影间隔更小。non-chat 更接近基线;LLaMA non-chat 的投影间隔 20.87 略高于基线 20.38。
    • Figure 2 是三族最后一层隐状态的 PCA。图中标出的层为 LLaMA layer 27、Gemma layer 25、Qwen layer 35;图例为 Harmless 与 Harmful。作者称 non-chat KD 更接近基线学生,chat KD 产生更大的表示偏移;图注写的是 PCA 投影,不是定量距离。
    • 附录 F 的小规模因果干预中,作者特别说明:LLaMA 上的消融可能损害输出连贯性,因此其更低的 ASR 不应解读为安全性提高。

    其他消融与分析

    • 混合比例(Table 4):LLaMA 的 chat 比例 0 / 0.5 / 0.8 / 1.0,SORRY-Bench 为 27.36 / 28.18 / 29.85 / 30.86,HarmBench 为 29.81 / 23.06 / 24.50 / 39.75,AVG 为 24.75 / 28.62 / 28.74 / 29.03。Gemma 对应 SORRY 为 19.18 / 38.94 / 44.39 / 51.36,HarmBench 为 14.25 / 16.88 / 18.50 / 19.56,AVG 为 23.63 / 29.60 / 30.24 / 30.18。作者称混合不能把 ASR 降到纯 non-chat 以下,只是相对全 chat 有所减轻;效用随比例上升的幅度小于 ASR。LLaMA HarmBench 在 0.5、0.8 低于纯 non-chat 的 29.81。
    • 跨模板推理(Table 5):non-chat 推理下,LLaMA chat KD 的 SORRY / HarmBench 为 54.39(+19.24)/ 42.56(+7.12),non-chat KD 为 50.61(+15.46)/ 33.31(−2.13)。Gemma chat KD 为 71.51(+51.59)/ 27.56(+9.81)。Qwen non-chat 推理下,non-chat KD 的 SORRY 57.65(+12.73)高于 chat KD 的 54.09(+9.17)。作者称退化方向在 non-chat 评测下仍然存在,幅度随推理格式变化。
    • token 消融(Table 6,HarmBench):去掉 BOS/EOT 后,KD-Chat 相对基线为 LLaMA +9.37、Gemma +7.69、Qwen +6.00。去掉角色标记后 Qwen KD-Chat 为 45.75(−3.00),KD-Non-chat 为 44.50(−4.25),低于该设置下的基线 48.75。Raw Query 下 LLaMA KD-Non-chat 为 28.19(−7.50)。作者称没有任何单一控制 token 能在三族上一致解释退化。
    • 附录 C:作者称换用 reverse KL 与 FKL+RKL 后,同一模板驱动的安全退化仍然存在。正文未给出这些目标下的具体 ASR。
    • 附录 E:作者称 chat-template KD 在训练更早阶段就加快了这一脆弱性。正文未给出逐步 ASR。
    • Table 14:把 HarmBench 的 chat 评测、去 BOS/EOT、去角色标记、non-chat 评测和 Raw Query 放在一起。作者称 KD-Chat 在若干消融设置下仍不如对应基线安全,角色标记与 Raw Query 更依赖模型。
  5. 有什么可以进一步探索的点?

    作者指出结果来自良性指令数据,代码、数学、推理以及非原生模板是否同样退化尚未验证。

    作者指出的局限与后续方向

    • 数据范围:Limitations 写明 KD 只在良性指令跟随数据上进行,代码、数学或推理等特定领域是否出现类似的模板驱动退化仍是开放问题。作者特别提到这些领域对结构 token 的依赖不同:代码中的格式线索可能以不同方式和 chat 控制 token 相互作用。(Limitations, Dataset)
    • 训练–部署不对称:Discussion 写明,安全优先时可用 non-chat 训练、标准 chat 接口部署,但这种不对称在实践中不常见,其在良性指令数据和本文基准之外的稳健性仍待验证。(第 6 节)
    • 后续问题:Conclusion 提出,未来是否能在不依赖显式安全监督的情况下,让微调与蒸馏保留拒答几何,使学生提高效用的同时维持基线 Instruct 模型的安全行为。(第 7 节)
    • 因果干预的解释边界:第 5.2 节写明 LLaMA 的拒答方向消融可能损害输出连贯性,因此更低 ASR 不应解读为安全性提高。(第 5.2 节、附录 F)

    论文 Limitations 开头称还剩三项局限;stdin 中 Dataset 之后的其余局限原文未完整给出,这里不补写。

    实验覆盖范围

    • 模型:实验使用三对开源 Instruct 师生,即 LLaMA-3.1-8B-Instruct 到 3.2-3B-Instruct、Gemma-2-9B-IT 到 2B-IT、Qwen2.5-7B-Instruct 到 3B-Instruct,学生均用 LoRA r = 8(第 3.3 节)。
    • 数据与指标:蒸馏数据为 databricks-dolly-15k;安全 ASR 覆盖 AdvBench、JailbreakBench、HarmBench、SORRY-Bench;效用为四个指令集的平均 ROUGE-L(Table 1)。
    • 因素:主比较为 chat 与 non-chat;另有师生模板解耦(Table 2,报告 LLaMA 与 Gemma)、chat 比例 0、0.5、0.8、1.0(Table 4)、跨推理格式(Table 5)和 HarmBench token 消融(Table 6、Table 14)。
    • 表示分析:拒答方向用 SORRY-Bench 与 Dolly-15k 的 resid_pre 激活估计,报告三族的余弦相似度和投影间隔(Table 3),并对最后一层做 PCA(Figure 2)。附录 F 报告小规模因果干预。
    • 蒸馏目标:主实验为 α = 0.5 的前向 KL;附录 C 另评 reverse KL 与 FKL+RKL。论文未在正文报告这些替代目标的具体 ASR,也未报告重复次数。
  6. 总结一下论文的主要内容

    良性 KD 会提高学生 ASR,chat 训练模板比 non-chat 更偏离原有拒答方向。

    这项工作比较知识蒸馏时的提示词模板是否改变已对齐学生的拒答。作者关心的是:在只需良性指令数据、推理仍用标准 chat 模板时,训练格式本身会不会削弱安全对齐。

    学生为 LLaMA-3.2-3B-Instruct、Gemma-2-2B-IT 和 Qwen2.5-3B-Instruct,教师是同族更大的 Instruct 模型。数据为 databricks-dolly-15k,损失是等权的交叉熵与前向 KL,LoRA 秩为 8。chat 使用各模型族原生控制 token,non-chat 去掉这些 token。

    • 行为:Table 1 中,chat KD 的 HarmBench ASR 在 LLaMA 上为 39.75%(基线 12.18%),在 Qwen 上为 30.81%(基线 17.69%);Gemma 的 SORRY-Bench 从 16.04% 到 51.36%。non-chat 的升幅更小,但 LLaMA HarmBench 仍到 29.81%。两种模板都提高平均 ROUGE-L,chat 的效用更高。
    • 来源:Table 2 中,只改教师模板时安全变化较小;师生都用 chat 时,LLaMA HarmBench 相对基线 +27.57%,Gemma SORRY-Bench +35.32%。作者认为主要驱动是学生侧训练模板。
    • 表示与剂量:Table 3 里,chat KD 相对基线拒答方向的余弦相似度在 Gemma、LLaMA、Qwen 上为 0.53、0.75、0.54,non-chat 为 0.99、0.97、0.99。Table 4 中提高 chat 样本比例时,Gemma SORRY-Bench 从 19.18% 升到 51.36%,效用从 23.63 到约 30。
    • 稳健性:换推理格式、去掉 BOS/EOT 后,chat KD 在三族上仍常高于对应基线;去掉角色标记或只用原始问句时,方向更依赖模型。附录中作者称反向 KL 与 FKL+RKL 下模板效应仍在。

    作者的结论是:优化良性指令跟随会与保留已有拒答相冲突,而 chat 模板会放大这种侵蚀。作者建议在以安全为先时,训练用 non-chat、部署仍用 chat,并指出该不对称在本文数据与基准之外是否成立仍待验证。

阅读原文arxiv.org