研究:知识蒸馏中 chat 模板会削弱学生模型的安全对齐
分析良性知识蒸馏中提示模板对学生拒答保留的影响
- arXiv
- 2609.30802
- 发表
- 场景
- 模型与 API
- 测试
- LLaMA-3.1-8B-Instruct、LLaMA-3.2-3B-Instruct、Gemma-2-9B-IT 等 7 个
- 风险拒答失当
分析良性知识蒸馏中提示模板对学生拒答保留的影响
提出 Bi-QSTO,优化能穿过质量筛选并在微调中削弱安全对齐的投毒样本
Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。
提出预训练缩放律,估计野生 AI 网页文本相当于多少人类 token
作者测量未标注的 wild AI 网页文本对预训练的影响,并提出一个能让 AI token 价值变号的缩放律。
提出 FDCU 双约束子空间投影遗忘,抵御再训练恢复有害知识
FDCU 是一种约束参数更新的遗忘方法,用来降低再训练把已抑制恶意行为重新引出的可能。
提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改
SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。
提出 DataShield,用共识子空间过滤会削弱安全的微调数据
提出 USG,在部分保护开源权重发布时阻断有害微调梯度
Unidirectional Safety Gate 是面向 PPOW 发布设定的发布时防护:大部分权重仍可训练,一小部分安全关键组件由提供者侧加固保留,下游不必配合额外安全流程。。
提出几何缓解框架,把有害梯度子空间从 LoRA 更新中正交投影出去
See it, Say it, Sorted 在参数轨迹上诊断涌现失准,并把经验有害梯度子空间从 LoRA 更新中正交去掉。
提出 RACER,用区域感知一致性对抗微调去除多模态大模型后门
提出 AnchorRep,用表征排斥防御跨模型越狱迁移
提出跨架构攻击 CSR,用概念分数参数重学习恢复文生图被擦除概念