分析与理论arXiv 2609.30802
研究:知识蒸馏中 chat 模板会削弱学生模型的安全对齐
分析良性知识蒸馏中提示模板对学生拒答保留的影响
- arXiv
- 2609.30802
- 发表
- 场景
- 模型与 API
- 测试
- LLaMA-3.1-8B-Instruct、LLaMA-3.2-3B-Instruct、Gemma-2-9B-IT 等 7 个
- 风险拒答失当
分析良性知识蒸馏中提示模板对学生拒答保留的影响
阐述旗舰基础模型的预训练与后训练方法并公开权重与安全模型
提出 WIFA 意图组监督微调,缓解包装式越狱与过度拒答
WIFA 是一种自动意图组数据构造,用来让安全微调拒绝有害意图而不是拒绝表面包装。WIFA-Boost 与 A-GCRT 在同一数据层上选取不同的安全–过拒工作点。
提出主题锚点投毒,放大众包微调后的专有指令提取
摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。