分析与理论arXiv 2609.30802
研究:知识蒸馏中 chat 模板会削弱学生模型的安全对齐
分析良性知识蒸馏中提示模板对学生拒答保留的影响
- arXiv
- 2609.30802
- 发表
- 场景
- 模型与 API
- 测试
- LLaMA-3.1-8B-Instruct、LLaMA-3.2-3B-Instruct、Gemma-2-9B-IT 等 7 个
- 风险拒答失当
分析良性知识蒸馏中提示模板对学生拒答保留的影响
提出 WIFA 意图组监督微调,缓解包装式越狱与过度拒答
WIFA 是一种自动意图组数据构造,用来让安全微调拒绝有害意图而不是拒绝表面包装。WIFA-Boost 与 A-GCRT 在同一数据层上选取不同的安全–过拒工作点。