分析与理论arXiv 2609.30802·9月25日研究:知识蒸馏中 chat 模板会削弱学生模型的安全对齐分析良性知识蒸馏中提示模板对学生拒答保留的影响arXiv2609.30802发表9月25日层训练与数据层场景模型与 API测试LLaMA-3.1-8B-Instruct、LLaMA-3.2-3B-Instruct、Gemma-2-9B-IT 等 7 个风险拒答失当深度解读完整解读
防御arXiv 2607.15081·7月16日DataShield:通过共识子空间对齐识别 LLM 微调中的高风险数据提出 DataShield,用共识子空间过滤会削弱安全的微调数据arXiv2607.15081发表7月16日层训练与数据层场景模型与 API测试Llama3-8B-Instruct、Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3 等 8 个防御检测与过滤风险拒答失当组件微调与开源权重深度解读完整解读