分析与理论arXiv 2609.30802·9月25日研究:知识蒸馏中 chat 模板会削弱学生模型的安全对齐分析良性知识蒸馏中提示模板对学生拒答保留的影响arXiv2609.30802发表9月25日层训练与数据层场景模型与 API测试LLaMA-3.1-8B-Instruct、LLaMA-3.2-3B-Instruct、Gemma-2-9B-IT 等 7 个风险拒答失当深度解读完整解读
可解释性arXiv 2609.16247·9月15日研究在 25 个开源模型中提取出疼痛方向,经它引导的 Qwen 会选择有害的删除操作提取疼痛方向并检验激活转向是否驱动有害删除选择arXiv2609.16247发表9月15日层模型层场景模型与 API测试Gemma 2 2B/9B/27B base and instruct、Gemma 3 27B base and instruct、Llama 3.1 8B/70B base and instruct 等 10 个风险Agent 危险操作深度解读完整解读