分析与理论arXiv 2609.30802·9月25日研究:知识蒸馏中 chat 模板会削弱学生模型的安全对齐分析良性知识蒸馏中提示模板对学生拒答保留的影响arXiv2609.30802发表9月25日层训练与数据层场景模型与 API测试LLaMA-3.1-8B-Instruct、LLaMA-3.2-3B-Instruct、Gemma-2-9B-IT 等 7 个风险拒答失当深度解读完整解读
分析与理论arXiv 2609.34572·9月28日论文提出 Nudgeability:推理模型会跟随置信信号却不追踪自身能力提出 Nudgeability,测量推理模型跟随信心信号调整工具委派的对准程度arXiv2609.34572发表9月28日层应用层场景AI Agent测试Qwen3-4B、Qwen3-8B、Qwen3-14B 等 11 个组件推理链深度解读完整解读