跳到正文
原文
论文追踪· arXiv:2609.21561· Anton Baumann; Akmal Ashirmatov; Leo Schmidt-Traub; Frederike Lübeck; Jonas Hübotter; Thomas Kleine Buening; Andreas Krause·本站收录 · 原文发表

自蒸馏中的排斥与吸引教师:将正确性与行为分离

On Repulsive and Attractive Teachers: Separating Correctness from Behavior in Self-Distillation

AI 导读

研究者在推理任务中发现,on-policy 自蒸馏中特权信息不仅改变教师模型"知道什么",也改变其行为:吸引式自蒸馏抑制探索性推理、让回答更短更自信,排斥式自蒸馏则拉长回答、可能触发模型意外切换到潜在思考模式并最终失稳。为此提出对比式自蒸馏,即向正确答案条件下的教师靠近、同时远离错误答案条件下的教师,两种教师带来的行为偏移大体相互抵消,留下更直接反映正确性的 token 级信号。在非思考、仅 instruct 和已思考三类模型上,该目标提升了推理表现并保持回答长度稳定。

阅读原文arxiv.org