自蒸馏中的排斥与吸引教师:将正确性与行为分离
On Repulsive and Attractive Teachers: Separating Correctness from Behavior in Self-Distillation
AI 导读
研究者在推理任务中发现,on-policy 自蒸馏中特权信息不仅改变教师模型"知道什么",也改变其行为:吸引式自蒸馏抑制探索性推理、让回答更短更自信,排斥式自蒸馏则拉长回答、可能触发模型意外切换到潜在思考模式并最终失稳。为此提出对比式自蒸馏,即向正确答案条件下的教师靠近、同时远离错误答案条件下的教师,两种教师带来的行为偏移大体相互抵消,留下更直接反映正确性的 token 级信号。在非思考、仅 instruct 和已思考三类模型上,该目标提升了推理表现并保持回答长度稳定。