跳到正文
原文
Hugging Face Daily Papers·· 4 天前

研究用稀疏 crosscoder 揭示 on-policy distillation 只重加权既有特征

Understanding On-Policy Distillation: A Mechanistic Interpretability Perspective via Sparse Crosscoders

AI 导读

研究用稀疏 crosscoder 分析 on-policy distillation(OPD)究竟向学生模型内部表征注入了什么,并提出 swap readout 方法,让每个学生 checkpoint 独立读取自身特征激活,从而衡量训练如何改变学生对特征的使用。在三种 OPD 设置下,OPD 既不创造新特征,也不传递教师自身的特征,学生高频使用特征中超过 98% 的激活率变化在 20% 以内。

阅读原文huggingface.co