Fixed-SAE Track:从机制可解释性看 LLM 从强化学习中学到了什么
What Does an LLM Learn from Reinforcement Learning? A Mechanistic Interpretability Perspective with Fixed-SAE Track
AI 导读
研究者提出 Fixed-SAE Track 框架,在每个考察层上基于基座模型与全部 RL checkpoint 的激活训练一个共享 SAE,固定特征方向以严格定义表征漂移。在多个数据集和 RL 算法上验证发现,RL 引起的漂移幅度小、渐进、与概念相关且集中在后层,主要提升一小批 ladder token 及步骤分隔、答案定界符等格式脚手架特征的采样率,而非重塑问题内容。把这些特征引导进基座模型可恢复约 80% 的 RL 性能增益,说明 RL 主要是激发模型已有能力。作者还设计了一个特征已知的合成基准,用于检验 RL 能否真正引入全新特征。