ScopeSAE 按预测相关性选择建模子空间,实现重建优于原始激活
ScopeSAE: Model-Scope Feature Discovery with Interpretable Layer Selection
AI 导读
研究者提出 ScopeSAE,用归一化梯度归因把每个预测归到最有影响的 token-层状态,从而按 token 选择建模子空间,而非按层固定子空间。作者称该方法出现重建优于原始的效果,即 SAE 写回重建的下一 token 交叉熵低于原始激活,并称此前未见 SAE 报告过这一现象。通过干预分析和 KL 微调对照实验,作者认为该效果来自预测相关的子空间本身,而非架构改动。相比现有按层基线,ScopeSAE 在有效特征数、可解释性、利用率和字典冗余上均有改善。