跳到正文
原文
arXiv:可解释性· arXiv:2610.04905· Qingwen Zeng, Zehao Fu, Shuyu Meng, Linghan Huang, Jiayi Zhang, Chenglin Wu, Ling Chen, Huaming Chen·本站收录 · 原文发表 日期未标

ScopeSAE 按预测相关性选择建模子空间,实现重建优于原始激活

ScopeSAE: Model-Scope Feature Discovery with Interpretable Layer Selection

AI 导读

研究者提出 ScopeSAE,用归一化梯度归因把每个预测归到最有影响的 token-层状态,从而按 token 选择建模子空间,而非按层固定子空间。作者称该方法出现重建优于原始的效果,即 SAE 写回重建的下一 token 交叉熵低于原始激活,并称此前未见 SAE 报告过这一现象。通过干预分析和 KL 微调对照实验,作者认为该效果来自预测相关的子空间本身,而非架构改动。相比现有按层基线,ScopeSAE 在有效特征数、可解释性、利用率和字典冗余上均有改善。

阅读原文arxiv.org