Persistent SAE:为语言模型特征学习特定时间尺度
研究者提出 Persistent Sparse Autoencoders(Persistent SAEs),在标准 SAE 基础上为每个特征学习一个持久性系数,仅靠重构目标就能学到特征特定的时间尺度。实验显示,Persistent SAEs 在保持有竞争力的重构质量的同时学到一组时间尺度谱:短时间尺度(快)特征保持局部可解释性,长时间尺度(慢)特征则累积用于识别当前上下文的信息。在提示注入监控案例研究中,慢特征能保留与注入相关的信号,并在长上下文中保持因果有效性。作者认为这为通过持久稀疏特征解释和监控语言模型提供了新途径。