Anthropic 可解释性团队分享稀疏自编码器与跨coder训练优化技巧
Circuits Updates — January 2025
AI 导读
Anthropic 可解释性团队公开了其训练稀疏自编码器和 crosscoder 的最新设置改进,涵盖 JumpReLU 激活函数实现、直通估计器的梯度回传方式以及减少死特征的方法。 该设置在损失函数中引入 tanh 惩罚项鼓励稀疏性,并新增一项对未激活特征的轻微惩罚(pre-act loss);同时将偏置初始化设定为使每个特征约有 10000/m 的时间处于激活状态,并将解码器权重列归一化为 L2 范数 1 以便简化分析代码。 团队表示尚未对所有设计选择做完整消融实验,仅将其作为外部研究者训练稀疏自编码器的起点参考,且部分思路仍在发展中,预计未来数月会发表更多成果。