Anthropic 提出稀疏 Crosscoder,用于跨层特征与模型差异分析
Sparse Crosscoders for Cross-Layer Features and Model Diffing
AI 导读
Anthropic 可解释性团队发布研究更新,提出稀疏 crosscoder,一种可同时读写多层激活的稀疏编码器,用于理解叠加表示中的跨层特征。与只在单层编码的 autoencoder 和用一层预测下一层的 transcoder 不同,crosscoder 能产出跨层甚至跨模型的共享特征,可用于解析跨层叠加、简化电路以及做模型差异分析。团队在 18 层模型上对比了全局 acausal crosscoder 与 18 个逐层 SAE:在总特征数相同时 crosscoder 的 eval loss 明显更优,说明层间存在大量冗余结构;但按训练 FLOPs 计,crosscoder 达到同等 eval loss 的效率约低 2 倍。
推荐理由
Anthropic 可解释性团队提出跨层稀疏编码器,把跨层与跨模型特征纳入同一字典,为模型差异审计提供新思路。