Anthropic 可解释性团队 2024 年 6 月更新:TopK 与 Gated SAE 对比及外部评测进展
Circuits Updates — June 2024
AI 导读
Anthropic 可解释性团队发布 2024 年 6 月更新,汇总多项尚在成形的研究想法。团队复现了 TopK SAE 与 Gated SAE 相对标准 L1 惩罚 SAE 的改进,确认二者在 L0/MSE 权衡上表现相近且明显更优,但训练优化程度低于标准 SAE。在 100 个特征的盲评中,不同方法在单义性上未见明显差异;高密度特征在低 L0 下不构成病理问题,但在 K=100 时出现大量难以解释的高密度特征。Clerp 自动评测显示 Gated SAE 与 K=20 TopK SAE 的得分与 L1=10 标准 SAE 相当。
推荐理由
Anthropic 可解释性团队汇总 SAE 训练方法的复现结果与外部评测进展,适合跟进稀疏自编码器路线的人了解当前共识与未解问题。