Anthropic 可解释性团队发布 2024 年 1 月 Circuits 更新
Circuits Updates — January 2024
AI 导读
Anthropic 可解释性团队发布 2024 年 1 月 Circuits 更新,汇总多项尚在推进中的研究想法,并说明未来数月将聚焦字典学习规模化、用字典学习攻击真实模型中的注意力叠加,以及在此基础上理解回路三个方向。团队把字典学习应用到 8 层 Transformer 的 MLP 激活上,发现最后一层特征与单层 Transformer 相似,中间层(约 4 至 6 层)特征更抽象,并给出若干与安全相关的特征示例。在更大规模模型上,团队称已初步提取出多语言特征,例如同一概念在多种语言中触发同一特征。
推荐理由
Anthropic 可解释性团队集中披露字典学习、叠加与 Ghost Grads 等阶段性进展,适合跟踪机制可解释性技术路线的人了解其当前优先级。