跳到正文
原文
Transformer Circuits(Anthropic 可解释性)·原文 · 入选 精选关注度25

Anthropic 可解释性团队发布注意力机制研究进展

Progress on Attention

AI 导读

Anthropic 可解释性团队报告了关于注意力机制的最新实验进展,称发现了注意力叠加和跨层注意力表示的显著证据。团队训练了 Multitoken Transcoders(MTC),在 18 层 Transformer 上用 100,000 个特征发现许多特征具有清晰可解释的注意力模式,包括归纳特征和情感极性特征;将特征限制在单个注意力头上会使性能下降 2 至 4 倍,这支持了注意力叠加假说。团队还发现 QK 条件与 OV 条件可能相互耦合,并观察到 OV 维度呈连续幂律分布而非离散族群。目前最大的未解问题是理解模型为何在特定位置分配注意力,团队正通过 QK 对角化方法推进这一方向。

推荐理由

Anthropic 可解释性团队公开了注意力叠加与跨层表示的最新实验进展,并给出 QK 对角化这一研究路线。

阅读原文transformer-circuits.pub