跳到正文
原文
Transformer Circuits(Anthropic 可解释性)·原文 · 入选 精选关注度62

Anthropic 发布 Transformer 逆向工程数学练习集

Exercises

AI 导读

Anthropic 的可解释性团队发布了一套配套其 Transformer 数学框架的练习集,要求读者为注意力头写出具体权重矩阵以实现特定算法,并附有解答。练习分三部分:热身题讨论单个注意力头如何用 W_Q、W_K、W_V、W_out 描述信息在残差流子空间之间的读写,以及 W_Q^T·W_K 和 W_out·W_V 的含义与秩;练习一用两个前一个 token 注意力头构造出看向两个 token 之前的虚拟注意力头,并展开 W_net 矩阵;练习二和练习三分别用指针算术和前一 token K-Composition 两种方式手工搭建归纳头,后者适用于 rotary attention 这类不向 W_V 暴露位置信息的机制。

推荐理由

Anthropic 可解释性团队把注意力头的权重写成显式矩阵,读者可据此亲手推导归纳头等机制。

阅读原文transformer-circuits.pub