跳到正文
原文
Transformer Circuits(Anthropic 可解释性)·原文 · 入选 精选关注度78

Anthropic 研究:induction head 或是 Transformer 上下文学习的主要机制

In-Context Learning and Induction Heads

AI 导读

Anthropic 的可解释性团队提出,induction head 可能是大型 Transformer 中大部分上下文学习的机制。induction head 由两层注意力头组成,前一个 token 头把前一 token 信息写入当前 token,第二个头据此找到此前出现过当前 token 的位置并复制其后的 token,实现 [A][B]…[A]→[B] 的模式补全。

推荐理由

Anthropic 的可解释性团队用六条证据把 induction head 与上下文学习联系起来,并给出可复用的消融与相变观察方法。

阅读原文transformer-circuits.pub