跳到正文
原文
Transformer Circuits(Anthropic 可解释性)·· 2024-10-01

Anthropic 可解释性团队九月更新:后继头与 SAE 过采样

Circuits Updates — September 2024

AI 导读

Anthropic 可解释性团队报告称,他们在一个 18 层模型中复现并分析了实现序数序列递推的后继头(successor heads)。研究者通过权重检查中的 OV 电路发现最高分后继头能将约 80% 的序数 token 映射到其后继项,第二名的该比例为约 60%,且错误呈块状结构分布在与输入同类的其他序数 token 上。他们还借助独立成分分析寻找跨注意力头的共同模式,得到一个近似实现递进的组件,并在相关类别间存在一定串扰。

阅读原文transformer-circuits.pub