跳到正文
原文
Transformer Circuits(Anthropic 可解释性)·原文 · 入选 精选关注度62

Anthropic 在单层语言模型中刻画干扰权重

Characterizing interference weights in a tiny language model

AI 导读

Anthropic 可解释性团队训练了一个约 2.9M 参数的单层 Transformer,将其分解为 token、位置、transcoder 特征与 logits 之间的虚拟权重,并沿有效性和有益性两个轴为每个权重打分,首次在训练好的 Transformer 内部通过测量对训练损失的影响确认了干扰权重的存在。有效性用 Fisher 信息度量权重对输出分布的影响,有益性用消融后损失的平均变化度量。

推荐理由

Anthropic 可解释性团队在单层 Transformer 中首次用损失变化定位干扰权重,为直接读取权重电路提供了可复现的度量方法。

阅读原文transformer-circuits.pub