跳到正文
原文
Transformer Circuits(Anthropic 可解释性)·· 2026-06-01精选关注度62

Anthropic 可解释性团队:用下游连接预测哪些特征会操控模型行为

Circuits Updates — May 2026

AI 导读

Anthropic 可解释性团队提出用 TWERA 排序的下游特征来补充标准特征描述,从而区分外观相似但因果作用不同的特征。标准做法只看 top activating examples 和 top unembeds,往往无法区分两个都激活于同一提示词的特征,例如在“草是什么颜色”中只有 Feature B 被抑制才会把答案从 Green 改成 Red。团队用 TWERA 虚拟权重衡量特征间的下游连接,发现 Feature A 的下游是十六进制颜色编码,Feature B 的下游更泛化并包含“说出 green”的特征。

推荐理由

Anthropic 可解释性团队用下游连接区分外观相似的特征,并给出可迁移的审计方法。

阅读原文transformer-circuits.pub