跳到正文
原文
Transformer Circuits(Anthropic 可解释性)·· 2025-03-27精选关注度88

Anthropic 用归因图解析 Claude 3.5 Haiku 的内部机制

On the Biology of a Large Language Model

AI 导读

Anthropic 可解释性团队发布研究,用归因图(attribution graphs)方法逆向分析 Claude 3.5 Haiku 的内部计算机制,覆盖多步推理、诗歌押韵规划、多语言电路、加法、医疗诊断、实体识别与幻觉、有害请求拒答、一次越狱攻击、思维链忠实性以及一个被微调出隐藏目标的模型变体。方法上,团队用跨层 transcoder(CLT)构建可解释的替换模型,共 3000 万个特征,再通过干预实验验证归因图预测的机制。

推荐理由

Anthropic 用归因图在 Claude 3.5 Haiku 上追踪多步推理、诗歌押韵规划与多语言电路,可看到机制可解释性方法在真实前沿模型上的适用范围与局限。

阅读原文transformer-circuits.pub