跳到正文
原文
Transformer Circuits(Anthropic 可解释性)·· 2025-07-25

Anthropic 可解释性团队 Circuits Updates——2025 年 7 月

Circuits Updates — July 2025

AI 导读

Anthropic 可解释性团队发布了 2025 年 7 月的 Circuits Updates,分享若干尚在发展中的初步研究方向而非成熟论文。其中一篇用特征的语言重新阐释《A Mathematical Framework for Transformer Circuits》,说明复制头、前一 token 头和归纳头的 OV/QK 电路可用变换后的特征集描述,并解释了此前为何借助正特征值来识别这些结构。另一篇综述稀疏自编码器应用于生物 AI 系统尤其是蛋白质语言模型的进展,指出 ESM-2 等模型虽预测准确却难以理解其内部机制,黑箱问题同样存在且风险更高。

阅读原文transformer-circuits.pub