跳到正文
原文
Transformer Circuits(Anthropic 可解释性)·· 2026-06-30

Anthropic 可解释性团队介绍 Turn-Averaged SAE 等初步研究

Circuits Updates — June 2026

AI 导读

Anthropic 可解释性团队发布 2026 年 6 月更新,介绍包括 Turn-Averaged SAE 在内的多项初步研究,并说明这些结果更接近实验室内部讨论而非成熟论文。Turn-Averaged SAE 的做法是把单个人类或助手回合内所有 token 的残差流取平均,再训练 SAE 重建该表示,从而把每个回合的特征激活数量从 n_tokens × L0 降到 L0。

阅读原文transformer-circuits.pub