跳到正文
原文
Transformer Circuits(Anthropic 可解释性)·· 2025-07-25精选关注度60

Anthropic 提出稀疏线性变换混合 MOLT 替代 transcoder 解释 MLP 计算

Sparse mixtures of linear transforms

AI 导读

Anthropic 可解释性团队发布初步更新,提出用稀疏线性变换混合(MOLT)替代 transcoder 来替换模型的 MLP 层。MOLT 不学习沿向量方向嵌入的稀疏特征,而是学习稀疏激活的线性变换,对残差流施加线性变换以给出对 MLP 输出的贡献,因此是纯计算对象,需与 SAE 等表示分解方法配合研究。

推荐理由

Anthropic 可解释性团队提出用稀疏线性变换混合替代 transcoder,并给出与同期 MxD 架构的对比,适合关注机制可解释性方法演进的研究者。

阅读原文transformer-circuits.pub