跳到正文
原文
Transformer Circuits(Anthropic 可解释性)·· 2025-07-29

Anthropic 可解释性研究:干扰权重(interference weights)的玩具模型

A Toy Model of Interference Weights

AI 导读

Anthropic 可解释性团队发布"干扰权重"(interference weights)的玩具模型,对该概念做更深入的拆解。原文未给出具体模型版本、实验数据或评测结果,仅说明这是对干扰权重机制的进一步展开。

阅读原文transformer-circuits.pub