Transformer Circuits(Anthropic 可解释性)·2025-07-29 08:00· 2025-07-29Anthropic 可解释性研究:干扰权重(interference weights)的玩具模型A Toy Model of Interference WeightsAI 导读Anthropic 可解释性团队发布"干扰权重"(interference weights)的玩具模型,对该概念做更深入的拆解。原文未给出具体模型版本、实验数据或评测结果,仅说明这是对干扰权重机制的进一步展开。阅读原文transformer-circuits.pub#可解释性#Anthropic