Transformer Circuits(Anthropic 可解释性)·2021-12-22 08:00· 2021-12-22Anthropic 的可解释性基础设施 GarçonGarconAI 导读Anthropic 为其机制可解释性研究搭建了一套名为 Garçon 的基础设施,可在跨节点的大规模 Transformer 模型上进行激活读取、组件消融与梯度回传实验。它通过启动服务器并连接远程模型的接口运行前向传播,暴露一组 probe points,允许挂载探针函数访问或修改内部张量,并以云 pickle 传输任意 Python 对象到服务端执行。阅读原文transformer-circuits.pub#工具/开源#可解释性#Anthropic