跳到正文
原文
Transformer Circuits(Anthropic 可解释性)·· 2021-12-22

Anthropic 的可解释性基础设施 Garçon

Garcon

AI 导读

Anthropic 为其机制可解释性研究搭建了一套名为 Garçon 的基础设施,可在跨节点的大规模 Transformer 模型上进行激活读取、组件消融与梯度回传实验。它通过启动服务器并连接远程模型的接口运行前向传播,暴露一组 probe points,允许挂载探针函数访问或修改内部张量,并以云 pickle 传输任意 Python 对象到服务端执行。

阅读原文transformer-circuits.pub