跳到正文
原文
Transformer Circuits(Anthropic 可解释性)·原文 · 入选 精选关注度62

Anthropic 提出机制忠实性的玩具模型:transcoder 可能学到不同机制

A Toy Model of Mechanistic (Un)Faithfulness

AI 导读

Anthropic 可解释性研究者 Chris Olah 发布非正式笔记,提出机制忠实性(mechanistic faithfulness)问题:用 transcoder 等稀疏近似替换模型组件时,替换件可能实现与原模型不同的计算机制。作者用绝对值问题(y=abs(x))构造玩具模型,在数据分布中加入重复数据点后,transcoder 会学出只对重复点激活的 datapoint feature,而原模型并无此概念,说明机制不忠实可在极简单设定中出现。

推荐理由

Anthropic 可解释性团队用玩具模型说明 transcoder 可能学到与原模型不同的机制,并提出 Jacobian 匹配作为缓解思路。

阅读原文transformer-circuits.pub