跳到正文
原文
Transformer Circuits(Anthropic 可解释性)·· 2023-10-04精选关注度74

Anthropic 用字典学习分解语言模型,迈向单义特征

Towards Monosemanticity: Decomposing Language Models With Dictionary Learning

AI 导读

Anthropic 的可解释性研究团队用稀疏自编码器从单层 Transformer 中提取出大量可解释特征,探索把叠加的多义神经元分解为单义特征。该工作以字典学习为方法,目标是让语言模型内部表征更易被人类理解。

推荐理由

Anthropic 可解释性团队用稀疏自编码器从单层 Transformer 中提取大量可解释特征,是机制可解释性方向的方法起点。

阅读原文transformer-circuits.pub