跳到正文
原文
Transformer Circuits(Anthropic 可解释性)·· 2024-05-21精选关注度82

Anthropic 用稀疏自编码器从 Claude 3 Sonnet 提取可解释特征

Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet

AI 导读

Anthropic 使用稀疏自编码器从 Claude 3 Sonnet 中提取出大量可解释特征,其中一些特征看起来与安全相关。该工作属于 Transformer Circuits 系列的可解释性研究,重点在于把模型内部表征拆解为可读的特征,并观察其中与安全相关的部分。

推荐理由

Anthropic 用稀疏自编码器从 Claude 3 Sonnet 中提取出大量可解释特征,其中部分与安全相关,为机制可解释性提供了可迁移的提取方法。

阅读原文transformer-circuits.pub