跳到正文
原文
Goodfire Research·· 2026-02-05精选关注度60

Goodfire 发布 Llama 3.3 70B 的 SAE 特征空间图谱与 API

Mapping the Latent Space of Llama 3.3 70B - Goodfire

AI 导读

Goodfire 在 Llama 3.3 70B 上训练了稀疏自编码器(SAE),并通过 API 开放这一带可解释性工具的模型,作者称这是当时公开可用的最强可解释性模型。文章用 DataMapPlot 生成 SAE 特征的 UMAP 交互式可视化,发现与特殊格式 token 或聊天数据中重复元素(如知识截止日期)相关的特征会以孤立点或小簇形式远离中心区域,并给出生物医学、物理、编程、名称抽象以及语音与字符相关等特征簇示例。

推荐理由

Goodfire 公开了 Llama 3.3 70B 的 SAE 特征图与 API,并给出特征引导中事实性随强度下降的实测曲线,可作机制可解释性研究的参考。

阅读原文goodfire.com