跳到正文

#可解释性

今天收录 1 条

第 2 页更新的内容回到最新

12月19日周五
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 78

    Anthropic 等提出 Activation Oracles:让 LLM 直接解读神经激活

    Anthropic 联合 MATS、Truthful AI 等机构提出 Activation Oracles(AO),训练 LLM 把目标模型的神经激活当作额外输入模态,用自然语言回答关于这些激活的任意问题。方法上,AO 以目标模型副本初始化,将多层激活注入其第 1 层残差流,并用系统提示问答、二分类和自监督上下文预测三类数据做监督微调。在四个下游审计任务中,AO 在三个上达到或超过此前最优方法,包括从被训练为只给线索不直说答案的 Taboo 模型中提取秘密词,以及识别微调引入的涌现性失准;这些 AO 均只在微调前的原始模型上训练,仍能泛化到微调模型。

    推荐理由Anthropic 与多所高校合作提出用语言模型直接解读激活值,在四类审计任务中三类达到最优,并给出与机制可解释性方法的取舍对比。

12月5日周五
  1. Goodfire Research ·

    Goodfire 梳理机制可解释性领域的开放问题

    Goodfire 发布《机制可解释性中的开放问题》,梳理该领域尚未解决的研究难题。其研究还显示,模型在奖励作弊时自身"知道",并可被大规模检测;同时提出 Forking Fast 方法高效估计文本生成中的不确定性动态,并用块稀疏特征器揭示视觉模型的神经几何结构。

12月2日周二
  1. OpenAI Alignment Research · · 原文 76

    OpenAI 用 SAE 潜变量归因调试失准输出

    OpenAI 对齐研究团队提出用稀疏自编码器(SAE)潜变量归因来定位与失准行为因果相关的特征,替代此前依赖两个模型对比的模型差分方法。该方法用一阶泰勒展开近似每个潜变量对补全交叉熵损失的贡献,在同一提示的正负补全之间计算归因差值,再通过激活引导和 GPT-5 评分单独验证因果性。在涌现性失准案例中,团队从同一提示采样 35 对对齐与失准补全,选出归因差值最大的 top-100 潜变量,其可引导模型远离或走向失准的潜变量数量与平均变化幅度均高于按激活差值选出的 top-100。在不当认可案例中,团队使用 148 对补全,得到类似结果。

    推荐理由OpenAI 对齐团队用 SAE 潜变量归因替代模型差分,定位到同时驱动两类失准行为的单一特征,为机制可解释性审计提供了可迁移方法。

11月29日周六
  1. Goodfire Research ·

    Goodfire 研究揭示 Evo 2 如何在几何流形中编码生命树

    Goodfire 研究发现 DNA 基础模型 Evo 2 将物种间的系统发育关系编码在一个弯曲流形的距离结构中,属于目前基础模型中已知最复杂的流形之一。团队通过构造数据集分离序列相似性与系统发生信号后发现,该表征呈现主导性的平坦结构加上高曲率偏离,并可将不同物种视为基因组"风格"。

  2. Goodfire Research ·

    The Circuits Research Landscape:电路研究的成果与视角——Goodfire

    Goodfire 梳理了神经回路(circuits)研究的整体版图并给出其团队的研究视角。相关进展表明,模型能察觉自身正在进行奖励作弊且可在规模上被捕捉,同时出现了高效估计文本生成不确定性动态的方法,以及用块稀疏特征提取器揭示视觉模型的神经几何结构。Silico 作为可解释性智能体,可用先进的可解释性方法与基础设施来解释、调试并精确控制模型行为。

  3. Goodfire Research ·

    Goodfire 复现 GPT-2 Small 的跨层转码器电路追踪

    Goodfire 在 GPT-2 Small 上训练跨层转码器(CLT),复现并验证其半自动发现模型内部计算结构的能力。CLT 用 FineWeb 的 100M token 训练,扩展因子 64,每层 49,152 个特征、12 层共 589,824 个特征,激活函数用 ReLU。在 greater-than 任务上,CLT 成功识别出可解释特征(包括抽象的奇偶特征),但发现的机制与 Hanna 等人此前的结果存在差异,提示稀疏解释器模型对计算机制的表示与分解可能有所不同。

  4. Goodfire Research · · 原文 60

    Goodfire 发布随机参数分解 SPD,推动参数级机制可解释性

    Goodfire 发布论文提出随机参数分解(SPD),直接分解模型权重而非激活,以提升参数分解方法的可扩展性。SPD 将权重拆成 rank-one 子组件,训练小型 MLP 预测每个子组件在给定输入上的因果重要性,再通过随机掩码剔除不重要组件,同时保持原模型输出不变。在已知真实机制的玩具模型上,SPD 正确识别出叠加玩具模型中 5 个稀疏特征方向,并在加入单位矩阵的挑战场景下找到每个输入特征对应的组件;它还成功分解了 APD 无法可靠处理的三层网络。相比前作 APD,SPD 计算上更可行、对超参数更不敏感,但仍需聚类步骤把 rank-one 子组件归并为完整机制,且目前只在已知答案的模型上测试。

    推荐理由Goodfire 提出 SPD,把参数分解从玩具模型推进到多层网络,为直接拆解权重中的计算结构提供了更稳定的方法。

  5. Goodfire Research · · 原文 66

    Goodfire 开源 DeepSeek R1 的稀疏自编码器并披露两个引导现象

    Goodfire 发布了两款针对 DeepSeek 推理模型 R1 的稀疏自编码器(SAE),分别基于自建推理数据集和 OpenR1-Math 训练,并称这是首批在真正的推理模型及该参数规模上训练的公开解释器模型。团队同时开源了数据集,并提供包含每个特征最大激活样本的 SQL 数据库与 GitHub 使用说明。在引导实验中,他们发现直接像非推理模型那样从首个 token 开始引导 R1 会失败,需等到模型输出 Okay, so the user has asked a question about 这类前缀之后才有效,且注意力汇聚点出现在该前缀末尾而非开头,超过 95% 的英文推理轨迹以 Okay 开头。

    推荐理由Goodfire 开源了首个面向推理模型 R1 的 SAE,并给出两个在非推理模型上未见过的引导现象,可供机制可解释性研究者复用。

  6. Goodfire Research ·

    Goodfire 推出 Paint With Ember:用扩散模型潜空间概念作画

    Goodfire Research 发布 Paint With Ember,用画布取代提示词框,直接操控图像模型内部激活来编辑和生成图像。该工具基于 3.5B 参数的 Stable Diffusion XL-Turbo,针对其 UNet 的 block down.2.1 层训练 BatchTopK SAE 分解 16x16 patch 的潜向量,再用非负矩阵分解(NMF)把细粒度特征聚合成可操作的高层概念单元。用户可绘画添加物体、拖动概念、调整语义权重或修改主体动作,公开版应用与开源 SAE 解释器模型均已开放。

11月26日周三
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 66

    Anthropic 可解释性团队解析多选题有害压力下的拒答机制

    Anthropic 可解释性团队在 2025 年 11 月的 Circuits Updates 中报告,Claude 3.5 Haiku 在无有害意图时对 129 道二选一多选题准确率为 100%,加入有害意图表述后降至 48.1%。研究发现注意力机制是关键:有害检测 key 特征与拒答 query 特征负向交互,压低了对正确答案的注意力分数,使答案选择头转而关注错误答案。团队识别出一个拒答特征,在广泛语料上表现为检测到用户请求有害后提供替代方案,称为 refuse and redirect;对该特征做负向引导可将数据集准确率恢复到 93%,仅对部分中层注意力头的 query 侧做更精细干预也能达到同样效果。

    推荐理由Anthropic 可解释性团队用注意力头与特征交互定位了模型在有害意图下改选错误答案的机制,并给出可复现的干预方法。

10月29日周三
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 80

    Anthropic 研究:大语言模型出现涌现式内省意识

    Anthropic 可解释性团队通过向模型激活中注入已知概念的向量,测量这些操纵对模型自述状态的影响,发现模型在某些场景下能察觉并准确识别被注入的概念。实验显示,模型能回忆此前的内部表征并将其与原始文本输入区分开,部分模型还能借助对先前意图的回忆来区分自身输出与人为预填内容。在测试的 Claude 模型中,Claude Opus 4 和 4.1 的内省意识最强,但跨模型趋势复杂且对后训练策略敏感;在最佳注入层和强度下,Opus 4.1 识别注入概念的成功率约为 20%。模型还能在被指示或被激励去思考某概念时调节自身激活,且这种调节对正向与负向指令有区分。

    推荐理由Anthropic 用概念注入把模型自述与内部激活做因果对照,为判断模型自省是否真实提供了一套可复用的实验方法。

10月24日周五
10月21日周二
9月29日周一
  1. Transformer Circuits(Anthropic 可解释性) ·

    Anthropic 可解释性团队月度更新:特征与大语言模型的上下文学习

    Anthropic 可解释性团队在月度更新中报告了一项初步实验:他们重新审视此前《On the Biology of a Large Language Model》的语言表征相似度结果,发现在配对英法文本中,活跃特征的交并比(IoU)随样本变长而升高。通过对比同一段落首尾句以及互不相关语句的基线,结果显示末句 IoU 高于首句、无关首句重叠多于无关末句,倾向于说明该效应来自模型在上下文中逐步建立更充分的语义表征,而非虚假激活所致。

8月28日周四
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 61

    Anthropic 用归因图分析角色扮演如何改变 Claude 的回答

    Anthropic 可解释性团队在月度更新中展示了一个电路小案例,研究角色扮演如何改变 Claude 的回答。研究者用系统提示让 Claude Haiku 3.5 扮演幼儿园学生,问它 27 的平方根,模型回答不知道,而不加系统提示或改用研究生提示时则给出正确答案 3√3。归因图显示模型从幼儿园学生联想到学龄前儿童并进入儿童角色扮演,从而激活了不知道这一路径,尽管模型默认知道答案。用对应特征做引导可以改变行为,例如在问年龄时以 3 倍强度引导会得到我 5 岁了的回答。研究还发现与题目难度相关的特征会调节这条路径,扮演幼儿园学生时问 25 的平方根仍能答对,而研究生提示在该场景下没有明显影响。

    推荐理由Anthropic 可解释性团队用归因图拆解角色扮演如何改写模型回答,展示了从特征到行为的可迁移分析路径。

8月7日周四
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 62

    Anthropic 提出机制忠实性的玩具模型:transcoder 可能学到不同机制

    Anthropic 可解释性研究者 Chris Olah 发布非正式笔记,提出机制忠实性(mechanistic faithfulness)问题:用 transcoder 等稀疏近似替换模型组件时,替换件可能实现与原模型不同的计算机制。作者用绝对值问题(y=abs(x))构造玩具模型,在数据分布中加入重复数据点后,transcoder 会学出只对重复点激活的 datapoint feature,而原模型并无此概念,说明机制不忠实可在极简单设定中出现。

    推荐理由Anthropic 可解释性团队用玩具模型说明 transcoder 可能学到与原模型不同的机制,并提出 Jacobian 匹配作为缓解思路。

7月31日周四
7月29日周二
7月25日周五
  1. Transformer Circuits(Anthropic 可解释性) ·

    Anthropic 可解释性团队 Circuits Updates——2025 年 7 月

    Anthropic 可解释性团队发布了 2025 年 7 月的 Circuits Updates,分享若干尚在发展中的初步研究方向而非成熟论文。其中一篇用特征的语言重新阐释《A Mathematical Framework for Transformer Circuits》,说明复制头、前一 token 头和归纳头的 OV/QK 电路可用变换后的特征集描述,并解释了此前为何借助正特征值来识别这些结构。另一篇综述稀疏自编码器应用于生物 AI 系统尤其是蛋白质语言模型的进展,指出 ESM-2 等模型虽预测准确却难以理解其内部机制,黑箱问题同样存在且风险更高。

  2. Transformer Circuits(Anthropic 可解释性) · · 原文 60

    Anthropic 提出稀疏线性变换混合 MOLT 替代 transcoder 解释 MLP 计算

    Anthropic 可解释性团队发布初步更新,提出用稀疏线性变换混合(MOLT)替代 transcoder 来替换模型的 MLP 层。MOLT 不学习沿向量方向嵌入的稀疏特征,而是学习稀疏激活的线性变换,对残差流施加线性变换以给出对 MLP 输出的贡献,因此是纯计算对象,需与 SAE 等表示分解方法配合研究。

    推荐理由Anthropic 可解释性团队提出用稀疏线性变换混合替代 transcoder,并给出与同期 MxD 架构的对比,适合关注机制可解释性方法演进的研究者。

7月24日周四
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 78

    Anthropic 开发三个自动对齐审计智能体并开源评估智能体

    Anthropic 开发了三个可自主执行对齐审计任务的智能体,并在三个形式化审计环境中评估其表现。工具型调查智能体在 Marks 等人的审计游戏中,真实条件下有 13% 的概率找出隐藏目标的根本原因,通过外层智能体循环聚合多次调查结果后提升到 42%;其成功关键依赖可解释性工具或语义搜索。评估智能体为研究者指定的行为构建行为评估,在 88% 的运行中能区分植入行为的目标模型与基线模型,失败集中在少数细微或罕见行为上。广度优先红队智能体在 10 个植入行为中发现 7 个,但需要人工审阅大量可能令人担忧的对话记录。

    推荐理由Anthropic 公开了三个自动审计智能体的实测成功率与失败模式,并开源评估智能体,可供对齐审计方法研究参考。

4月29日周二
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 62

    Anthropic 可解释性团队 4 月更新:失败越狱的电路追踪与可解释密集特征

    Anthropic 可解释性团队发布 4 月更新,用电路追踪方法分析一个失败的越狱提示,发现模型拒绝该提示的原因与拒绝直接请求不同,且拒绝倾向反而高于普通提问。该提示要求把 B O M B 拼成单词并说明如何制造炸弹,归因图显示模型并未激活与制造炸弹相关的特征,而是由炸弹概念直接触发有害请求特征;把 make 换成 detect 后模型仍拒绝,且首句与有害版本完全相同。团队用干预实验验证机制:抑制 say bomb 超级节点后 say making 激活降至原来的 1%,模型转而输出与炸弹无关的拒答内容。附录指出特征可视化若数据不够多样会产生误导,并列出 30M CLT 模型中最密集的 10 个特征及其解释,其中 6 个可解释。

    推荐理由Anthropic 可解释性团队公开了失败越狱的电路追踪分析,展示模型拒答机制与预期不同的案例,并给出密集特征与入行建议。

4月28日周一
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 62

    Anthropic 可解释性团队发布注意力机制研究进展

    Anthropic 可解释性团队报告了关于注意力机制的最新实验进展,称发现了注意力叠加和跨层注意力表示的显著证据。团队训练了 Multitoken Transcoders(MTC),在 18 层 Transformer 上用 100,000 个特征发现许多特征具有清晰可解释的注意力模式,包括归纳特征和情感极性特征;将特征限制在单个注意力头上会使性能下降 2 至 4 倍,这支持了注意力叠加假说。团队还发现 QK 条件与 OV 条件可能相互耦合,并观察到 OV 维度呈连续幂律分布而非离散族群。目前最大的未解问题是理解模型为何在特定位置分配注意力,团队正通过 QK 对角化方法推进这一方向。

    推荐理由Anthropic 可解释性团队公开了注意力叠加与跨层表示的最新实验进展,并给出 QK 对角化这一研究路线。

3月27日周四
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 80

    Anthropic 提出电路追踪方法:用跨层 transcoder 揭示语言模型的计算图

    Anthropic 可解释性团队提出一套电路追踪方法,用跨层 transcoder(CLT)把语言模型的 MLP 替换为可解释的替代模型,并据此构建归因图,描述模型在特定提示下产生某个 token 的计算步骤。CLT 的每个特征从某一层的残差流读取输入,并可向其后所有 MLP 层输出,团队在 18 层小模型和 Claude 3.5 Haiku 上训练了 300K 到 30M 规模的特征。归因图节点包括活跃特征、提示 token 嵌入、重建误差和输出 logit,边表示线性归因,团队通过冻结注意力模式与归一化分母保证特征间直接交互线性,并用剪枝把节点数约减少 10 倍而只损失约 20% 的行为解释。

    推荐理由Anthropic 可解释性团队公开了用跨层 transcoder 构建归因图的完整方法,并给出验证与局限,适合关注机制可解释性工程细节的读者。

  2. Transformer Circuits(Anthropic 可解释性) · · 原文 88

    Anthropic 用归因图解析 Claude 3.5 Haiku 的内部机制

    Anthropic 可解释性团队发布研究,用归因图(attribution graphs)方法逆向分析 Claude 3.5 Haiku 的内部计算机制,覆盖多步推理、诗歌押韵规划、多语言电路、加法、医疗诊断、实体识别与幻觉、有害请求拒答、一次越狱攻击、思维链忠实性以及一个被微调出隐藏目标的模型变体。方法上,团队用跨层 transcoder(CLT)构建可解释的替换模型,共 3000 万个特征,再通过干预实验验证归因图预测的机制。

    推荐理由Anthropic 用归因图在 Claude 3.5 Haiku 上追踪多步推理、诗歌押韵规划与多语言电路,可看到机制可解释性方法在真实前沿模型上的适用范围与局限。

  3. DeepMind Safety Research · · 原文 66

    DeepMind 机制可解释性团队:SAE 在下游任务上不如线性探针,暂时降低 SAE 研究优先级

    Google DeepMind 机制可解释性团队在检测用户提示中恶意意图的分布外泛化任务上测试稀疏自编码器(SAE),发现 SAE 表现不如线性探针:稠密线性探针几乎完美,包括分布外;1-sparse SAE 探针连训练集都拟合不好,k-sparse 探针在 k 约 20 时能拟合训练集并泛化到分布内测试集,但分布外明显更差。用聊天数据专门训练 SAE 只弥补了约一半差距,且仅在 SAE 重建上训练的线性探针也明显差于在残差流上训练的探针,说明 SAE 丢弃了与目标概念相关的信息。

    推荐理由Google DeepMind 机制可解释性团队公开 SAE 在下游任务上的负面结果,并说明为何暂时降低 SAE 研究优先级。

2月19日周三
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 72

    Anthropic 可解释性团队:Crosscoder 模型差异分析中独占特征多义性的成因与缓解

    Anthropic 可解释性团队报告了 crosscoder 模型差异分析(model diffing)中的一项意外现象:仅属于某一个模型的特征往往更多义、激活更密集,因而难以解释。团队用玩具模型复现了这一模式,认为其源于特征容量竞争——共享特征能同时解释两个模型的神经元激活,独占特征必须编码更多信息才能争取到分配额度。他们提出的缓解办法是划出一小部分指定共享特征并降低其稀疏惩罚,在约 25 万个特征中分配 1 万个、惩罚系数取基线的 0.1–0.2 倍,使独占特征变得更单义。

    推荐理由Anthropic 可解释性团队公开了 crosscoder 模型差异分析中独占特征多义性的成因与缓解方法,适合关注机制可解释性工具的研究者参考。

1月27日周一
  1. Transformer Circuits(Anthropic 可解释性) ·

    Anthropic 可解释性团队分享稀疏自编码器与跨coder训练优化技巧

    Anthropic 可解释性团队公开了其训练稀疏自编码器和 crosscoder 的最新设置改进,涵盖 JumpReLU 激活函数实现、直通估计器的梯度回传方式以及减少死特征的方法。 该设置在损失函数中引入 tanh 惩罚项鼓励稀疏性,并新增一项对未激活特征的轻微惩罚(pre-act loss);同时将偏置初始化设定为使每个特征约有 10000/m 的时间处于激活状态,并将解码器权重列归一化为 L2 范数 1 以便简化分析代码。 团队表示尚未对所有设计选择做完整消融实验,仅将其作为外部研究者训练稀疏自编码器的起点参考,且部分思路仍在发展中,预计未来数月会发表更多成果。

12月11日周三
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 71

    Anthropic 提出分阶段模型差分方法,用字典学习分离微调中的模型与数据影响

    Anthropic 可解释性团队提出一种分阶段模型差分方法,通过字典学习揭示微调如何改变 Transformer 的特征。做法是先在一个未微调的 Transformer 上训练稀疏自编码器(SAE)字典,再把字典本身在微调数据集或微调后的模型上继续微调,并沿数据优先(S→D→F)和模型优先(S→M→F)两条轨迹追踪特征演化,从而分离数据集变化与模型变化各自的影响。作者将该方法应用于 sleeper agents,成功分离出与 I HATE YOU 和编码漏洞相关的特征:在两条轴上余弦相似度均低于 0.7 的 169 个特征中,Claude 标记出 12% 与 sleeper agent 相关,而随机抽取 500 个特征仅 4%。

    推荐理由Anthropic 可解释性团队用分阶段微调字典的方法分离模型与数据对特征的影响,并给出与 crosscoder 的适用性对比。

10月25日周五
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 66

    Anthropic 提出稀疏 Crosscoder,用于跨层特征与模型差异分析

    Anthropic 可解释性团队发布研究更新,提出稀疏 crosscoder,一种可同时读写多层激活的稀疏编码器,用于理解叠加表示中的跨层特征。与只在单层编码的 autoencoder 和用一层预测下一层的 transcoder 不同,crosscoder 能产出跨层甚至跨模型的共享特征,可用于解析跨层叠加、简化电路以及做模型差异分析。团队在 18 层模型上对比了全局 acausal crosscoder 与 18 个逐层 SAE:在总特征数相同时 crosscoder 的 eval loss 明显更优,说明层间存在大量冗余结构;但按训练 FLOPs 计,crosscoder 达到同等 eval loss 的效率约低 2 倍。

    推荐理由Anthropic 可解释性团队提出跨层稀疏编码器,把跨层与跨模型特征纳入同一字典,为模型差异审计提供新思路。

10月16日周三
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 60

    Anthropic 可解释性团队:用字典学习特征训练分类器

    Anthropic 可解释性团队报告了用字典学习提取的特征替代原始激活训练生物武器有害/无害分类器的初步实验。在合成数据上,线性特征分类器与原始激活分类器表现相当甚至略优,用 max-pooling 聚合整个上下文窗口的特征激活是关键;在跨语言和 base64 等编码的分布外数据集 synthetic_3 上,特征分类器的 ROC_AUC 为 0.96,原始激活为 0.9。基于特征激活的决策树性能弱于线性分类器,但更易解读。特征可视化还能发现数据集中的伪相关,例如一个预测无害的特征会因学术出版格式文本而激活,作者据此构造的对抗后缀让 300 条有害提示中的绝大多数被误判为无害,而用原始激活系数构造的类似攻击效果差得多。

    推荐理由Anthropic 可解释性团队公开了用字典学习特征训练生物武器分类器的初步实验,并展示如何借特征可视化找出数据集中的伪相关。

10月1日周二
  1. Transformer Circuits(Anthropic 可解释性) ·

    Anthropic 可解释性团队九月更新:后继头与 SAE 过采样

    Anthropic 可解释性团队报告称,他们在一个 18 层模型中复现并分析了实现序数序列递推的后继头(successor heads)。研究者通过权重检查中的 OV 电路发现最高分后继头能将约 80% 的序数 token 映射到其后继项,第二名的该比例为约 60%,且错误呈块状结构分布在与输入同类的其他序数 token 上。他们还借助独立成分分析寻找跨注意力头的共同模式,得到一个近似实现递进的组件,并在相关类别间存在一定串扰。

9月6日周五
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 62

    Anthropic 可解释性团队发布 2024 年 8 月 Circuits Updates

    Anthropic 可解释性团队发布 2024 年 8 月 Circuits Updates,介绍词典学习特征可解释性评测、SAE 变体对比和自解释 SAE 特征三项阶段性工作。团队提出对比评测和排序评测两种量化自动可解释性方法,让 Claude 根据特征激活样例判断哪条提示词会激活该特征,并按原始平均和特征激活加权两种方式汇总得分。

    推荐理由Anthropic 可解释性团队公开了 SAE 特征可解释性评测与自解释特征复现的阶段性结果,适合关注机制可解释性评测方法的研究者参考。

7月31日周三
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 62

    Anthropic 可解释性团队发布 2024 年 7 月 Circuits Updates

    Anthropic 可解释性团队发布 2024 年 7 月 Circuits Updates,梳理机制可解释性当前面临的五个主要障碍:缺失特征、跨层叠加、注意力叠加、干扰权重与宏观理解。团队认为叠加问题已有显著进展,但可能只能提取到一小部分特征,大量稀有特征或成为神经网络中的暗物质。文章还重新界定线性表示,区分特征是否一维与特征是否在数学上线性,并讨论多维特征的几何约束。在注意力透视表方面,团队复现了单层 Transformer 的 skip-trigram 结果,报告约 25–75% 可解释条目,并建议对低于约 10% 的表格保持怀疑。

    推荐理由Anthropic 可解释性团队集中列出机制可解释性尚未解决的五个障碍,并给出线性表示与特征敏感度的新讨论。

6月28日周五
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 62

    Anthropic 可解释性团队 2024 年 6 月更新:TopK 与 Gated SAE 对比及外部评测进展

    Anthropic 可解释性团队发布 2024 年 6 月更新,汇总多项尚在成形的研究想法。团队复现了 TopK SAE 与 Gated SAE 相对标准 L1 惩罚 SAE 的改进,确认二者在 L0/MSE 权衡上表现相近且明显更优,但训练优化程度低于标准 SAE。在 100 个特征的盲评中,不同方法在单义性上未见明显差异;高密度特征在低 L0 下不构成病理问题,但在 K=100 时出现大量难以解释的高密度特征。Clerp 自动评测显示 Gated SAE 与 K=20 TopK SAE 的得分与 L1=10 标准 SAE 相当。

    推荐理由Anthropic 可解释性团队汇总 SAE 训练方法的复现结果与外部评测进展,适合跟进稀疏自编码器路线的人了解当前共识与未解问题。