跳到正文

可解释性

今天新收录 11 条(含旧文)

第 8 页更新的内容回到最新

10月1日周四
  1. Transformer Circuits · 收录 · 原文 43

    Anthropic 在 Claude Sonnet 4.5 中发现情绪概念表征并证实其影响输出

    Anthropic 的可解释性研究团队在 Claude Sonnet 4.5 中发现了情绪概念的内部表征,并表明这些表征会因果性地影响模型的输出。研究以 Transformer Circuits 文章形式发布,但当前可见内容仅为摘要,未提供具体探测方法、表征位置和实验细节。

    推荐理由Anthropic 在 Claude Sonnet 4.5 中找到情绪概念表征并给出其因果影响输出的证据,是机制可解释性研究的一个具体案例。

  2. Transformer Circuits · 收录 · 原文 43

    Anthropic 开源注意力头可视化工具 HeadVis

    Anthropic 可解释性团队发布交互式工具 HeadVis,用于研究大语言模型中的注意力头,并开源了前端代码与后端接口规范。工具通过注意力模式可视化、分布指标、低秩分量投影以及经 QK 和 OV 电路的 SAE 特征归因,帮助生成和检验关于注意力头功能的假设。作者用 Claude Haiku 3.5 做了四个案例:归纳头在特征基上表现为模糊归纳;此前研究的行宽头在完整分布上呈现年份、多 token 词和换行三种行为,PCA 显示 Q、K、O 激活可清晰聚类;答案选择头在更广分布上复用了同一套选择机制,虚拟权重分析提示它可能是单义的;同集合抑制头会抑制国家与其本国城市之间的注意力,在 185 句自造句子上有 98% 的情况成立。

    推荐理由Anthropic 开源了注意力头可视化工具 HeadVis,并给出四个从易到难的案例,展示注意力头在完整数据分布上的行为如何偏离单一任务描述。

  3. Goodfire Research · 收录 · 原文 43

    Goodfire 提出 Block-Sparse Featurizers,在视觉模型中还原多维概念流形

    Goodfire Research 提出 Block-Sparse Featurizers(BSF),用多维子空间替代 SAE 等常用方法的一维直线假设,把模型激活分解为成组同时激活的 block。作者认为现有 SAE 和 transcoder 假设每个内部概念是一条直线,无法刻画表示中弯曲的多维结构,而 BSF 在 block 层面施加稀疏性,还提出 vanilla BSF、Grassmannian BSF 和 group-lasso BSF 三个变体。

    推荐理由Goodfire 提出用块稀疏分解替代 SAE 的直线假设,在视觉模型中恢复出多维概念流形,为机制可解释性提供新的工具思路。

  4. Transformer Circuits · 收录 · 原文 55

    Anthropic 提出自然语言自编码器 NLA,用文本解释 LLM 激活

    Anthropic 可解释性团队提出自然语言自编码器(NLA),一种无监督生成 LLM 激活自然语言解释的方法。NLA 由激活语言化器(AV)和激活重建器(AR)两个 LLM 模块组成,二者以目标模型副本初始化,经监督微调预热后,用强化学习联合训练以重建残差流激活,重建质量以方差解释比例(FVE)衡量,论文中达到 0.6–0.8。作者在 Claude Opus 4.6 的部署前审计中应用 NLA,帮助诊断安全相关行为,并发现模型未说出口的评测感知,即模型内部认为自己在被评测却未明说。在需要端到端调查一个故意错位模型的自动化审计基准上,配备 NLA 的智能体优于基线,且无需访问该模型的训练数据。

    推荐理由Anthropic 提出用自然语言自编码器把激活翻译成可读解释,并给出审计 Claude Opus 4.6 的案例与量化评测。

  5. Transformer Circuits · 收录 · 原文 43

    Anthropic 可解释性团队:用下游连接预测哪些特征会操控模型行为

    Anthropic 可解释性团队提出用 TWERA 排序的下游特征来补充标准特征描述,从而区分外观相似但因果作用不同的特征。标准做法只看 top activating examples 和 top unembeds,往往无法区分两个都激活于同一提示词的特征,例如在“草是什么颜色”中只有 Feature B 被抑制才会把答案从 Green 改成 Red。团队用 TWERA 虚拟权重衡量特征间的下游连接,发现 Feature A 的下游是十六进制颜色编码,Feature B 的下游更泛化并包含“说出 green”的特征。

    推荐理由Anthropic 可解释性团队用下游连接区分外观相似的特征,并给出可迁移的审计方法。

  6. Transformer Circuits · 收录 · 原文 36

    Anthropic 可解释性团队介绍 Turn-Averaged SAE 等初步研究

    Anthropic 可解释性团队发布 2026 年 6 月更新,介绍包括 Turn-Averaged SAE 在内的多项初步研究,并说明这些结果更接近实验室内部讨论而非成熟论文。Turn-Averaged SAE 的做法是把单个人类或助手回合内所有 token 的残差流取平均,再训练 SAE 重建该表示,从而把每个回合的特征激活数量从 n_tokens × L0 降到 L0。

  7. Transformer Circuits · 收录 · 原文 60

    Anthropic 提出 Jacobian lens,发现语言模型中的全局工作空间

    Anthropic 可解释性团队提出 Jacobian lens(J-lens)新技术,用于识别语言模型中随时可被言语化的内部表征,并发现这些表征构成一个类似神经科学全局工作空间的子空间,称为 J-space。J-lens 通过计算激活对模型输出 token 的一阶因果效应并在大量上下文上取平均,改进了 logit lens,能在更早的层读出可解释内容。作者称 J-space 具备言语报告、定向调制、内部推理、灵活泛化和选择性五项功能属性,但只占激活总方差的一小部分。

    推荐理由Anthropic 提出 Jacobian lens 新方法,把模型可言语化的内部表征识别为一个类似全局工作空间的子空间,为审计模型未说出口的推理提供了可迁移工具。

  8. Transformer Circuits · 收录 · 原文 43

    Anthropic 在单层语言模型中刻画干扰权重

    Anthropic 可解释性团队训练了一个约 2.9M 参数的单层 Transformer,将其分解为 token、位置、transcoder 特征与 logits 之间的虚拟权重,并沿有效性和有益性两个轴为每个权重打分,首次在训练好的 Transformer 内部通过测量对训练损失的影响确认了干扰权重的存在。有效性用 Fisher 信息度量权重对输出分布的影响,有益性用消融后损失的平均变化度量。

    推荐理由Anthropic 可解释性团队在单层 Transformer 中首次用损失变化定位干扰权重,为直接读取权重电路提供了可复现的度量方法。

9月30日周三
  1. Redwood Research · 收录 · 原文 35

    Redwood Research 提出 NLS depth:量化模型不可言说串行认知的新指标

    Redwood Research 提出 NLS depth(自然语言根基节点分隔深度),用于量化模型可执行的不可言说串行认知量,作为思维链可监控性的代理指标。该指标基于 GDM 论文(Brown-Cohen 等,2026)的"不透明串行深度"概念,将输出文本且由预训练先验初始化的节点视为"可解释瓶颈",标准 Transformer 的该深度与层数成正比。

  2. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文44

    研究:自然语言自动编码器中哪些 token 最值得审计

    一项基于 470 万条提示注入与隐藏行为解释的研究比较了模型计算信号与仅依赖对话结构的排序器,发现在四个数据集中的三个上,只解释 5% 的位置就能接近逐位置解释的成功率,此处成功指获得有关威胁的解释。研究还表明,预训练的言语化器无需额外训练即可还原模型经微调学会隐藏的词。作者指出这有助于确定审计者的解释生成重点。

  3. AI Alignment Forum · 收录 · 原文 50

    潜在推理架构可能削弱 CoT 这一最强监督工具

    Lukas Finnveden 在 AI Alignment Forum 发文认为,向潜在推理架构的转变很可能削弱思维链(CoT)的可监控性,使 AI 监督更加困难。文章把 CoT 当前的价值分为两类:必要性,即模型不把计划说出来就无法完成目标;倾向性,即模型即使没必要也倾向于把推理写进 CoT。作者认为必要性论证更稳健,因为 CoT 是模型突破单次前向传播串行步数限制的唯一途径,且 RL 不会很快探索出高度非人类的 CoT 用法。潜在推理架构会缩小甚至消除有 CoT 与无 CoT 能力之间的差距:COCONUT 完全用连续潜在思维替代文本 CoT,full-bandwidth transformer 在 CoT 之外并行增加潜在通道,looped transformer 则在文本瓶颈之间大幅增加串行深度。

已经到底了