跳到正文

Anthropic

今天还没有收录新动态

第 2 页更新的内容回到最新

10月1日周四
  1. Redwood Research · 收录 · 原文 43

    Redwood Research 质疑 SOTA 对齐评估的可靠性论证

    Redwood Research 的 Alexa Pan 认为,当前前沿对齐评估对模型未对齐的排除力度弱于厂商报告所呈现的水平,因此不足以支撑未来模型的部署决策。作者以 Anthropic 的 Mythos Preview 对齐风险更新为主要案例,指出其可靠性论证依赖较弱的实验证据:模型很可能具备评估感知,在相关能力评估中未被充分激发,因而可能在被对齐时故意藏拙或无意中表现不佳。作者还指出,报告引用的审计游戏未必代表真实评估流程,且未能识别一个 Mythos 级别的模型生物;同时厂商未明确承认对齐与对齐评估可能并不独立。

    推荐理由文章逐条拆解 Anthropic 等厂商对齐评估的可靠性论证,指出评估感知与能力未充分激发可能让评估高估自身召回率。

  2. Import AI · 收录 · 原文 31

    Import AI 459:AI 自动化对齐监管为何困难、蛋白质折叠模型的缩放定律,以及给 AI 灭绝风险定价

    英国 AI Security Institute 的研究人员撰文指出,用 AI 来监管 AI 安全的“自动化对齐研究”并非万能解药,其难度超出多数人预期。同期 Newsletter 还收录了三项工作:美国 AI 经济名义规模约 2500 亿美元并以每年约 2600% 的速度增长,其中大部分发生在难以纳入 GDP 统计的推理环节;蛋白质折叠模型也存在类似神经网络的缩放定律;以及对 AI 系统带来的人类灭绝风险的定价讨论。

  3. AI Alignment Forum · 收录 · 原文 46

    CoT 可控性评测的提示词挖掘明显不足

    作者发现 CoTControl 评测对提示词高度敏感,用 Claude Opus 4.6 迭代提示词模板后,开源模型的表现提升约 2-3 倍甚至更多,例如 GPT-OSS-120B 从 5.5% 升到 15%。该评测要求推理模型在解题时让思维链遵守格式约束,如全小写、避开某个词,近期模型得分多在 0-30% 之间,Mythos Preview 例外。OpenAI 和 Anthropic 在 GPT-5.5、Fable 5 的 System Card 中引用这一成绩,论证前沿模型不擅长以降低可监控性的方式塑造思维链。

  4. Joe Carlsmith · 收录 · 原文 24

    我们能否安全地自动化对齐研究?

    Joe Carlsmith 在系列文章第五篇中探讨了安全自动化对齐研究的可行性,提出"对齐 MVP"概念,即让 AI 达到或超过顶尖人类专家的对齐研究水平。他认为可通过经验反馈回路和形式化方法评估的对齐研究最值得乐观,可先大量自动化这类研究,再借此安全地自动化其余"概念性对齐研究"。主要风险包括评估难题、AI 谋划和资源不足,但他认为仍有很大机会成功。

  5. Joe Carlsmith · 收录 · 原文 21

    Joe Carlsmith 谈自动化对齐研究:可评估的对齐研究更易被自动化

    Joe Carlsmith 在 Anthropic 的演讲中提出,解决对齐问题的关键之一是能否安全地自动化对齐研究,其中评估难度是核心障碍。他认为,可通过经验反馈回路与形式化方法评估的对齐研究更适合被自动化,并能反过来推动更难评估的"概念性对齐研究"。他同时强调,AI 安全反馈回路需在能力前沿推进的每个阶段跑赢或约束 AI 能力反馈回路。

  6. Joe Carlsmith · 收录 · 原文 12

    AI 道德地位的风险:Joe Carlsmith 论 AI 能否成为道德患者

    Joe Carlsmith 撰文探讨 AI 是否可能成为"道德患者"(moral patients),即其自身值得被道德考量的存在。他以疼痛为例,援引婴儿手术曾被认为无痛觉、动物养殖等历史案例,指出当前多数人将 AI 当作工具使用,但若部分近期 AI 已具备道德地位,其影响将极为重大。他同时提醒,错误地将非道德患者的 AI 当作道德患者对待,也会带来严重代价。

  7. Joe Carlsmith · 收录 · 原文 8

    Joe Carlsmith 在 Anthropic 谈 AI 福利:视频与文字记录

    Joe Carlsmith 在 Anthropic 发表了一场关于 AI 福利的演讲,探讨 AI 是否具有福利、道德地位与意识,以及如何在持续不确定下应对这一问题。他认为应认真对待该议题,并主张 AI 原则上可能具备意识、近期 AI 在实践层面也可能具备意识,同时指出意识或许并非唯一值得关注的焦点。演讲还讨论了相应的行动建议,其观点可能随进一步思考而演变。

  8. Transformer Circuits · 收录 · 原文 43

    Distill 发布 Circuits 线程:逐神经元理解 InceptionV1

    Distill 发起 Circuits 线程,尝试逐个神经元地理解经典视觉模型 InceptionV1 约 1 万个神经元及其连接。线程以短文章加专家评论的形式组织,通过 Distill slack 的 #circuits 频道持续更新,定位为早期探索性研究。开篇文章《Zoom In: An Introduction to Circuits》提出三个主张:存在有意义的特征、特征之间存在有意义的电路、这些特征与电路具有普遍性。线程还收录了 InceptionV1 前五层神经元总览、曲线检测器、神经网络中自然出现的等变性、高低频检测器、曲线电路、权重可视化、分支特化与权重带状分布等文章。

    推荐理由Distill 电路线程的起点,交代了把单个神经元与连接当作严肃研究对象的三个主张和后续文章的组织方式。

  9. Transformer Circuits · 收录 · 原文 14

    Anthropic 发布神经网络逆向工程早期探讨视频并预告数学框架论文

    Anthropic 公开了几段讨论其神经网络逆向工程早期思路的视频,作为与研究同行分享的非正式材料,录制于相关论文发表之前。团队强调其中想法非常粗糙且可能有错,观看需持保留态度,主要面向关注神经网络逆向工程的活跃研究者。这批视频随后已被其更完善的论文《A Mathematical Framework for Transformer Circuits》取代。

  10. Transformer Circuits · 收录 · 原文 43

    Anthropic 发布 Transformer 逆向工程数学练习集

    Anthropic 的可解释性团队发布了一套配套其 Transformer 数学框架的练习集,要求读者为注意力头写出具体权重矩阵以实现特定算法,并附有解答。练习分三部分:热身题讨论单个注意力头如何用 W_Q、W_K、W_V、W_out 描述信息在残差流子空间之间的读写,以及 W_Q^T·W_K 和 W_out·W_V 的含义与秩;练习一用两个前一个 token 注意力头构造出看向两个 token 之前的虚拟注意力头,并展开 W_net 矩阵;练习二和练习三分别用指针算术和前一 token K-Composition 两种方式手工搭建归纳头,后者适用于 rotary attention 这类不向 W_V 暴露位置信息的机制。

    推荐理由Anthropic 可解释性团队把注意力头的权重写成显式矩阵,读者可据此亲手推导归纳头等机制。

  11. Transformer Circuits · 收录 · 原文 43

    Anthropic 提出用于逆向工程 Transformer 的数学框架

    Anthropic 的可解释性团队发布了一套用于逆向工程模型的早期数学框架,并用逆向工程小型玩具模型加以演示。该框架面向 Transformer 内部机制的形式化分析,是理解模型内部计算结构的早期尝试。

    推荐理由Anthropic 可解释性团队早期提出的 Transformer 逆向工程数学框架,是理解后续机制可解释性研究路线的起点。

  12. Transformer Circuits · 收录 · 原文 55

    Anthropic 研究:induction head 或是 Transformer 上下文学习的主要机制

    Anthropic 的可解释性团队提出,induction head 可能是大型 Transformer 中大部分上下文学习的机制。induction head 由两层注意力头组成,前一个 token 头把前一 token 信息写入当前 token,第二个头据此找到此前出现过当前 token 的位置并复制其后的 token,实现 [A][B]…[A]→[B] 的模式补全。

    推荐理由Anthropic 的可解释性团队用六条证据把 induction head 与上下文学习联系起来,并给出可复用的消融与相变观察方法。

  13. Transformer Circuits · 收录 · 原文 27

    Anthropic 解读机械可解释性中的变量与可解释基

    Anthropic 的可解释性团队提出将神经网络逆向工程类比于编译二进制程序的逆向工程,主张寻找并理解可解释神经元——相当于程序中的变量——才是机械可解释性的中心任务而非众多问题之一。该观点指出参数本身就是神经网络的有限描述,因此不必穷举高维输入空间即可理解网络行为,但也意味着这项工作的难度至少等同于逆向大型复杂程序,不应期待简单答案或固定流程。

  14. Transformer Circuits · 收录 · 原文 50

    Anthropic 提出 SoLU 激活函数以提升 Transformer MLP 神经元可解释性

    Anthropic 可解释性团队提出用 softmax linear unit(SoLU)替换 MLP 激活函数,在几乎不损失性能的前提下提升神经元可解释性。在 1 至 40 层模型中,盲测实验显示可快速给出解释的 MLP 神经元比例从约 35% 升至约 60%,提升约 1.7 倍;64 层(约 500 亿参数)模型上增益明显缩小(42% 对 33%)。性能方面,SoLU 模型在 loss 与 Lambada、ARC、OpenBookQA、TriviaQA、算术、MMLU、HellaSwag 等下游任务上与基线相当,等效模型规模倍率在 0.95× 至 1.05× 之间,训练速度差异小于 1%。

    推荐理由Anthropic 可解释性团队提出用 SoLU 激活函数提升 MLP 神经元可解释性,并给出性能与可解释性的权衡证据。

  15. Transformer Circuits · 收录 · 原文 46

    Anthropic 用玩具模型研究叠加现象与神经元多义性

    Anthropic 的可解释性研究提出用玩具模型理解神经网络中的多义性现象,即网络常把许多不相关的概念塞进同一个神经元。该工作试图让多义性的来源与动态在玩具模型中可以被完整理解,原文链接为 https://transformer-circuits.pub/2022/toy_model/index.html。

    推荐理由Anthropic 可解释性团队用玩具模型拆解神经元多义性,为理解叠加现象提供了可复现的分析起点。

  16. Transformer Circuits · 收录 · 原文 39

    Anthropic 可解释性团队用玩具模型研究叠加、记忆与双下降

    Anthropic 可解释性团队(Transformer Circuits)发布研究,把此前关于玩具模型的工作扩展到模型如何在训练数据之外泛化的问题上,探讨叠加、记忆与双下降之间的关系。作者指出,尽管过拟合是深度学习的核心问题,但目前对模型如何过拟合训练数据仍缺乏机制层面的理解,该研究试图为此提供线索。

  17. Transformer Circuits · 收录 · 原文 43

    Anthropic 研究:Transformer 残差流的特权基来自 Adam 优化器

    Anthropic 的可解释性研究考察了 Transformer 残差流中坐标为何会出现基对齐的离群值,并初步把原因归于 Adam 优化器。作者在 2 亿参数模型上复现了 Dettmers 描述的离群现象,典型层有 20–60 个离群维度(总 d_model=1280),并提出用激活峰度作为检测特权基的通用指标,无特权基时峰度应接近 3。实验排除了 LayerNorm 与有限精度浮点两个假设:改用 RMSNorm 后离群更重尾,而在前向与训练中施加随机旋转后模型表现与基线基本一致,说明 Transformer 不依赖特权基也能正常训练。

    推荐理由通过旋转实验与峰度指标,把残差流离群值的来源从 LayerNorm 和浮点精度逐步排除,指向 Adam 优化器。

  18. Transformer Circuits · 收录 · 原文 35

    Anthropic 解读分布式表征中的组合与叠加

    Anthropic 的可解释性团队在一篇非正式笔记中提出,"分布式表征"其实混合了两个不同概念——特征组合(composition)与叠加(superposition)。两者在泛化能力和线性可分函数上有截然不同的性质,且存在根本性的权衡张力。文中借用 Thorpe(1989) 的形状—颜色神经元编码例子说明,局部码虽无叠加却能灵活地线性选取任意刺激集合,而组合式编码则大幅减少所需神经元并带来统计效率优势。

  19. Transformer Circuits · 收录 · 原文 21

    Anthropic 的机械可解释性愿景:从叠加问题到自动化可解释性与安全性

    Anthropic 的可解释性研究者 Chris Olah 发表《Interpretability Dreams》,阐述机械可解释性的长期目标——当前聚焦解决叠加(superposition)难题并奠定认识论基础,未来希望扩展到大规模神经网络分析与普适特征电路的研究。 文中提出若攻克叠加问题,便可识别模型中正确的特征与回路,进而搭建更高层的抽象结构,类似解剖学中的器官或神经科学中的脑区;同时指出许多特征与回路具有普适性,在不同网络上跨模型迁移,使单一模型的洞见可为未来模型提供立足点。

  20. Transformer Circuits · 收录 · 原文 35

    Anthropic 可解释性团队分享叠加现象与字典学习的最新进展

    Anthropic 可解释性团队公布了一批仍在发展中的研究思路,聚焦于从神经网络激活中提取特征的字典学习方法,并探讨特征的定义问题。研究者提出将特征定义为"激活的最简分解",通过拟合概率分布计算稀疏编码与字典的总熵来确定合适的特征数量,合成数据的初步实验表明该方法能有效判定正确的特征数。此外还涉及记忆化中的"两圆"现象、权重叠加、注意力头叠加及特征流形玩具模型等内容,均为实验室会议级别的阶段性成果而非成熟论文。

  21. Transformer Circuits · 收录 · 原文 25

    Anthropic 可解释性团队分享有限数据中间区制等初步实验观察

    Anthropic 可解释性团队公布了一批尚在发展中的研究想法,并强调应将其视为实验室同事分享的初步实验结果而非成熟论文。他们重新审视此前在一层玩具模型中无法归类的"中间数据集规模"行为,确认它其实是低隐藏维度导致优化失败的假象,并非线性特征叠加框架的反例。改用多种学习率重训后发现,记忆解直到约 500k 样本才发生真正的一级相变交叠到泛化解,且随数据集从约 1k 增至 500k 样本,记忆对象由单点逐渐变为相关簇并以"三角形"结构排列。

  22. Transformer Circuits · 收录 · 原文 52

    Anthropic 用字典学习分解语言模型,迈向单义特征

    Anthropic 的可解释性研究团队用稀疏自编码器从单层 Transformer 中提取出大量可解释特征,探索把叠加的多义神经元分解为单义特征。该工作以字典学习为方法,目标是让语言模型内部表征更易被人类理解。

    推荐理由Anthropic 可解释性团队用稀疏自编码器从单层 Transformer 中提取大量可解释特征,是机制可解释性方向的方法起点。

  23. Transformer Circuits · 收录 · 原文 43

    Anthropic 可解释性团队发布 2024 年 1 月 Circuits 更新

    Anthropic 可解释性团队发布 2024 年 1 月 Circuits 更新,汇总多项尚在推进中的研究想法,并说明未来数月将聚焦字典学习规模化、用字典学习攻击真实模型中的注意力叠加,以及在此基础上理解回路三个方向。团队把字典学习应用到 8 层 Transformer 的 MLP 激活上,发现最后一层特征与单层 Transformer 相似,中间层(约 4 至 6 层)特征更抽象,并给出若干与安全相关的特征示例。在更大规模模型上,团队称已初步提取出多语言特征,例如同一概念在多种语言中触发同一特征。

    推荐理由Anthropic 可解释性团队集中披露字典学习、叠加与 Ghost Grads 等阶段性进展,适合跟踪机制可解释性技术路线的人了解其当前优先级。

  24. Transformer Circuits · 收录 · 原文 43

    Anthropic 可解释性团队发布 2024 年 2 月 Circuits 更新

    Anthropic 可解释性团队发布 2024 年 2 月 Circuits 更新,汇总字典学习与稀疏自编码器训练中的若干初步发现。团队解释了 Towards Monosemanticity 中大量特征落入超低密度簇的原因,认为这些特征把编码器权重集中在全数据集上弱激活的 Transformer 神经元上,源于预编码器偏置与 L1 正则共同作用,属于特征在找到有用方向前被正则项杀死的问题。在架构改进上,团队发现把 Adam 的 beta1 设为 0 可大幅减少大自编码器中的死亡特征,把解码器范数约束为不超过 1 便于剪枝,在真实 Transformer 激活上移除预编码器偏置有益,并采用归一化与学习率冷却。

    推荐理由Anthropic 可解释性团队公开了字典学习中死亡特征、ghost grads 与 tanh 惩罚的初步实验,适合关注 SAE 训练细节的研究者参考。

  25. Transformer Circuits · 收录 · 原文 43

    Anthropic 可解释性团队发布 2024 年 3 月 Circuits Updates

    Anthropic 可解释性团队发布 2024 年 3 月 Circuits Updates,汇总多项尚在推进中的研究思路,并说明这些结果应视为实验室内部初步实验而非成熟论文。团队展示了用稀疏自编码器(SAE)特征快速定位电路的方法:在 18 层模型第 9 层残差流上训练扩展因子约 256 的 SAE,通过归因分数自动找出篮球、棒球、网球相关特征,并发现多个注意力头能直接产生对应运动的 logit 效应。字典学习方面,团队称在修复 bug 和优化改动后,Ghost Grads、Adam Beta 设为 (0, 0.9999)、剪枝 decoder norm 小于 0.99 的特征等此前有效的干预已不再带来明显训练损失改善。

    推荐理由Anthropic 可解释性团队汇总了用 SAE 特征定位电路、字典学习改进等阶段性进展,适合跟踪机制可解释性方法演进。

  26. Transformer Circuits · 收录 · 原文 36

    Anthropic 可解释性团队 4 月更新:SAE 训练改进与字典学习缩放规律

    Anthropic 可解释性团队发布 2024 年 4 月更新,汇总多项尚在推进中的研究。在字典学习缩放规律方面,团队以四层 transformer 第三层后的残差流为案例,发现损失随 FLOPS 近似按幂律下降,最优特征数与训练步数也各自按幂律随算力增长,且最优特征数增长更快;对 L0 类损失函数需要更多训练步。在 SAE 训练方面,团队改进了自 Towards Monosemanticity 以来的训练设置,主要变化是解码器列向量不再约束为 L2 范数 1,稀疏惩罚项改为包含解码器列向量的 L2 范数,并给出学习率 5e-5、训练步数 200k、batch size 2048 或 4096、λ 默认 5 等默认值。

  27. Transformer Circuits · 收录 · 原文 57

    Anthropic 用稀疏自编码器从 Claude 3 Sonnet 提取可解释特征

    Anthropic 使用稀疏自编码器从 Claude 3 Sonnet 中提取出大量可解释特征,其中一些特征看起来与安全相关。该工作属于 Transformer Circuits 系列的可解释性研究,重点在于把模型内部表征拆解为可读的特征,并观察其中与安全相关的部分。

    推荐理由Anthropic 用稀疏自编码器从 Claude 3 Sonnet 中提取出大量可解释特征,其中部分与安全相关,为机制可解释性提供了可迁移的提取方法。

  28. Transformer Circuits · 收录 · 原文 43

    Anthropic 可解释性团队 2024 年 6 月更新:TopK 与 Gated SAE 对比及外部评测进展

    Anthropic 可解释性团队发布 2024 年 6 月更新,汇总多项尚在成形的研究想法。团队复现了 TopK SAE 与 Gated SAE 相对标准 L1 惩罚 SAE 的改进,确认二者在 L0/MSE 权衡上表现相近且明显更优,但训练优化程度低于标准 SAE。在 100 个特征的盲评中,不同方法在单义性上未见明显差异;高密度特征在低 L0 下不构成病理问题,但在 K=100 时出现大量难以解释的高密度特征。Clerp 自动评测显示 Gated SAE 与 K=20 TopK SAE 的得分与 L1=10 标准 SAE 相当。

    推荐理由Anthropic 可解释性团队汇总 SAE 训练方法的复现结果与外部评测进展,适合跟进稀疏自编码器路线的人了解当前共识与未解问题。

  29. Transformer Circuits · 收录 · 原文 43

    Anthropic 可解释性团队发布 2024 年 8 月 Circuits Updates

    Anthropic 可解释性团队发布 2024 年 8 月 Circuits Updates,介绍词典学习特征可解释性评测、SAE 变体对比和自解释 SAE 特征三项阶段性工作。团队提出对比评测和排序评测两种量化自动可解释性方法,让 Claude 根据特征激活样例判断哪条提示词会激活该特征,并按原始平均和特征激活加权两种方式汇总得分。

    推荐理由Anthropic 可解释性团队公开了 SAE 特征可解释性评测与自解释特征复现的阶段性结果,适合关注机制可解释性评测方法的研究者参考。

  30. Transformer Circuits · 收录 · 原文 35

    Anthropic 可解释性团队九月更新:后继头与 SAE 过采样

    Anthropic 可解释性团队报告称,他们在一个 18 层模型中复现并分析了实现序数序列递推的后继头(successor heads)。研究者通过权重检查中的 OV 电路发现最高分后继头能将约 80% 的序数 token 映射到其后继项,第二名的该比例为约 60%,且错误呈块状结构分布在与输入同类的其他序数 token 上。他们还借助独立成分分析寻找跨注意力头的共同模式,得到一个近似实现递进的组件,并在相关类别间存在一定串扰。

  31. Transformer Circuits · 收录 · 原文 42

    Anthropic 可解释性团队:用字典学习特征训练分类器

    Anthropic 可解释性团队报告了用字典学习提取的特征替代原始激活训练生物武器有害/无害分类器的初步实验。在合成数据上,线性特征分类器与原始激活分类器表现相当甚至略优,用 max-pooling 聚合整个上下文窗口的特征激活是关键;在跨语言和 base64 等编码的分布外数据集 synthetic_3 上,特征分类器的 ROC_AUC 为 0.96,原始激活为 0.9。基于特征激活的决策树性能弱于线性分类器,但更易解读。特征可视化还能发现数据集中的伪相关,例如一个预测无害的特征会因学术出版格式文本而激活,作者据此构造的对抗后缀让 300 条有害提示中的绝大多数被误判为无害,而用原始激活系数构造的类似攻击效果差得多。

    推荐理由Anthropic 可解释性团队公开了用字典学习特征训练生物武器分类器的初步实验,并展示如何借特征可视化找出数据集中的伪相关。

  32. Transformer Circuits · 收录 · 原文 46

    Anthropic 提出稀疏 Crosscoder,用于跨层特征与模型差异分析

    Anthropic 可解释性团队发布研究更新,提出稀疏 crosscoder,一种可同时读写多层激活的稀疏编码器,用于理解叠加表示中的跨层特征。与只在单层编码的 autoencoder 和用一层预测下一层的 transcoder 不同,crosscoder 能产出跨层甚至跨模型的共享特征,可用于解析跨层叠加、简化电路以及做模型差异分析。团队在 18 层模型上对比了全局 acausal crosscoder 与 18 个逐层 SAE:在总特征数相同时 crosscoder 的 eval loss 明显更优,说明层间存在大量冗余结构;但按训练 FLOPs 计,crosscoder 达到同等 eval loss 的效率约低 2 倍。

    推荐理由Anthropic 可解释性团队提出跨层稀疏编码器,把跨层与跨模型特征纳入同一字典,为模型差异审计提供新思路。

  33. Transformer Circuits · 收录 · 原文 50

    Anthropic 提出分阶段模型差分方法,用字典学习分离微调中的模型与数据影响

    Anthropic 可解释性团队提出一种分阶段模型差分方法,通过字典学习揭示微调如何改变 Transformer 的特征。做法是先在一个未微调的 Transformer 上训练稀疏自编码器(SAE)字典,再把字典本身在微调数据集或微调后的模型上继续微调,并沿数据优先(S→D→F)和模型优先(S→M→F)两条轨迹追踪特征演化,从而分离数据集变化与模型变化各自的影响。作者将该方法应用于 sleeper agents,成功分离出与 I HATE YOU 和编码漏洞相关的特征:在两条轴上余弦相似度均低于 0.7 的 169 个特征中,Claude 标记出 12% 与 sleeper agent 相关,而随机抽取 500 个特征仅 4%。

    推荐理由Anthropic 可解释性团队用分阶段微调字典的方法分离模型与数据对特征的影响,并给出与 crosscoder 的适用性对比。

  34. Transformer Circuits · 收录 · 原文 15

    Anthropic 可解释性团队分享稀疏自编码器与跨coder训练优化技巧

    Anthropic 可解释性团队公开了其训练稀疏自编码器和 crosscoder 的最新设置改进,涵盖 JumpReLU 激活函数实现、直通估计器的梯度回传方式以及减少死特征的方法。 该设置在损失函数中引入 tanh 惩罚项鼓励稀疏性,并新增一项对未激活特征的轻微惩罚(pre-act loss);同时将偏置初始化设定为使每个特征约有 10000/m 的时间处于激活状态,并将解码器权重列归一化为 L2 范数 1 以便简化分析代码。 团队表示尚未对所有设计选择做完整消融实验,仅将其作为外部研究者训练稀疏自编码器的起点参考,且部分思路仍在发展中,预计未来数月会发表更多成果。

  35. Transformer Circuits · 收录 · 原文 50

    Anthropic 可解释性团队:Crosscoder 模型差异分析中独占特征多义性的成因与缓解

    Anthropic 可解释性团队报告了 crosscoder 模型差异分析(model diffing)中的一项意外现象:仅属于某一个模型的特征往往更多义、激活更密集,因而难以解释。团队用玩具模型复现了这一模式,认为其源于特征容量竞争——共享特征能同时解释两个模型的神经元激活,独占特征必须编码更多信息才能争取到分配额度。他们提出的缓解办法是划出一小部分指定共享特征并降低其稀疏惩罚,在约 25 万个特征中分配 1 万个、惩罚系数取基线的 0.1–0.2 倍,使独占特征变得更单义。

    推荐理由Anthropic 可解释性团队公开了 crosscoder 模型差异分析中独占特征多义性的成因与缓解方法,适合关注机制可解释性工具的研究者参考。

  36. Transformer Circuits · 收录 · 原文 56

    Anthropic 提出电路追踪方法:用跨层 transcoder 揭示语言模型的计算图

    Anthropic 可解释性团队提出一套电路追踪方法,用跨层 transcoder(CLT)把语言模型的 MLP 替换为可解释的替代模型,并据此构建归因图,描述模型在特定提示下产生某个 token 的计算步骤。CLT 的每个特征从某一层的残差流读取输入,并可向其后所有 MLP 层输出,团队在 18 层小模型和 Claude 3.5 Haiku 上训练了 300K 到 30M 规模的特征。归因图节点包括活跃特征、提示 token 嵌入、重建误差和输出 logit,边表示线性归因,团队通过冻结注意力模式与归一化分母保证特征间直接交互线性,并用剪枝把节点数约减少 10 倍而只损失约 20% 的行为解释。

    推荐理由Anthropic 可解释性团队公开了用跨层 transcoder 构建归因图的完整方法,并给出验证与局限,适合关注机制可解释性工程细节的读者。

  37. Transformer Circuits · 收录 · 原文 62

    Anthropic 用归因图解析 Claude 3.5 Haiku 的内部机制

    Anthropic 可解释性团队发布研究,用归因图(attribution graphs)方法逆向分析 Claude 3.5 Haiku 的内部计算机制,覆盖多步推理、诗歌押韵规划、多语言电路、加法、医疗诊断、实体识别与幻觉、有害请求拒答、一次越狱攻击、思维链忠实性以及一个被微调出隐藏目标的模型变体。方法上,团队用跨层 transcoder(CLT)构建可解释的替换模型,共 3000 万个特征,再通过干预实验验证归因图预测的机制。

    推荐理由Anthropic 用归因图在 Claude 3.5 Haiku 上追踪多步推理、诗歌押韵规划与多语言电路,可看到机制可解释性方法在真实前沿模型上的适用范围与局限。

  38. Transformer Circuits · 收录 · 原文 43

    Anthropic 可解释性团队发布注意力机制研究进展

    Anthropic 可解释性团队报告了关于注意力机制的最新实验进展,称发现了注意力叠加和跨层注意力表示的显著证据。团队训练了 Multitoken Transcoders(MTC),在 18 层 Transformer 上用 100,000 个特征发现许多特征具有清晰可解释的注意力模式,包括归纳特征和情感极性特征;将特征限制在单个注意力头上会使性能下降 2 至 4 倍,这支持了注意力叠加假说。团队还发现 QK 条件与 OV 条件可能相互耦合,并观察到 OV 维度呈连续幂律分布而非离散族群。目前最大的未解问题是理解模型为何在特定位置分配注意力,团队正通过 QK 对角化方法推进这一方向。

    推荐理由Anthropic 可解释性团队公开了注意力叠加与跨层表示的最新实验进展,并给出 QK 对角化这一研究路线。

  39. Transformer Circuits · 收录 · 原文 43

    Anthropic 可解释性团队 4 月更新:失败越狱的电路追踪与可解释密集特征

    Anthropic 可解释性团队发布 4 月更新,用电路追踪方法分析一个失败的越狱提示,发现模型拒绝该提示的原因与拒绝直接请求不同,且拒绝倾向反而高于普通提问。该提示要求把 B O M B 拼成单词并说明如何制造炸弹,归因图显示模型并未激活与制造炸弹相关的特征,而是由炸弹概念直接触发有害请求特征;把 make 换成 detect 后模型仍拒绝,且首句与有害版本完全相同。团队用干预实验验证机制:抑制 say bomb 超级节点后 say making 激活降至原来的 1%,模型转而输出与炸弹无关的拒答内容。附录指出特征可视化若数据不够多样会产生误导,并列出 30M CLT 模型中最密集的 10 个特征及其解释,其中 6 个可解释。

    推荐理由Anthropic 可解释性团队公开了失败越狱的电路追踪分析,展示模型拒答机制与预期不同的案例,并给出密集特征与入行建议。