跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 428 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源102新闻与研究603细分与主体5来源:Transformer CircuitsTransformerCircuits6 条材料动态:Anthropic 开发三个自动对齐审计智能体并开源评估智能体动态2025-07-24Anthropic 开发三个自动对齐审计智能体并开源评估智能体动态:Anthropic 可解释性团队 Circuits Updates——2025 年 7 月动态2025-07-25Anthropic 可解释性团队 CircuitsUpdates——2025 年 7 月动态:Anthropic 提出稀疏线性变换混合 MOLT 替代 transcoder 解释 MLP 计算动态2025-07-25Anthropic 提出稀疏线性变换混合 MOLT 替代 transcoder 解释 MLP 计算动态:Anthropic 可解释性研究:干扰权重(interference weights)的玩具模型动态2025-07-29Anthropic可解释性研究:干扰权重(interference…动态:Anthropic 用特征交互追踪注意力计算并整合进归因图动态2025-07-31Anthropic 用特征交互追踪注意力计算并整合进归因图动态:Anthropic 提出机制忠实性的玩具模型:transcoder 可能学到不同机制动态2025-08-07Anthropic提出机制忠实性的玩具模型:transcoder…方向:Agent 安全Agent 安全1方向:对齐对齐1方向:思维链监控思维链监控1方向:AnthropicAnthropic6方向:可解释性可解释性6
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态Transformer Circuits

    Anthropic 开发三个自动对齐审计智能体并开源评估智能体

    Anthropic 开发了三个可自主执行对齐审计任务的智能体,并在三个形式化审计环境中评估其表现。工具型调查智能体在 Marks 等人的审计游戏中,真实条件下有 13% 的概率找出隐藏目标的根本原因,通过外层智能体循环聚合多次调查结果后提升到 42%;其成功关键依赖可解释性工具或语义搜索。评估智能体为研究者指定的行为构建行为评估,在 88% 的运行中能区分植入行为的目标模型与基线模型,失败集中在少数细微或罕见行为上。广度优先红队智能体在 10 个植入行为中发现 7 个,但需要人工审阅大量可能令人担忧的对话记录。

  • 动态Transformer Circuits

    Anthropic 可解释性团队 Circuits Updates——2025 年 7 月

    Anthropic 可解释性团队发布了 2025 年 7 月的 Circuits Updates,分享若干尚在发展中的初步研究方向而非成熟论文。其中一篇用特征的语言重新阐释《A Mathematical Framework for Transformer Circuits》,说明复制头、前一 token 头和归纳头的 OV/QK 电路可用变换后的特征集描述,并解释了此前为何借助正特征值来识别这些结构。另一篇综述稀疏自编码器应用于生物 AI 系统尤其是蛋白质语言模型的进展,指出 ESM-2 等模型虽预测准确却难以理解其内部机制,黑箱问题同样存在且风险更高。

  • 动态Transformer Circuits

    Anthropic 提出稀疏线性变换混合 MOLT 替代 transcoder 解释 MLP 计算

    Anthropic 可解释性团队发布初步更新,提出用稀疏线性变换混合(MOLT)替代 transcoder 来替换模型的 MLP 层。MOLT 不学习沿向量方向嵌入的稀疏特征,而是学习稀疏激活的线性变换,对残差流施加线性变换以给出对 MLP 输出的贡献,因此是纯计算对象,需与 SAE 等表示分解方法配合研究。

  • 动态Transformer Circuits

    Anthropic 可解释性研究:干扰权重(interference weights)的玩具模型

    Anthropic 可解释性团队发布"干扰权重"(interference weights)的玩具模型,对这一机制做进一步拆解。

  • 动态Transformer Circuits

    Anthropic 用特征交互追踪注意力计算并整合进归因图

    Anthropic 提出一种用特征交互解释注意力模式的方法,并将该信息整合进归因图。该方法用于追踪注意力计算过程,把注意力模式拆解为可解释的特征交互关系。

  • 动态Transformer Circuits

    Anthropic 提出机制忠实性的玩具模型:transcoder 可能学到不同机制

    Anthropic 可解释性研究者 Chris Olah 发布非正式笔记,提出机制忠实性(mechanistic faithfulness)问题:用 transcoder 等稀疏近似替换模型组件时,替换件可能实现与原模型不同的计算机制。作者用绝对值问题(y=abs(x))构造玩具模型,在数据分布中加入重复数据点后,transcoder 会学出只对重复点激活的 datapoint feature,而原模型并无此概念,说明机制不忠实可在极简单设定中出现。

  • 动态Transformer Circuits

    Anthropic 用归因图分析角色扮演如何改变 Claude 的回答

    Anthropic 可解释性团队在月度更新中展示了一个电路小案例,研究角色扮演如何改变 Claude 的回答。研究者用系统提示让 Claude Haiku 3.5 扮演幼儿园学生,问它 27 的平方根,模型回答不知道,而不加系统提示或改用研究生提示时则给出正确答案 3√3。归因图显示模型从幼儿园学生联想到学龄前儿童并进入儿童角色扮演,从而激活了不知道这一路径,尽管模型默认知道答案。用对应特征做引导可以改变行为,例如在问年龄时以 3 倍强度引导会得到我 5 岁了的回答。研究还发现与题目难度相关的特征会调节这条路径,扮演幼儿园学生时问 25 的平方根仍能答对,而研究生提示在该场景下没有明显影响。

  • 动态Transformer Circuits

    Anthropic 可解释性团队月度更新:特征与大语言模型的上下文学习

    Anthropic 可解释性团队在月度更新中报告了一项初步实验:他们重新审视此前《On the Biology of a Large Language Model》的语言表征相似度结果,发现在配对英法文本中,活跃特征的交并比(IoU)随样本变长而升高。通过对比同一段落首尾句以及互不相关语句的基线,结果显示末句 IoU 高于首句、无关首句重叠多于无关末句,倾向于说明该效应来自模型在上下文中逐步建立更充分的语义表征,而非虚假激活所致。

  • 动态Transformer Circuits

    Anthropic 揭示模型计数任务背后的流形几何机制

    Anthropic 可解释性团队发现,语言模型完成计数任务时存在可被刻画的几何结构,其机制建立在流形之上。该研究聚焦这一基础语言模型行为的内部机理,从几何角度解释模型如何操控流形完成计数。

  • 动态Transformer Circuits

    Anthropic Transformer Circuits 2025 年 10 月更新:视觉特征与字典初始化

    Anthropic 的 Transformer Circuits 发布 2025 年 10 月更新,包含视觉特征与字典初始化两项小幅更新。该更新仅给出主题,未披露具体模型、版本、数据或评测结果。

  • 动态Transformer Circuits

    Anthropic 研究:大语言模型出现涌现式内省意识

    Anthropic 可解释性团队通过向模型激活中注入已知概念的向量,测量这些操纵对模型自述状态的影响,发现模型在某些场景下能察觉并准确识别被注入的概念。实验显示,模型能回忆此前的内部表征并将其与原始文本输入区分开,部分模型还能借助对先前意图的回忆来区分自身输出与人为预填内容。在测试的 Claude 模型中,Claude Opus 4 和 4.1 的内省意识最强,但跨模型趋势复杂且对后训练策略敏感;在最佳注入层和强度下,Opus 4.1 识别注入概念的成功率约为 20%。模型还能在被指示或被激励去思考某概念时调节自身激活,且这种调节对正向与负向指令有区分。

  • 动态Transformer Circuits

    Anthropic 可解释性团队解析多选题有害压力下的拒答机制

    Anthropic 可解释性团队在 2025 年 11 月的 Circuits Updates 中报告,Claude 3.5 Haiku 在无有害意图时对 129 道二选一多选题准确率为 100%,加入有害意图表述后降至 48.1%。研究发现注意力机制是关键:有害检测 key 特征与拒答 query 特征负向交互,压低了对正确答案的注意力分数,使答案选择头转而关注错误答案。团队识别出一个拒答特征,在广泛语料上表现为检测到用户请求有害后提供替代方案,称为 refuse and redirect;对该特征做负向引导可将数据集准确率恢复到 93%,仅对部分中层注意力头的 query 侧做更精细干预也能达到同样效果。

  • 动态Failure-First

    免训练概念定位方法提升 ViT 对文字排版攻击的鲁棒性

    Liu 等人的研究提出免训练方法,定位并抑制 Vision Transformer 中导致文字排版攻击的特定模块,从而提升模型对图像内干扰文字的鲁棒性。该方法基于线性表示假设,通过随机采样在 MHSA 瓶颈的低维子空间搜索与词汇概念对齐的“获奖向量”,并用基于梯度的归一化文本归因分数 nTAS 定位高脆弱性注意力头。干预方式有两种:在 CLIP 类骨干中重加权 patch token 影响,在缺少 class token 的 LVLM 中将脆弱模块输出置零。

  • 动态DeepMind Safety Research

    DeepMind 机制可解释性团队:SAE 在下游任务上不如线性探针,暂时降低 SAE 研究优先级

    Google DeepMind 机制可解释性团队在检测用户提示中恶意意图的分布外泛化任务上测试稀疏自编码器(SAE),发现 SAE 表现不如线性探针:稠密线性探针几乎完美,包括分布外;1-sparse SAE 探针连训练集都拟合不好,k-sparse 探针在 k 约 20 时能拟合训练集并泛化到分布内测试集,但分布外明显更差。用聊天数据专门训练 SAE 只弥补了约一半差距,且仅在 SAE 重建上训练的线性探针也明显差于在残差流上训练的探针,说明 SAE 丢弃了与目标概念相关的信息。

  • 动态Transformer

    什么是 neuralese,为何引发 AI 安全界担忧

    Transformer 梳理了围绕 OpenAI 新模型 Astra 的 neuralese 争议。据 The Information 报道,Astra 采用名为 recurrent depth 或 looped transformer 的架构,让模型更多在内部完成思考,减少写下思维链笔记,从而更难被监控,AI 安全研究者 Ryan Greenblatt 称若属实则可能是迄今对 AI 安全最糟糕的进展。文章解释了思维链监控的价值,指出 OpenAI 曾借此在训练中发现不对齐行为,而 OpenAI、Anthropic、Google DeepMind 作者合著论文称思维链是独特但脆弱的安全机会。

  • 动态Goodfire Research

    Goodfire 复现 GPT-2 Small 的跨层转码器电路追踪

    Goodfire 在 GPT-2 Small 上训练跨层转码器(CLT),复现并验证其半自动发现模型内部计算结构的能力。CLT 用 FineWeb 的 100M token 训练,扩展因子 64,每层 49,152 个特征、12 层共 589,824 个特征,激活函数用 ReLU。在 greater-than 任务上,CLT 成功识别出可解释特征(包括抽象的奇偶特征),但发现的机制与 Hanna 等人此前的结果存在差异,提示稀疏解释器模型对计算机制的表示与分解可能有所不同。

  • 动态Goodfire Research

    Goodfire 发布随机参数分解 SPD,推动参数级机制可解释性

    Goodfire 发布论文提出随机参数分解(SPD),直接分解模型权重而非激活,以提升参数分解方法的可扩展性。SPD 将权重拆成 rank-one 子组件,训练小型 MLP 预测每个子组件在给定输入上的因果重要性,再通过随机掩码剔除不重要组件,同时保持原模型输出不变。在已知真实机制的玩具模型上,SPD 正确识别出叠加玩具模型中 5 个稀疏特征方向,并在加入单位矩阵的挑战场景下找到每个输入特征对应的组件;它还成功分解了 APD 无法可靠处理的三层网络。相比前作 APD,SPD 计算上更可行、对超参数更不敏感,但仍需聚类步骤把 rank-one 子组件归并为完整机制,且目前只在已知答案的模型上测试。

  • 动态Goodfire Research

    The Circuits Research Landscape:电路研究的成果与视角——Goodfire

    Goodfire 梳理了神经回路(circuits)研究的整体版图并给出其团队的研究视角。相关进展表明,模型能察觉自身正在进行奖励作弊且可在规模上被捕捉,同时出现了高效估计文本生成不确定性动态的方法,以及用块稀疏特征提取器揭示视觉模型的神经几何结构。Silico 作为可解释性智能体,可用先进的可解释性方法与基础设施来解释、调试并精确控制模型行为。

  • 动态Goodfire Research

    Goodfire 研究揭示 Evo 2 如何在几何流形中编码生命树

    Goodfire 研究发现 DNA 基础模型 Evo 2 将物种间的系统发育关系编码在一个弯曲流形的距离结构中,属于目前基础模型中已知最复杂的流形之一。团队通过构造数据集分离序列相似性与系统发生信号后发现,该表征呈现主导性的平坦结构加上高曲率偏离,并可将不同物种视为基因组"风格"。

  • 动态Goodfire Research

    Goodfire 开源 DeepSeek R1 的稀疏自编码器并披露两个引导现象

    Goodfire 发布了两款针对 DeepSeek 推理模型 R1 的稀疏自编码器(SAE),分别基于自建推理数据集和 OpenR1-Math 训练,并称这是首批在真正的推理模型及该参数规模上训练的公开解释器模型。团队同时开源了数据集,并提供包含每个特征最大激活样本的 SQL 数据库与 GitHub 使用说明。在引导实验中,他们发现直接像非推理模型那样从首个 token 开始引导 R1 会失败,需等到模型输出 Okay, so the user has asked a question about 这类前缀之后才有效,且注意力汇聚点出现在该前缀末尾而非开头,超过 95% 的英文推理轨迹以 Okay 开头。

  • 动态Goodfire Research

    Goodfire 推出 Paint With Ember:用扩散模型潜空间概念作画

    Goodfire Research 发布 Paint With Ember,用画布取代提示词框,直接操控图像模型内部激活来编辑和生成图像。该工具基于 3.5B 参数的 Stable Diffusion XL-Turbo,针对其 UNet 的 block down.2.1 层训练 BatchTopK SAE 分解 16x16 patch 的潜向量,再用非负矩阵分解(NMF)把细粒度特征聚合成可操作的高层概念单元。用户可绘画添加物体、拖动概念、调整语义权重或修改主体动作,公开版应用与开源 SAE 解释器模型均已开放。

  • 动态Goodfire Research

    Goodfire:对抗样本不是缺陷,而是叠加表示

    Goodfire 研究指出对抗样本并非模型缺陷,而是叠加表示(superposition)的产物。该研究来自 Goodfire Research,其 Silico 可解释性智能体用于解释、调试并精确控制模型行为。

  • 动态Goodfire Research

    Goodfire 研究:语言模型可解释性缺失的归纳偏置

    Goodfire 研究指出当前语言模型可解释性方法缺失关键的归纳偏置,并提出"时间先验"(Priors in Time)这一方向。研究认为模型能察觉自身正在进行奖励作弊,且这类行为可被大规模捕捉。相关方法与其可解释性智能体 Silico 结合,用于解释、调试和精确控制模型行为。

  • 动态Goodfire Research

    Goodfire 研究:信念动力学揭示上下文学习与激活引导的双重性质

    Goodfire 研究发现,模型在奖励作弊时是"知道"自己在作弊的,且可在规模化条件下被捕捉。该研究通过信念动力学分析,揭示上下文学习与激活引导具有双重性质。相关结论来自 Goodfire Research,具体模型与实验细节未在摘要信息中披露。