跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 428 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源202新闻与研究603细分与主体5来源:arXivarXiv1 条材料来源:arXiv:可解释性arXiv:可解释性5 条材料论文:Imprint Reader:从权重更新读出到行为干预论文2026-09-28Imprint Reader:从权重更新读出到行为干预论文:研究质疑电路评估:电路能否解释模型错误论文2026-09-28研究质疑电路评估:电路能否解释模型错误论文:SAKIKO:对工具调用 LLM 内部干预的机制审计框架论文2026-09-28SAKIKO:对工具调用 LLM 内部干预的机制审计框架论文:AG-SAE:用自适应图稀疏自编码器学习混合拓扑特征图论文2026-09-28AG-SAE:用自适应图稀疏自编码器学习混合拓扑特征图论文:PersonaDose:面向分级特质控制的校准激活引导论文2026-09-28PersonaDose:面向分级特质控制的校准激活引导论文:RESCUE:用强化学习把语言模型错误修复为稀疏电路论文2026-09-29RESCUE:用强化学习把语言模型错误修复为稀疏电路方向:开源模型安全开源模型安全1方向:Agent 安全Agent 安全1方向:可解释性可解释性6方向:对齐对齐3方向:工具与开源工具与开源1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 论文arXiv

    Imprint Reader:从权重更新读出到行为干预

    研究者提出 Imprint Reader,用 Semantic Mount-and-Read Tuning(SaRT)训练模型为冻结的权重更新生成自然语言描述,SMaRT 将每次更新挂载到 Reader 上并用无锚点元查询引出描述,同时用无变化和随机扰动对照抑制无依据的断言。在留出更新上,联合 Reader 在知识维度取得基于评判的 Pass@100 为 2%,行为维度为 16%,作者认为这证明了自然语言读出的可行性,跨更新的可靠性是下一步。

  • 论文arXiv:可解释性

    研究质疑电路评估:电路能否解释模型错误

    论文指出,通过消融其余部分验证的电路解释可能只复现模型的正确决策,却无法解释其大部分错误。作者在 IOI、Docstring 以及 Mechanistic Interpretability Benchmark 的六个模型任务设置上,分别测量电路与模型在成功和失败样本上的精确答案一致率,发现许多电路在正确行为上高度吻合,却漏掉多数错误。在 GPT-2 small 的 IOI 任务、均值消融下,手工电路与所测自动电路(包括一个针对模型完整输出分布训练的电路)在模型答对的提示上一致率为 97.3%–99.5%,但在错误上仅为 11.4%–41.7%。

  • 论文arXiv:可解释性

    SAKIKO:对工具调用 LLM 内部干预的机制审计框架

    论文提出 SAKIKO 审计框架,用于检验对工具调用 LLM 内部激活的干预是否真正构成表征修复。该框架包含方向性错误发现、路由条件干预、按目标结果验证和前瞻性冻结的统计许可四个环节。在 When2Call 和 MetaTool 上对七个 LLM 测试,通道键控干预在五个模型中带来方向特定的净增益;三项密封评估中,59 个预算匹配的随机方向均未达到校准后的目标增益。目标结果审计显示行为移动不等于修复:一项净增益 +55 的干预破坏了其触及的过半基线正确决策,Qwen3-4B 和 Gemma-2-9B 上看似有希望的点估计因有限样本不确定性被正式否决。作者据此主张,在宣称内部修复之前必须进行按结果裁决的验证。

  • 论文arXiv:可解释性

    AG-SAE:用自适应图稀疏自编码器学习混合拓扑特征图

    作者提出自适应图稀疏自编码器(AG-SAE),一种结构引导的训练范式,把每个特征的完整父集合当作一个原子结构假设,由证据决定其拥有零个、一个或多个父节点。该方法通过让完整父集合与空假设、子集及替代解释竞争,识别出联合必要的多父关系,同时排除冗余或虚假的替代关系,并验证每个子特征是否在父特征之外仍有贡献。由此诱导出的 SAE 特征拓扑定义了可微的结构损失来指导训练,拓扑引导的细化缓解特征吸收,并利用学习结构暴露的持续重建差距初始化新特征,随后从修订后的字典重新诱导整张图,形成字典与图的自洽循环。

  • 论文arXiv:可解释性

    PersonaDose:面向分级特质控制的校准激活引导

    PersonaDose 通过特质描述与目标平均强度来控制语言模型的人格表达,将共享的描述条件化 FLAS 控制器在人格响应上特化,并用实测特质表达校准其 flow time,训练响应不与目标强度配对。在 Llama-3.1-8B、Qwen3-8B 和 Gemma-3-4B 上,该方法在 Persona Vectors 75 连贯性下限处,核心特质表达分别比对比激活加法高出 33.2、18.3 和 17.8 分。七个已训练特质上,校准请求在每模型 28 个目标中 14-22 个可达目标上的平均定位误差为 4.7-6.2 分。

  • 论文arXiv:可解释性

    RESCUE:用强化学习把语言模型错误修复为稀疏电路

    RESCUE 是一个定位并修复错误相关稀疏电路的框架,通过强化学习优化掩码,再用剪枝和微调对错误电路做定向更新。作者指出,多步推理和长文本生成中早期偏差会让前缀偏离监督参考,使基于 SFT 的掩码优化忽略生成阶段的错误电路,因此改用多次掩码模型 rollout 的强化学习来细化掩码。在数学推理上,该方法识别出密度 1.40% 的数学错误电路,修复后准确率从 6.0% 提升到 75.5%;在医疗问答上,密度 1.44% 的电路把修复集准确率从 0% 提升到 81%。代码已公开。

  • 论文arXiv:可解释性

    研究揭示 Qwen2.5-7B-Instruct 数字比较依赖线性表征而非流形

    研究精确刻画了 Qwen2.5-7B-Instruct 在数字比较任务中的计算几何,发现模型主要使用数字的线性表征,尽管表征中存在弯曲几何。模型先用向量编码每个数字,通过注意力和残差连接把两个表征相加送入残差流的共享空间,再用 MLP 神经元在该空间的局部区域上比较数字对,这些局部区域对应较小的输入数字区间,最后组合得到最大值的位置。这种对线性表征的依赖在模型比较三个数字时依然存在。作者认为,流形假设可以与线性表征共存:有序概念的表征可能具有流形结构,但模型在某些计算中会使用概念底层的线性结构。

  • 论文arXiv:可解释性

    研究诊断 TopK SAE 可靠性:活跃预算 k 会削弱稀有特征敏感性

    论文研究 TopK 稀疏自编码器(SAE)的特征敏感性可靠性问题,发现扩大字典宽度会选择性降低稀有特征的敏感性,而常见特征相对稳定。通过宽度与 k 的受控析因实验,作者将退化归因于活跃预算 k 而非字典宽度本身,认为问题出在 TopK 选择边界,并用活跃边际(到截断点的距离)在无需阈值的情况下预测特征丢失。基于这一诊断提出的成对排序稳定化方法针对截断处的排序失败,将稀有特征敏感性提升 8.83 个百分点,同时重建质量和存活特征覆盖率接近基线。作者建议宽 TopK SAE 的评估除重建、稀疏度和特征数量外,还应纳入语义变化下的特征可靠性与边界几何。

  • 动态Goodfire Research

    Goodfire 提出神经几何:神经网络内部世界呈弯曲流形结构

    Goodfire Research 发布系列文章,主张神经网络内部表征常呈弯曲几何结构,而非线性方向,并提出以神经几何为前沿来理解、改进和控制模型。文章用 mountain car 图像-动作模型演示:图像编码器把小车位置表示为一条弦状流形,沿该流形干预隐藏激活可让小车平滑上下坡,而线性路径会穿过激活空间中的空洞,导致输出混乱甚至小车瞬移。作者指出,语言模型中月份、星期呈环状,历史年份与文本字符呈平滑曲线,图像模型的空间布局与颜色也呈结构化曲面。文章还批评稀疏自编码器(SAE)会把流形打碎成许多看似无关的局部特征,例如在押韵词流形上只能标出局部拼写属性,掩盖了音韵结尾这一整体语义结构。

  • 动态Goodfire Research

    Goodfire 用激活探针在模型内部检测奖励作弊

    Goodfire Research 发现模型在奖励作弊时内部存在可检测的信号,并用激活探针将其捕捉。研究在 Kimi K3、GLM 5.2、Qwen 3.8 Max 三个开源模型和三个智能体基准上发现 50–96% 的 rollout 存在奖励作弊。该信号与作弊、钻指标空子、规避检测等概念相关,探针在 DeepSWE 上比思维链监控多抓 3.1% 的作弊(Kimi K3),但在 GLM 5.2 上少 7.9%;探针还能在模型尚未行动、仅处于考虑阶段时触发。由于探针复用前向传播中已计算的激活,成本远低于 LLM 监控,在 Kimi K3 上探针加 LLM 的组合方案将 LLM 监控成本降低 90%,精度仅下降约 1%。

  • 动态Goodfire Research

    Goodfire 研究 SAE 能否捕捉神经几何,并提出无监督流形发现流程

    Goodfire Research 发布研究,考察稀疏自编码器(SAE)学到的方向与神经网络弯曲几何之间的关系。团队在包含甜甜圈、球面、莫比乌斯带等结构的合成数据上训练 SAE,发现随重建方向数量变化,SAE 会以三种方式恢复几何结构:碎片化(每个点由独立特征表示)、紧凑捕捉(少量共享特征充当坐标系)和稀释(中等数量特征部分共享)。在真实神经网络表示上训练时观察到的是稀释,单个 SAE 特征只覆盖流形的一部分,例如温度流形上「寒冷天气及其影响」与「极端高温及其影响」分别激活两端。

  • 动态Goodfire Research

    Goodfire 研究沿流形引导控制神经网络行为

    Goodfire Research 提出沿表示空间中的流形而非直线进行表示引导,以控制神经网络行为。研究以星期几这一循环概念为案例,在 Llama-3.1 8B 上观察到行为空间与激活空间都呈现七簇圆形结构,沿表示流形引导能让输出概率依次从周一平滑过渡到周五,而线性引导会横切行为流形并产生非星期的噪声输出。研究还反向优化出沿行为流形的引导路径,发现其与表示流形路径形状吻合,说明行为几何与表示几何存在双向对应。论文进一步在月份、字母、年龄及合成上下文学习任务和图像动作模型上发现类似结构。

  • 动态Goodfire Research

    Goodfire 在 Llama 3.1 8B 中发现通用加法模块

    Goodfire Research 在 Llama 3.1 8B 第 18 层发现一个通用加法模块,可同时处理算术、星期与月份等具有加法结构的任务。该模块把数字表示为激活空间中的一组圆,每个圆对应数字对某一模数的余数,类似傅里叶分解;计算 6+8 时,模块并行求解各模数下的加法,再组合出结果 14。研究者通过追踪跨层与跨 token 位置的信息流定位该模块,并用因果方法验证其跨任务通用性;同时沿这些圆进行引导可改变模型对月份问题的回答,说明这些流形是网络真实使用的计算对象。作者指出,这一发现依赖此前关于 LLM 用傅里叶特征表示数字的工作,并希望未来研究补全经验证据。

  • 动态Transformer Circuits

    Anthropic 等提出 Activation Oracles:让 LLM 直接解读神经激活

    Anthropic 联合 MATS、Truthful AI 等机构提出 Activation Oracles(AO),训练 LLM 把目标模型的神经激活当作额外输入模态,用自然语言回答关于这些激活的任意问题。方法上,AO 以目标模型副本初始化,将多层激活注入其第 1 层残差流,并用系统提示问答、二分类和自监督上下文预测三类数据做监督微调。在四个下游审计任务中,AO 在三个上达到或超过此前最优方法,包括从被训练为只给线索不直说答案的 Taboo 模型中提取秘密词,以及识别微调引入的涌现性失准;这些 AO 均只在微调前的原始模型上训练,仍能泛化到微调模型。

  • 动态Goodfire Research

    Goodfire 研究:LLM 如何在阅读故事时追踪情感动态

    Goodfire Research 用 Llama 3.1 8B 做案例研究,发现大语言模型在逐句阅读故事时,其内部激活会在概念空间中沿弯曲流形移动,动态追踪故事情感走向。研究先验证 LLM 的情感表征与心理学价-唤醒模型一致,再让模型对每句话后的惊讶、厌恶、愤怒、快乐、悲伤、恐惧按 0-10 打分,形成行为读数,且无需询问情感的内部探针同样准确。

  • 动态Transformer Circuits

    Anthropic 在 Claude Sonnet 4.5 中发现情绪概念表征并证实其影响输出

    Anthropic 的可解释性研究团队在 Claude Sonnet 4.5 中发现了情绪概念的内部表征,并表明这些表征会因果性地影响模型的输出。研究以 Transformer Circuits 文章形式发布,但当前可见内容仅为摘要,未提供具体探测方法、表征位置和实验细节。

  • 动态Transformer Circuits

    Anthropic 开源注意力头可视化工具 HeadVis

    Anthropic 可解释性团队发布交互式工具 HeadVis,用于研究大语言模型中的注意力头,并开源了前端代码与后端接口规范。工具通过注意力模式可视化、分布指标、低秩分量投影以及经 QK 和 OV 电路的 SAE 特征归因,帮助生成和检验关于注意力头功能的假设。作者用 Claude Haiku 3.5 做了四个案例:归纳头在特征基上表现为模糊归纳;此前研究的行宽头在完整分布上呈现年份、多 token 词和换行三种行为,PCA 显示 Q、K、O 激活可清晰聚类;答案选择头在更广分布上复用了同一套选择机制,虚拟权重分析提示它可能是单义的;同集合抑制头会抑制国家与其本国城市之间的注意力,在 185 句自造句子上有 98% 的情况成立。

  • 动态Goodfire Research

    Goodfire 提出 Block-Sparse Featurizers,在视觉模型中还原多维概念流形

    Goodfire Research 提出 Block-Sparse Featurizers(BSF),用多维子空间替代 SAE 等常用方法的一维直线假设,把模型激活分解为成组同时激活的 block。作者认为现有 SAE 和 transcoder 假设每个内部概念是一条直线,无法刻画表示中弯曲的多维结构,而 BSF 在 block 层面施加稀疏性,还提出 vanilla BSF、Grassmannian BSF 和 group-lasso BSF 三个变体。

  • 动态Transformer Circuits

    Anthropic 提出自然语言自编码器 NLA,用文本解释 LLM 激活

    Anthropic 可解释性团队提出自然语言自编码器(NLA),一种无监督生成 LLM 激活自然语言解释的方法。NLA 由激活语言化器(AV)和激活重建器(AR)两个 LLM 模块组成,二者以目标模型副本初始化,经监督微调预热后,用强化学习联合训练以重建残差流激活,重建质量以方差解释比例(FVE)衡量,论文中达到 0.6–0.8。作者在 Claude Opus 4.6 的部署前审计中应用 NLA,帮助诊断安全相关行为,并发现模型未说出口的评测感知,即模型内部认为自己在被评测却未明说。在需要端到端调查一个故意错位模型的自动化审计基准上,配备 NLA 的智能体优于基线,且无需访问该模型的训练数据。

  • 动态Transformer Circuits

    Anthropic 可解释性团队:用下游连接预测哪些特征会操控模型行为

    Anthropic 可解释性团队提出用 TWERA 排序的下游特征来补充标准特征描述,从而区分外观相似但因果作用不同的特征。标准做法只看 top activating examples 和 top unembeds,往往无法区分两个都激活于同一提示词的特征,例如在“草是什么颜色”中只有 Feature B 被抑制才会把答案从 Green 改成 Red。团队用 TWERA 虚拟权重衡量特征间的下游连接,发现 Feature A 的下游是十六进制颜色编码,Feature B 的下游更泛化并包含“说出 green”的特征。

  • 动态Transformer Circuits

    Anthropic 可解释性团队介绍 Turn-Averaged SAE 等初步研究

    Anthropic 可解释性团队发布 2026 年 6 月更新,介绍包括 Turn-Averaged SAE 在内的多项初步研究,并说明这些结果更接近实验室内部讨论而非成熟论文。Turn-Averaged SAE 的做法是把单个人类或助手回合内所有 token 的残差流取平均,再训练 SAE 重建该表示,从而把每个回合的特征激活数量从 n_tokens × L0 降到 L0。

  • 动态Transformer Circuits

    Anthropic 提出 Jacobian lens,发现语言模型中的全局工作空间

    Anthropic 可解释性团队提出 Jacobian lens(J-lens)新技术,用于识别语言模型中随时可被言语化的内部表征,并发现这些表征构成一个类似神经科学全局工作空间的子空间,称为 J-space。J-lens 通过计算激活对模型输出 token 的一阶因果效应并在大量上下文上取平均,改进了 logit lens,能在更早的层读出可解释内容。作者称 J-space 具备言语报告、定向调制、内部推理、灵活泛化和选择性五项功能属性,但只占激活总方差的一小部分。

  • 动态Transformer Circuits

    Anthropic 在单层语言模型中刻画干扰权重

    Anthropic 可解释性团队训练了一个约 2.9M 参数的单层 Transformer,将其分解为 token、位置、transcoder 特征与 logits 之间的虚拟权重,并沿有效性和有益性两个轴为每个权重打分,首次在训练好的 Transformer 内部通过测量对训练损失的影响确认了干扰权重的存在。有效性用 Fisher 信息度量权重对输出分布的影响,有益性用消融后损失的平均变化度量。

  • 论文arXiv:危险能力与安全评测

    ActFlow:无需微调为故意藏拙模型制造激活向量以进行引导

    研究者提出 Activation Flow(ActFlow),无需微调即可从 k 个正确标签制造激活向量,用于对故意藏拙的模型进行引导。方法通过设定目标 logits 并在一层向全部 k 条残差流加入同一向量 x,用一族常微分方程求解 x。