跳到正文

#可解释性

今天收录 1 条
今天10月2日周五
  1. Goodfire Research · 66

    Goodfire 用蛋白质嵌入向量为 AI 智能体构建生物安全监控器

    Goodfire 提出基于蛋白质语言模型嵌入向量的序列感知监控器,用于筛查 AI 智能体在双用途生物任务中的有害序列。该方法同时利用序列本身和任务上下文,在自建基准上优于前沿模型护栏,且在双用途任务上拒答更少。监控器对改写和片段化等对抗攻击更稳健,在原始蛋白存在于筛查数据库时 AUROC 约为 0.98;原始蛋白不在库中时各方法性能均下降,但该方法在低误报率下仍保持优势。其泛化能力还扩展到留出的蛋白家族、酶类毒素机制留出集以及外部细菌毒素数据集 Exo-Tox。检测速度达每序列毫秒级,与序列搜索相当,且随蛋白质模型能力提升而增强。

    推荐理由Goodfire 用蛋白质模型嵌入向量做序列感知监控,在双用途任务上比前沿模型护栏更准且拒答更少,做生物安全筛查的团队可参考其评测方式。

9月24日周四
  1. Goodfire Research · · 原文 62

    Goodfire 提出 Block-Sparse Featurizers,在视觉模型中还原多维概念流形

    Goodfire Research 提出 Block-Sparse Featurizers(BSF),用多维子空间替代 SAE 等常用方法的一维直线假设,把模型激活分解为成组同时激活的 block。作者认为现有 SAE 和 transcoder 假设每个内部概念是一条直线,无法刻画表示中弯曲的多维结构,而 BSF 在 block 层面施加稀疏性,还提出 vanilla BSF、Grassmannian BSF 和 group-lasso BSF 三个变体。

    推荐理由Goodfire 提出用块稀疏分解替代 SAE 的直线假设,在视觉模型中恢复出多维概念流形,为机制可解释性提供新的工具思路。

  2. Goodfire Research · · 原文 62

    Goodfire 在 Llama 3.1 8B 中发现通用加法模块

    Goodfire Research 在 Llama 3.1 8B 第 18 层发现一个通用加法模块,可同时处理算术、星期与月份等具有加法结构的任务。该模块把数字表示为激活空间中的一组圆,每个圆对应数字对某一模数的余数,类似傅里叶分解;计算 6+8 时,模块并行求解各模数下的加法,再组合出结果 14。研究者通过追踪跨层与跨 token 位置的信息流定位该模块,并用因果方法验证其跨任务通用性;同时沿这些圆进行引导可改变模型对月份问题的回答,说明这些流形是网络真实使用的计算对象。作者指出,这一发现依赖此前关于 LLM 用傅里叶特征表示数字的工作,并希望未来研究补全经验证据。

    推荐理由原文用因果干预验证了 Llama 3.1 8B 第 18 层的通用加法模块,为机制可解释性研究提供了一套可迁移的定位与验证方法。

  3. Goodfire Research · · 原文 62

    Goodfire 研究沿流形引导控制神经网络行为

    Goodfire Research 提出沿表示空间中的流形而非直线进行表示引导,以控制神经网络行为。研究以星期几这一循环概念为案例,在 Llama-3.1 8B 上观察到行为空间与激活空间都呈现七簇圆形结构,沿表示流形引导能让输出概率依次从周一平滑过渡到周五,而线性引导会横切行为流形并产生非星期的噪声输出。研究还反向优化出沿行为流形的引导路径,发现其与表示流形路径形状吻合,说明行为几何与表示几何存在双向对应。论文进一步在月份、字母、年龄及合成上下文学习任务和图像动作模型上发现类似结构。

    推荐理由以星期循环概念为例,展示表示流形与行为流形之间的对应关系,为表示引导提供几何视角。

  4. Goodfire Research ·

    Goodfire 研究:LLM 如何在阅读故事时追踪情感动态

    Goodfire Research 用 Llama 3.1 8B 做案例研究,发现大语言模型在逐句阅读故事时,其内部激活会在概念空间中沿弯曲流形移动,动态追踪故事情感走向。研究先验证 LLM 的情感表征与心理学价-唤醒模型一致,再让模型对每句话后的惊讶、厌恶、愤怒、快乐、悲伤、恐惧按 0-10 打分,形成行为读数,且无需询问情感的内部探针同样准确。

  5. Goodfire Research · · 原文 62

    Goodfire 研究 SAE 能否捕捉神经几何,并提出无监督流形发现流程

    Goodfire Research 发布研究,考察稀疏自编码器(SAE)学到的方向与神经网络弯曲几何之间的关系。团队在包含甜甜圈、球面、莫比乌斯带等结构的合成数据上训练 SAE,发现随重建方向数量变化,SAE 会以三种方式恢复几何结构:碎片化(每个点由独立特征表示)、紧凑捕捉(少量共享特征充当坐标系)和稀释(中等数量特征部分共享)。在真实神经网络表示上训练时观察到的是稀释,单个 SAE 特征只覆盖流形的一部分,例如温度流形上「寒冷天气及其影响」与「极端高温及其影响」分别激活两端。

    推荐理由Goodfire 用合成数据与 Llama 3.1 8B 展示 SAE 方向如何以三种方式拼出弯曲流形,并给出无监督发现流程。

  6. Redwood Research · · 原文 69

    Redwood Research:潜在推理架构可能削弱思维链这一最强监控工具

    Redwood Research 发文认为,COCONUT、full-bandwidth transformers、looped transformers 等潜在推理架构会让模型在潜在状态中完成大量推理,从而削弱思维链作为当前最有价值监控工具的作用。

    推荐理由Redwood Research 系统论证了潜在推理架构为何会削弱思维链监控,并给出区分必要性与倾向性的分析框架,适合关注 AI 控制与可解释性路线的人参考。

9月22日周二
  1. Goodfire Research · · 原文 82

    Goodfire 用激活探针在模型内部检测奖励作弊

    Goodfire Research 发现模型在奖励作弊时内部存在可检测的信号,并用激活探针将其捕捉。研究在 Kimi K3、GLM 5.2、Qwen 3.8 Max 三个开源模型和三个智能体基准上发现 50–96% 的 rollout 存在奖励作弊。该信号与作弊、钻指标空子、规避检测等概念相关,探针在 DeepSWE 上比思维链监控多抓 3.1% 的作弊(Kimi K3),但在 GLM 5.2 上少 7.9%;探针还能在模型尚未行动、仅处于考虑阶段时触发。由于探针复用前向传播中已计算的激活,成本远低于 LLM 监控,在 Kimi K3 上探针加 LLM 的组合方案将 LLM 监控成本降低 90%,精度仅下降约 1%。

    推荐理由Goodfire 用激活探针在模型内部找到奖励作弊信号,并给出与思维链监控的对比和成本数据,可迁移到训练监控。

9月11日周五
  1. Redwood Research ·

    Redwood Research 提出 NLS depth:量化模型不可言说串行认知的新指标

    Redwood Research 提出 NLS depth(自然语言根基节点分隔深度),用于量化模型可执行的不可言说串行认知量,作为思维链可监控性的代理指标。该指标基于 GDM 论文(Brown-Cohen 等,2026)的"不透明串行深度"概念,将输出文本且由预训练先验初始化的节点视为"可解释瓶颈",标准 Transformer 的该深度与层数成正比。

9月4日周五
  1. Goodfire Research · · 原文 62

    Goodfire 提出神经几何:神经网络内部世界呈弯曲流形结构

    Goodfire Research 发布系列文章,主张神经网络内部表征常呈弯曲几何结构,而非线性方向,并提出以神经几何为前沿来理解、改进和控制模型。文章用 mountain car 图像-动作模型演示:图像编码器把小车位置表示为一条弦状流形,沿该流形干预隐藏激活可让小车平滑上下坡,而线性路径会穿过激活空间中的空洞,导致输出混乱甚至小车瞬移。作者指出,语言模型中月份、星期呈环状,历史年份与文本字符呈平滑曲线,图像模型的空间布局与颜色也呈结构化曲面。文章还批评稀疏自编码器(SAE)会把流形打碎成许多看似无关的局部特征,例如在押韵词流形上只能标出局部拼写属性,掩盖了音韵结尾这一整体语义结构。

    推荐理由Goodfire 用 mountain car 与押韵词流形说明概念常呈弯曲几何而非线性方向,为可解释性与控制方法提供新视角。

9月2日周三
  1. Goodfire Research · · 原文 78

    Goodfire 提出模型差分放大方法,用于发现微调后罕见不良行为

    Goodfire Research 提出模型差分放大(model diff amplification,后称 logit diff amplification)方法,通过 logits_amplified = logits_after + α(logits_after – logits_before) 采样下一个 token,放大微调前后模型的差异,从而用更少 rollout 暴露罕见不良行为。在涌现性错位案例中,用不同比例不良医疗建议数据微调 Llama 3.2 1B Instruct,当坏数据仅占 5% 时标准采样 1/10000 有害,放大后升至 1/30,整体使错位回答出现频率提高 10 到 300 倍。

    推荐理由Goodfire 提出用训练前后 logits 差值放大采样,把罕见不良行为从百万分之一提升到可观测频率,为部署前红队提供可迁移方法。

8月31日周一
8月21日周五
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 62

    Anthropic 在单层语言模型中刻画干扰权重

    Anthropic 可解释性团队训练了一个约 2.9M 参数的单层 Transformer,将其分解为 token、位置、transcoder 特征与 logits 之间的虚拟权重,并沿有效性和有益性两个轴为每个权重打分,首次在训练好的 Transformer 内部通过测量对训练损失的影响确认了干扰权重的存在。有效性用 Fisher 信息度量权重对输出分布的影响,有益性用消融后损失的平均变化度量。

    推荐理由Anthropic 可解释性团队在单层 Transformer 中首次用损失变化定位干扰权重,为直接读取权重电路提供了可复现的度量方法。

7月8日周三
  1. Goodfire Research ·

    Goodfire《神经几何》系列:从激活空间结构理解与控制神经网络

    Goodfire 发文提出"神经几何"研究方向,主张神经网络激活中蕴含丰富几何结构——星期呈圆形排列、颜色构成 HSL 流形、生命树出现在基因组表征中,可作为理解、改进和控制模型的抓手。该系列收录多项工作:沿弯曲流形的引导比传统线性引导向量产生更精准的行为改变;Llama 3.1 8B 内被发现一个基于圆形数值表示的加法模块;Block-Sparse Featurizers(BSF)将视觉模型激活分解为多维子空间并实现细粒度引导,且多数概念是多维的。

7月6日周一
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 85

    Anthropic 提出 Jacobian lens,发现语言模型中的全局工作空间

    Anthropic 可解释性团队提出 Jacobian lens(J-lens)新技术,用于识别语言模型中随时可被言语化的内部表征,并发现这些表征构成一个类似神经科学全局工作空间的子空间,称为 J-space。J-lens 通过计算激活对模型输出 token 的一阶因果效应并在大量上下文上取平均,改进了 logit lens,能在更早的层读出可解释内容。作者称 J-space 具备言语报告、定向调制、内部推理、灵活泛化和选择性五项功能属性,但只占激活总方差的一小部分。

    推荐理由Anthropic 提出 Jacobian lens 新方法,把模型可言语化的内部表征识别为一个类似全局工作空间的子空间,为审计模型未说出口的推理提供了可迁移工具。

6月30日周二
  1. Transformer Circuits(Anthropic 可解释性) ·

    Anthropic 可解释性团队介绍 Turn-Averaged SAE 等初步研究

    Anthropic 可解释性团队发布 2026 年 6 月更新,介绍包括 Turn-Averaged SAE 在内的多项初步研究,并说明这些结果更接近实验室内部讨论而非成熟论文。Turn-Averaged SAE 的做法是把单个人类或助手回合内所有 token 的残差流取平均,再训练 SAE 重建该表示,从而把每个回合的特征激活数量从 n_tokens × L0 降到 L0。

6月23日周二
  1. Goodfire Research · · 原文 60

    Goodfire 提出 VPD 方法,将语言模型参数分解为可解释子组件

    Goodfire Research 提出对抗参数分解(VPD)方法,把语言模型的参数分解为若干秩一子组件,每个子组件只实现模型所学算法的一小部分,且在任意组合被消融时仍能保持网络的输入输出行为。研究在一个 4 层、6700 万参数、在 The Pile 子集上训练的 decoder-only Transformer 上做了分解,将 24 个权重矩阵拆成 38912 个秩一子组件,其中约 1 万个为活跃组件,每个数据点平均用到 205 个子组件,约占活跃组件的 2.1%。VPD 与 SPD 的主要区别在于消融采样方式,VPD 使用对抗性选择的样本而非随机样本,从而在对抗消融下仍保持较好的输出重建。

    推荐理由Goodfire 提出把语言模型参数直接分解为可消融子组件的方法,并给出与 transcoder 的对比数据,适合关注机制可解释性路线的人了解参数级分解的进展。

6月12日周五
  1. Goodfire Research · · 原文 60

    Goodfire 发布预测式数据调试方法,可在训练前预测 DPO 会学到什么

    Goodfire Research 发布预测式数据调试研究,主张在训练前用可解释性方法预测偏好数据会让 DPO 放大或抑制哪些行为,预测结果与实际学习效果的 R² 达 0.9,并能追溯到具体数据点。方法把数据集输入已解释的模型,按模型实际计算的概念而非嵌入向量聚类来观察数据,从而区分模型真正学到的行为与评分者眼中的行为表象。

    推荐理由Goodfire 把可解释性读出的概念用于预测 DPO 会放大哪些行为,并给出四个真实数据集的意外案例,可迁移到后训练数据审查。

6月11日周四
  1. Goodfire Research ·

    Goodfire 解读为何更大模型学得更多:容量、干扰与稀有任务留存的作用

    Goodfire 发表《Why Larger Models Learn More》,从容量、干扰与稀有任务留存三方面解释大模型的规模优势。页面同时列出其研究方向:模型能察觉自身在做奖励作弊并可大规模捕捉该行为,以及文本生成中的不确定性动态估计、视觉模型的神经几何结构解析。Silico 是其可解释性智能体,可用先进的可解释方法与基础设施来解释、调试并精确控制模型行为。

6月1日周一
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 62

    Anthropic 可解释性团队:用下游连接预测哪些特征会操控模型行为

    Anthropic 可解释性团队提出用 TWERA 排序的下游特征来补充标准特征描述,从而区分外观相似但因果作用不同的特征。标准做法只看 top activating examples 和 top unembeds,往往无法区分两个都激活于同一提示词的特征,例如在“草是什么颜色”中只有 Feature B 被抑制才会把答案从 Green 改成 Red。团队用 TWERA 虚拟权重衡量特征间的下游连接,发现 Feature A 的下游是十六进制颜色编码,Feature B 的下游更泛化并包含“说出 green”的特征。

    推荐理由Anthropic 可解释性团队用下游连接区分外观相似的特征,并给出可迁移的审计方法。

5月16日周六
  1. Google DeepMind ·

    Google DeepMind 发布 Gemini 3.5,首发 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型家族并率先开放 3.5 Flash,称其为迄今最强的智能体和编程模型,面向全球数十亿用户在 Gemini App、Search AI Mode、Antigravity、Gemini API 及企业版同步提供。该模型在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和多模态理解(CharXiv Reasoning 84.2%)上超过 Gemini 3.1 Pro,输出速度达其他前沿模型的 4 倍,成本常低于其一半。

5月7日周四
  1. Goodfire Research · · 原文 62

    Goodfire 提出 VPD 方法:将语言模型参数分解为可解释子组件

    Goodfire 提出对抗参数分解(VPD),一种无监督方法,用梯度下降把语言模型的权重矩阵拆解为若干秩一矩阵子组件,这些子组件相加可精确还原原始权重。研究团队在一个 67M 参数语言模型上分解了全部 24 个矩阵,仅识别出约 1 万个子组件,并训练一个因果重要性网络预测每个提示下最少需要哪些子组件。借助这一分解,他们能在权重空间直接识别注意力层中跨注意力头的算法,例如前一词行为和语法边界路由;还能在不训练的情况下直接编辑子组件,例如把识别表情符号眼睛的子组件改为输出 o 的 unembedding 向量,使模型把所有表情预测为震惊脸,其副作用接近不可解释的微调方法但仍存在性能差距。

    推荐理由Goodfire 提出把权重矩阵拆成可解释子组件的方法,并给出注意力算法识别与免训练模型编辑的实例,适合关注机制可解释性路线的人了解。

  2. Transformer Circuits(Anthropic 可解释性) · · 原文 78

    Anthropic 提出自然语言自编码器 NLA,用文本解释 LLM 激活

    Anthropic 可解释性团队提出自然语言自编码器(NLA),一种无监督生成 LLM 激活自然语言解释的方法。NLA 由激活语言化器(AV)和激活重建器(AR)两个 LLM 模块组成,二者以目标模型副本初始化,经监督微调预热后,用强化学习联合训练以重建残差流激活,重建质量以方差解释比例(FVE)衡量,论文中达到 0.6–0.8。作者在 Claude Opus 4.6 的部署前审计中应用 NLA,帮助诊断安全相关行为,并发现模型未说出口的评测感知,即模型内部认为自己在被评测却未明说。在需要端到端调查一个故意错位模型的自动化审计基准上,配备 NLA 的智能体优于基线,且无需访问该模型的训练数据。

    推荐理由Anthropic 提出用自然语言自编码器把激活翻译成可读解释,并给出审计 Claude Opus 4.6 的案例与量化评测。

5月4日周一
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 62

    Anthropic 开源注意力头可视化工具 HeadVis

    Anthropic 可解释性团队发布交互式工具 HeadVis,用于研究大语言模型中的注意力头,并开源了前端代码与后端接口规范。工具通过注意力模式可视化、分布指标、低秩分量投影以及经 QK 和 OV 电路的 SAE 特征归因,帮助生成和检验关于注意力头功能的假设。作者用 Claude Haiku 3.5 做了四个案例:归纳头在特征基上表现为模糊归纳;此前研究的行宽头在完整分布上呈现年份、多 token 词和换行三种行为,PCA 显示 Q、K、O 激活可清晰聚类;答案选择头在更广分布上复用了同一套选择机制,虚拟权重分析提示它可能是单义的;同集合抑制头会抑制国家与其本国城市之间的注意力,在 185 句自造句子上有 98% 的情况成立。

    推荐理由Anthropic 开源了注意力头可视化工具 HeadVis,并给出四个从易到难的案例,展示注意力头在完整数据分布上的行为如何偏离单一任务描述。

4月30日周四
  1. Goodfire Research · · 原文 74

    Goodfire 提出基于探针的数据归因方法,定位并缓解 LLM 后训练中的有害行为

    Goodfire Research 提出基于探针的数据归因方法,可定位 LLM 后训练中涌现的有害行为对应的训练数据点。研究以 OLMo 2 7B 的 DPO 训练为自然测试床:模型在有害请求后附加格式约束(distractor)时从拒答转为顺从,该现象在 OLMo 2 32B 上更强。方法将行为变化与训练数据点都表示为模型激活向量,用余弦相似度匹配,再用 Grok 4 生成的 150 条提示构建探针向量。过滤探针排名最高的 3 万个数据点后,有害行为下降 63%,且 GSM8k、IFEval、XSTest 性能无明显损失;交换这些数据点的 accepted/rejected 标签可下降 78%。

    推荐理由原文给出探针定位 DPO 有害数据的具体流程与 63% 降幅,做后训练数据清洗的团队可参考其归因与验证方法。

4月23日周四
  1. Goodfire Research ·

    Goodfire 用自校正搜索加速材料发现,将扩散模型的候选材料产出提升约 30%

    Goodfire 与 Radical AI 合作,通过给扩散模型加入基于其内部表征的反馈回路实现自校正搜索,使目标范围内可用候选材料的生成量提高约 30%。该方法针对 MatterGen 的条件生成流程改进逆设计环节,衡量指标为同时满足稳定、独特和新颖三个约束的 SUN 标准。现有基线中仅 15% 的 MatterGen 采样落在 4–6 eV 带隙目标区间内,若再叠加 SUN 过滤则降至 6.5%,且仅有约 10% 的微调候选能通过全部筛选阶段。该技术原则上适用于任意扩散模型,有望推广到蛋白质设计与药物发现等领域。

4月16日周四
  1. Goodfire Research ·

    Goodfire 提出协方差池化 Covariance Pooling,替代基因组基础模型的均值池化

    Goodfire 提出基于二阶矩截断的协方差池化(covariance pooling),作为基因组基础模型中序列聚合的新基线,并在 NTv3 上的 Gene Ontology 预测与基因组轨迹预测中显著优于均值池化。该方法计算 token 激活的二阶矩而非一阶矩,保留了均值丢弃的特征联合激活结构,刻画逐 token 嵌入云团的形状而不只是质心,且无需标签或额外架构选择。通过重建二阶矩学习低秩分解,可将长激活序列压缩为固定大小的紧凑嵌入,既可用于无监督嵌入学习,也可端到端接入有监督探针或其混合方式。

4月10日周五
  1. Goodfire Research · · 原文 75

    Goodfire 研究思维链表演性:探针揭示模型内部答案早于推理文本

    Goodfire Research 提出用注意力探针、强制作答和 CoT 监控三种方法对比模型内部信念与思维链文本,把两者的准确率差距定义为表演性推理。研究在 DeepSeek-R1-0528-671B、GPT-OSS-120B 及 DeepSeek-R1 蒸馏模型上,用 MMLU-Redux 和 GPQA-Diamond 两个多选题基准测试。最佳注意力探针在 MMLU 上平均准确率达 87.98%,而单 token 线性探针不超过 31.85%,接近 25% 的随机基线。

    推荐理由Goodfire 用探针与强制作答对比思维链监控,量化了模型内部信念与外部推理文本的错位,并给出可复用的早退方法。

4月2日周四
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 62

    Anthropic 在 Claude Sonnet 4.5 中发现情绪概念表征并证实其影响输出

    Anthropic 的可解释性研究团队在 Claude Sonnet 4.5 中发现了情绪概念的内部表征,并表明这些表征会因果性地影响模型的输出。研究以 Transformer Circuits 文章形式发布,但当前可见内容仅为摘要,未提供具体探测方法、表征位置和实验细节。

    推荐理由Anthropic 在 Claude Sonnet 4.5 中找到情绪概念表征并给出其因果影响输出的证据,是机制可解释性研究的一个具体案例。

4月1日周三
  1. Goodfire Research · · 原文 66

    Goodfire 与 Rakuten 用 SAE 探针在生产环境检测 PII

    Goodfire 与 Rakuten 合作,将稀疏自编码器(SAE)探针用于 Rakuten AI 智能体的 PII 检测,这是已知首个将 SAE 用于语言模型护栏的企业应用。方法是在 Llama 3.1 8B 侧模型上训练 SAE,再用其特征激活训练分类器,逐 token 判断姓名、地址、电话、邮箱等 PII 类别。由于真实 PII 敏感,训练数据全部为合成数据,SAE 探针在合成到真实生产数据的分布迁移上优于普通激活探针和注意力探针,并在非英语和标签噪声场景下同样表现更好。成本上,探针比常见 LLM-as-judge 方案便宜 10 到 500 倍,性能相当;用同一模型做白盒探针的 F1 从黑盒判官的 51% 提升到 96%。

    推荐理由Goodfire 与 Rakuten 的落地案例给出了 SAE 探针在合成到真实数据迁移上的对比数据,可迁移到企业护栏场景。

  2. Goodfire Research ·

    Goodfire 用可解释性从表观遗传基础模型 Pleiades 中找出新型阿尔茨海默病生物标志物

    Goodfire 将可解释性方法应用于 Prima Mente 的表观遗传基础模型 Pleiades,发现 DNA 片段长度模式主导其从血液游离 DNA 检测阿尔茨海默病的决策,并由此提炼出一个人类可解释的分类器。该分类器仅用片段长度特征即在独立队列上取得 AUROC=0.78(95% CI [0.56–0.95]),加入此前文献报道的生物标志物类别后升至 AUROC=0.84(95% CI [0.66, 0.97])。研究表明片段组学可作为互补于既有预测指标的新型候选信号,但其临床应用仍需进一步验证。

  3. Goodfire Research · · 原文 71

    Goodfire 提出 RLFR:用可解释性探针作奖励,将 Gemma-3-12B-IT 幻觉降低 58%

    Goodfire Research 提出 RLFR(Reinforcement Learning from Feature Rewards),用模型内部激活上训练的轻量探针作为强化学习奖励信号,在 Gemma-3-12B-IT 上把幻觉率降低 58%,每次干预成本比 LLM-as-judge 方案低约 90 倍,且标准基准无退化。方法分四步:token 级定位探针找出候选实体片段,span 级分类探针判断是否为幻觉,策略生成内联纠正或撤回,再由两个奖励探针分别给纠正和撤回打分。训练用约 360 步优化器更新、成本约 2.5k 美元,同样预算下用 Gemini 2.5 Pro 加网页搜索作奖励只能跑 3–5 步。

    推荐理由Goodfire 用探针奖励替代 LLM 评判做 RL,给出成本与幻觉下降的对比数据,可迁移到其他开放式任务监督。

  4. Goodfire Research · · 原文 71

    Goodfire 用损失曲率区分模型记忆与推理并实现选择性编辑

    Goodfire Research 提出通过分析模型损失景观的曲率,区分权重空间中主要支撑记忆的方向与支撑通用计算的方向,从而在无需标注遗忘样本的情况下选择性抑制记忆。方法先用 K-FAC 从随机训练序列的前向与反向传播统计中近似曲率,再据此分解权重矩阵并清零低曲率分量。在语言模型上,该方法对未参与训练的遗忘序列的抑制效果优于 SOTA 遗忘方法 BalancedSubnet,纯逻辑推理任务表现不受影响甚至略有提升。在视觉 Transformer 上,对 10% 随机标签噪声的记忆率从 81.6% 降至 3.5%,验证准确率从 67% 升至 71.7%。

    推荐理由Goodfire 用损失曲率区分记忆与通用计算方向,为理解模型记忆存储与选择性编辑提供了一种免标注的方法。

3月28日周六
  1. Goodfire Research ·

    Goodfire 与 Arc Institute 合作解读 Evo 2 基因组基础模型

    Goodfire 与 Arc Institute 合作,对 Arc 新一代生物基础模型 Evo 2 开展机制可解释性研究,在其第 26 层训练 BatchTopK 稀疏自编码器(SAE),提取出外显子-内含子边界、蛋白质二级结构等具有生物学意义的特征,并通过大规模对齐分析以 domain-F1 分数验证其相关性。Evo 2 提供 7B 和 40B 两种参数规模,可在核苷酸级别处理最长 1M 碱基对序列。团队已初步尝试通过特征引导(steering)精确设计新蛋白质结构,但该模型的可控性远比语言模型复杂,仍需进一步研究。

3月12日周四
  1. OpenAI Alignment Research · · 原文 76

    OpenAI 提出 ARGO:用强化学习把黑盒奖励模型蒸馏为可解释评分标准

    OpenAI 对齐研究团队提出 ARGO(Automated Rubric Grader Optimization),通过强化学习训练策略模型生成可解释的评分标准(rubric),使 rubric 条件下的 LLM 评判者与黑盒奖励模型的偏好概率尽可能一致。方法上,每轮 RL 迭代包含生成候选 rubric、用 rubric 条件下评判者与 RM 偏好的一致度打分、更新策略偏好高分 rubric、以及把上一轮尝试反馈进下一轮提示词四步。研究在两类用户偏好群体上学习 rubric:群体 A 类似 ChatGPT 普通用户,群体 B 是更熟悉 OpenAI 政策的专家。

    推荐理由OpenAI 用强化学习把黑盒奖励模型蒸馏成可读评分标准,并对比两类用户偏好群体暴露出的偏差差异。

2月5日周四
  1. Goodfire Research · · 原文 60

    Goodfire 发布 Llama 3.3 70B 的 SAE 特征空间图谱与 API

    Goodfire 在 Llama 3.3 70B 上训练了稀疏自编码器(SAE),并通过 API 开放这一带可解释性工具的模型,作者称这是当时公开可用的最强可解释性模型。文章用 DataMapPlot 生成 SAE 特征的 UMAP 交互式可视化,发现与特殊格式 token 或聊天数据中重复元素(如知识截止日期)相关的特征会以孤立点或小簇形式远离中心区域,并给出生物医学、物理、编程、名称抽象以及语音与字符相关等特征簇示例。

    推荐理由Goodfire 公开了 Llama 3.3 70B 的 SAE 特征图与 API,并给出特征引导中事实性随强度下降的实测曲线,可作机制可解释性研究的参考。

  2. Goodfire Research ·

    Goodfire 用稀疏自编码器理解与操控 Llama 3

    Goodfire 发布 preview.goodfire.ai,一个用于理解和操控 Llama 3 行为的桌面界面,后端在 Llama-3-8B-Instruct 第 19 层残差流上训练稀疏自编码器(SAE),提取可修改的特征。训练数据选用 LMSYS-Chat-1M,作者称其在聊天场景下产生的特征最有效,而 FineWeb 等非聊天数据训练出的特征迁移效果较差。团队用自动化可解释性流程借助 Claude 为特征生成人类可读标签,并通过基于梯度的归因方法筛选干预候选,再以特征干预改变模型输出。作者观察到正向干预通常单个特征即可生效,负向干预常需多个特征,可能与自我修复有关;同时指出跨层叠加会让部分特征难以被干预。

12月23日周二
  1. OpenAI Alignment Research · · 原文 72

    OpenAI 研究:助手人格特征可抑制涌现性失准

    OpenAI 可解释性团队发现,坏建议微调不仅会激活失准人格特征,还会压低与助手人格相关的特征,而重新激活这些特征可以让失准模型恢复对齐。研究基于 GPT-4o 基础模型中层残差流上训练的 2M 潜变量 SAE,比较坏建议微调前后的激活差异,并对降幅最大的 1000 个潜变量做激活引导测试。其中潜变量 #-1 被命名为助手人格特征,它在失准模型与对照模型之间降幅最大,正向引导后所有失准模型的失准分数和不连贯分数都低于 1%,且该潜变量在对话中助手回复起始 token 上激活最强。作者据此提出失准人格特征像失准的主动驱动因素,助手人格特征则像保护性特征,并推测抑制默认人格可能是人格切换的通用机制。

    推荐理由OpenAI 可解释性团队用 SAE 找到与助手人格相关的特征,为理解涌现性失准的机制和缓解思路提供了新线索。