跳到正文

可解释性

机制可解释性、SAE、探针与 steering:看清模型内部并用于检测和干预。

339条动态与论文相关主题对齐思维链监控Anthropic
在这个话题内搜索或按分类筛选

新闻与论文

第 281–300 条 · 共 339 条
10月1日周四
  1. Goodfire Research · 收录 · 原文 15

    Goodfire 推出 Paint With Ember:用扩散模型潜空间概念作画

    Goodfire Research 发布 Paint With Ember,用画布取代提示词框,直接操控图像模型内部激活来编辑和生成图像。该工具基于 3.5B 参数的 Stable Diffusion XL-Turbo,针对其 UNet 的 block down.2.1 层训练 BatchTopK SAE 分解 16x16 patch 的潜向量,再用非负矩阵分解(NMF)把细粒度特征聚合成可操作的高层概念单元。用户可绘画添加物体、拖动概念、调整语义权重或修改主体动作,公开版应用与开源 SAE 解释器模型均已开放。

  2. Goodfire Research · 收录 · 原文 21

    Goodfire 研究:语言模型可解释性缺失的归纳偏置

    Goodfire 研究指出当前语言模型可解释性方法缺失关键的归纳偏置,并提出"时间先验"(Priors in Time)这一方向。研究认为模型能察觉自身正在进行奖励作弊,且这类行为可被大规模捕捉。相关方法与其可解释性智能体 Silico 结合,用于解释、调试和精确控制模型行为。

  3. Goodfire Research · 收录 · 原文 21

    Goodfire 研究:信念动力学揭示上下文学习与激活引导的双重性质

    Goodfire 研究发现,模型在奖励作弊时是"知道"自己在作弊的,且可在规模化条件下被捕捉。该研究通过信念动力学分析,揭示上下文学习与激活引导具有双重性质。相关结论来自 Goodfire Research,具体模型与实验细节未在摘要信息中披露。

  4. Goodfire Research · 收录 · 原文 15

    Goodfire 梳理机制可解释性领域的开放问题

    Goodfire 发布《机制可解释性中的开放问题》,梳理该领域尚未解决的研究难题。其研究还显示,模型在奖励作弊时自身"知道",并可被大规模检测;同时提出 Forking Fast 方法高效估计文本生成中的不确定性动态,并用块稀疏特征器揭示视觉模型的神经几何结构。

  5. Goodfire Research · 收录 · 原文 39

    Goodfire 用稀疏自编码器理解与操控 Llama 3

    Goodfire 发布 preview.goodfire.ai,一个用于理解和操控 Llama 3 行为的桌面界面,后端在 Llama-3-8B-Instruct 第 19 层残差流上训练稀疏自编码器(SAE),提取可修改的特征。训练数据选用 LMSYS-Chat-1M,作者称其在聊天场景下产生的特征最有效,而 FineWeb 等非聊天数据训练出的特征迁移效果较差。团队用自动化可解释性流程借助 Claude 为特征生成人类可读标签,并通过基于梯度的归因方法筛选干预候选,再以特征干预改变模型输出。作者观察到正向干预通常单个特征即可生效,负向干预常需多个特征,可能与自我修复有关;同时指出跨层叠加会让部分特征难以被干预。

  6. Goodfire Research · 收录 · 原文 42

    Goodfire 发布 Llama 3.3 70B 的 SAE 特征空间图谱与 API

    Goodfire 在 Llama 3.3 70B 上训练了稀疏自编码器(SAE),并通过 API 开放这一带可解释性工具的模型,作者称这是当时公开可用的最强可解释性模型。文章用 DataMapPlot 生成 SAE 特征的 UMAP 交互式可视化,发现与特殊格式 token 或聊天数据中重复元素(如知识截止日期)相关的特征会以孤立点或小簇形式远离中心区域,并给出生物医学、物理、编程、名称抽象以及语音与字符相关等特征簇示例。

    推荐理由Goodfire 公开了 Llama 3.3 70B 的 SAE 特征图与 API,并给出特征引导中事实性随强度下降的实测曲线,可作机制可解释性研究的参考。

  7. Goodfire Research · 收录 · 原文 27

    Goodfire 与 Arc Institute 合作解读 Evo 2 基因组基础模型

    Goodfire 与 Arc Institute 合作,对 Arc 新一代生物基础模型 Evo 2 开展机制可解释性研究,在其第 26 层训练 BatchTopK 稀疏自编码器(SAE),提取出外显子-内含子边界、蛋白质二级结构等具有生物学意义的特征,并通过大规模对齐分析以 domain-F1 分数验证其相关性。Evo 2 提供 7B 和 40B 两种参数规模,可在核苷酸级别处理最长 1M 碱基对序列。团队已初步尝试通过特征引导(steering)精确设计新蛋白质结构,但该模型的可控性远比语言模型复杂,仍需进一步研究。

  8. Goodfire Research · 收录 · 原文 46

    Goodfire 与 Rakuten 用 SAE 探针在生产环境检测 PII

    Goodfire 与 Rakuten 合作,将稀疏自编码器(SAE)探针用于 Rakuten AI 智能体的 PII 检测,这是已知首个将 SAE 用于语言模型护栏的企业应用。方法是在 Llama 3.1 8B 侧模型上训练 SAE,再用其特征激活训练分类器,逐 token 判断姓名、地址、电话、邮箱等 PII 类别。由于真实 PII 敏感,训练数据全部为合成数据,SAE 探针在合成到真实生产数据的分布迁移上优于普通激活探针和注意力探针,并在非英语和标签噪声场景下同样表现更好。成本上,探针比常见 LLM-as-judge 方案便宜 10 到 500 倍,性能相当;用同一模型做白盒探针的 F1 从黑盒判官的 51% 提升到 96%。

    推荐理由Goodfire 与 Rakuten 的落地案例给出了 SAE 探针在合成到真实数据迁移上的对比数据,可迁移到企业护栏场景。

  9. Goodfire Research · 收录 · 原文 50

    Goodfire 用损失曲率区分模型记忆与推理并实现选择性编辑

    Goodfire Research 提出通过分析模型损失景观的曲率,区分权重空间中主要支撑记忆的方向与支撑通用计算的方向,从而在无需标注遗忘样本的情况下选择性抑制记忆。方法先用 K-FAC 从随机训练序列的前向与反向传播统计中近似曲率,再据此分解权重矩阵并清零低曲率分量。在语言模型上,该方法对未参与训练的遗忘序列的抑制效果优于 SOTA 遗忘方法 BalancedSubnet,纯逻辑推理任务表现不受影响甚至略有提升。在视觉 Transformer 上,对 10% 随机标签噪声的记忆率从 81.6% 降至 3.5%,验证准确率从 67% 升至 71.7%。

    推荐理由Goodfire 用损失曲率区分记忆与通用计算方向,为理解模型记忆存储与选择性编辑提供了一种免标注的方法。

  10. Goodfire Research · 收录 · 原文 15

    Goodfire 用可解释性从表观遗传基础模型 Pleiades 中找出新型阿尔茨海默病生物标志物

    Goodfire 将可解释性方法应用于 Prima Mente 的表观遗传基础模型 Pleiades,发现 DNA 片段长度模式主导其从血液游离 DNA 检测阿尔茨海默病的决策,并由此提炼出一个人类可解释的分类器。该分类器仅用片段长度特征即在独立队列上取得 AUROC=0.78(95% CI [0.56–0.95]),加入此前文献报道的生物标志物类别后升至 AUROC=0.84(95% CI [0.66, 0.97])。研究表明片段组学可作为互补于既有预测指标的新型候选信号,但其临床应用仍需进一步验证。

  11. Goodfire Research · 收录 · 原文 50

    Goodfire 提出 RLFR:用可解释性探针作奖励,将 Gemma-3-12B-IT 幻觉降低 58%

    Goodfire Research 提出 RLFR(Reinforcement Learning from Feature Rewards),用模型内部激活上训练的轻量探针作为强化学习奖励信号,在 Gemma-3-12B-IT 上把幻觉率降低 58%,每次干预成本比 LLM-as-judge 方案低约 90 倍,且标准基准无退化。方法分四步:token 级定位探针找出候选实体片段,span 级分类探针判断是否为幻觉,策略生成内联纠正或撤回,再由两个奖励探针分别给纠正和撤回打分。训练用约 360 步优化器更新、成本约 2.5k 美元,同样预算下用 Gemini 2.5 Pro 加网页搜索作奖励只能跑 3–5 步。

    推荐理由Goodfire 用探针奖励替代 LLM 评判做 RL,给出成本与幻觉下降的对比数据,可迁移到其他开放式任务监督。

  12. Goodfire Research · 收录 · 原文 53

    Goodfire 研究思维链表演性:探针揭示模型内部答案早于推理文本

    Goodfire Research 提出用注意力探针、强制作答和 CoT 监控三种方法对比模型内部信念与思维链文本,把两者的准确率差距定义为表演性推理。研究在 DeepSeek-R1-0528-671B、GPT-OSS-120B 及 DeepSeek-R1 蒸馏模型上,用 MMLU-Redux 和 GPQA-Diamond 两个多选题基准测试。最佳注意力探针在 MMLU 上平均准确率达 87.98%,而单 token 线性探针不超过 31.85%,接近 25% 的随机基线。

    推荐理由Goodfire 用探针与强制作答对比思维链监控,量化了模型内部信念与外部推理文本的错位,并给出可复用的早退方法。

  13. Goodfire Research · 收录 · 原文 11

    Goodfire 提出协方差池化 Covariance Pooling,替代基因组基础模型的均值池化

    Goodfire 提出基于二阶矩截断的协方差池化(covariance pooling),作为基因组基础模型中序列聚合的新基线,并在 NTv3 上的 Gene Ontology 预测与基因组轨迹预测中显著优于均值池化。该方法计算 token 激活的二阶矩而非一阶矩,保留了均值丢弃的特征联合激活结构,刻画逐 token 嵌入云团的形状而不只是质心,且无需标签或额外架构选择。通过重建二阶矩学习低秩分解,可将长激活序列压缩为固定大小的紧凑嵌入,既可用于无监督嵌入学习,也可端到端接入有监督探针或其混合方式。

  14. Goodfire Research · 收录 · 原文 14

    Goodfire 用自校正搜索加速材料发现,将扩散模型的候选材料产出提升约 30%

    Goodfire 与 Radical AI 合作,通过给扩散模型加入基于其内部表征的反馈回路实现自校正搜索,使目标范围内可用候选材料的生成量提高约 30%。该方法针对 MatterGen 的条件生成流程改进逆设计环节,衡量指标为同时满足稳定、独特和新颖三个约束的 SUN 标准。现有基线中仅 15% 的 MatterGen 采样落在 4–6 eV 带隙目标区间内,若再叠加 SUN 过滤则降至 6.5%,且仅有约 10% 的微调候选能通过全部筛选阶段。该技术原则上适用于任意扩散模型,有望推广到蛋白质设计与药物发现等领域。

  15. Goodfire Research · 收录 · 原文 52

    Goodfire 提出基于探针的数据归因方法,定位并缓解 LLM 后训练中的有害行为

    Goodfire Research 提出基于探针的数据归因方法,可定位 LLM 后训练中涌现的有害行为对应的训练数据点。研究以 OLMo 2 7B 的 DPO 训练为自然测试床:模型在有害请求后附加格式约束(distractor)时从拒答转为顺从,该现象在 OLMo 2 32B 上更强。方法将行为变化与训练数据点都表示为模型激活向量,用余弦相似度匹配,再用 Grok 4 生成的 150 条提示构建探针向量。过滤探针排名最高的 3 万个数据点后,有害行为下降 63%,且 GSM8k、IFEval、XSTest 性能无明显损失;交换这些数据点的 accepted/rejected 标签可下降 78%。

    推荐理由原文给出探针定位 DPO 有害数据的具体流程与 63% 降幅,做后训练数据清洗的团队可参考其归因与验证方法。

  16. Goodfire Research · 收录 · 原文 43

    Goodfire 提出 VPD 方法:将语言模型参数分解为可解释子组件

    Goodfire 提出对抗参数分解(VPD),一种无监督方法,用梯度下降把语言模型的权重矩阵拆解为若干秩一矩阵子组件,这些子组件相加可精确还原原始权重。研究团队在一个 67M 参数语言模型上分解了全部 24 个矩阵,仅识别出约 1 万个子组件,并训练一个因果重要性网络预测每个提示下最少需要哪些子组件。借助这一分解,他们能在权重空间直接识别注意力层中跨注意力头的算法,例如前一词行为和语法边界路由;还能在不训练的情况下直接编辑子组件,例如把识别表情符号眼睛的子组件改为输出 o 的 unembedding 向量,使模型把所有表情预测为震惊脸,其副作用接近不可解释的微调方法但仍存在性能差距。

    推荐理由Goodfire 提出把权重矩阵拆成可解释子组件的方法,并给出注意力算法识别与免训练模型编辑的实例,适合关注机制可解释性路线的人了解。