跳到正文

可解释性

今天还没有收录新动态
10月1日周四
  1. arXiv:可解释性 · 收录 · 原文 论文14

    REGEXROUTE:无需嵌入向量的正则表达式路由,兼顾速度与可解释性

    REGEXROUTE 用稀疏自编码器(SAEs)从无标注文本中发现可解释的正则表达式特征,让 LLM 将分组 SAE latent 的描述转成正则提取器并迭代精炼,从而在推理时完全省去神经编码。在四个基准上,固定 128 个特征取得 76.43% 平均路由准确率,与最强神经文本编码器基线的 76.41% 相当,且延迟更低、鲁棒性更强。该工作还发现 Qwen2.5 编码器从 0.5B 扩到 72B 参数对路由准确率提升甚微。

  2. Transformer Circuits · 收录 · 原文 22

    Anthropic 的可解释性基础设施 Garçon

    Anthropic 为其机制可解释性研究搭建了一套名为 Garçon 的基础设施,可在跨节点的大规模 Transformer 模型上进行激活读取、组件消融与梯度回传实验。它通过启动服务器并连接远程模型的接口运行前向传播,暴露一组 probe points,允许挂载探针函数访问或修改内部张量,并以云 pickle 传输任意 Python 对象到服务端执行。

  3. Transformer Circuits · 收录 · 原文 17

    Anthropic 发布 PySvelte:连接 Python 深度学习与 Svelte 可视化的库

    Anthropic 发布 PySvelte,一个用于将基于 Svelte 和 Web 标准的自定义可视化接入 Python 深度学习工作流的库。它让 src/ 目录下的 Svelte 组件自动以 pysvelte.Hello() 形式在 Python 中可用,支持 NumPy 数组传入、组件相加成页面,并可通过 .publish() 发布到 GCS/S3/AZ 等存储分享。该库声明完全不提供支持,许多功能需用户自行编写 config.py 才能使用。

  4. Transformer Circuits · 收录 · 原文 43

    Anthropic 可解释性团队发布 2024 年 7 月 Circuits Updates

    Anthropic 可解释性团队发布 2024 年 7 月 Circuits Updates,梳理机制可解释性当前面临的五个主要障碍:缺失特征、跨层叠加、注意力叠加、干扰权重与宏观理解。团队认为叠加问题已有显著进展,但可能只能提取到一小部分特征,大量稀有特征或成为神经网络中的暗物质。文章还重新界定线性表示,区分特征是否一维与特征是否在数学上线性,并讨论多维特征的几何约束。在注意力透视表方面,团队复现了单层 Transformer 的 skip-trigram 结果,报告约 25–75% 可解释条目,并建议对低于约 10% 的表格保持怀疑。

    推荐理由Anthropic 可解释性团队集中列出机制可解释性尚未解决的五个障碍,并给出线性表示与特征敏感度的新讨论。

  5. Goodfire Research · 收录 · 原文 15

    Goodfire 推出 Paint With Ember:用扩散模型潜空间概念作画

    Goodfire Research 发布 Paint With Ember,用画布取代提示词框,直接操控图像模型内部激活来编辑和生成图像。该工具基于 3.5B 参数的 Stable Diffusion XL-Turbo,针对其 UNet 的 block down.2.1 层训练 BatchTopK SAE 分解 16x16 patch 的潜向量,再用非负矩阵分解(NMF)把细粒度特征聚合成可操作的高层概念单元。用户可绘画添加物体、拖动概念、调整语义权重或修改主体动作,公开版应用与开源 SAE 解释器模型均已开放。

  6. Goodfire Research · 收录 · 原文 39

    Goodfire 用稀疏自编码器理解与操控 Llama 3

    Goodfire 发布 preview.goodfire.ai,一个用于理解和操控 Llama 3 行为的桌面界面,后端在 Llama-3-8B-Instruct 第 19 层残差流上训练稀疏自编码器(SAE),提取可修改的特征。训练数据选用 LMSYS-Chat-1M,作者称其在聊天场景下产生的特征最有效,而 FineWeb 等非聊天数据训练出的特征迁移效果较差。团队用自动化可解释性流程借助 Claude 为特征生成人类可读标签,并通过基于梯度的归因方法筛选干预候选,再以特征干预改变模型输出。作者观察到正向干预通常单个特征即可生效,负向干预常需多个特征,可能与自我修复有关;同时指出跨层叠加会让部分特征难以被干预。

  7. Goodfire Research · 收录 · 原文 42

    Goodfire 发布 Llama 3.3 70B 的 SAE 特征空间图谱与 API

    Goodfire 在 Llama 3.3 70B 上训练了稀疏自编码器(SAE),并通过 API 开放这一带可解释性工具的模型,作者称这是当时公开可用的最强可解释性模型。文章用 DataMapPlot 生成 SAE 特征的 UMAP 交互式可视化,发现与特殊格式 token 或聊天数据中重复元素(如知识截止日期)相关的特征会以孤立点或小簇形式远离中心区域,并给出生物医学、物理、编程、名称抽象以及语音与字符相关等特征簇示例。

    推荐理由Goodfire 公开了 Llama 3.3 70B 的 SAE 特征图与 API,并给出特征引导中事实性随强度下降的实测曲线,可作机制可解释性研究的参考。

  8. Goodfire Research · 收录 · 原文 11

    Goodfire 提出协方差池化 Covariance Pooling,替代基因组基础模型的均值池化

    Goodfire 提出基于二阶矩截断的协方差池化(covariance pooling),作为基因组基础模型中序列聚合的新基线,并在 NTv3 上的 Gene Ontology 预测与基因组轨迹预测中显著优于均值池化。该方法计算 token 激活的二阶矩而非一阶矩,保留了均值丢弃的特征联合激活结构,刻画逐 token 嵌入云团的形状而不只是质心,且无需标签或额外架构选择。通过重建二阶矩学习低秩分解,可将长激活序列压缩为固定大小的紧凑嵌入,既可用于无监督嵌入学习,也可端到端接入有监督探针或其混合方式。

  9. Goodfire Research · 收录 · 原文 42

    Goodfire 发布预测式数据调试方法,可在训练前预测 DPO 会学到什么

    Goodfire Research 发布预测式数据调试研究,主张在训练前用可解释性方法预测偏好数据会让 DPO 放大或抑制哪些行为,预测结果与实际学习效果的 R² 达 0.9,并能追溯到具体数据点。方法把数据集输入已解释的模型,按模型实际计算的概念而非嵌入向量聚类来观察数据,从而区分模型真正学到的行为与评分者眼中的行为表象。

    推荐理由Goodfire 把可解释性读出的概念用于预测 DPO 会放大哪些行为,并给出四个真实数据集的意外案例,可迁移到后训练数据审查。

已经到底了