跳到正文
原文
Google DeepMind·本站收录 · 原文发表 精选关注度56

Gemma Scope 2:帮助 AI 安全社区深入理解语言模型的复杂行为

Gemma Scope 2: helping the AI safety community deepen understanding of complex language model behavior

AI 导读

Google DeepMind 发布 Gemma Scope 2,一套覆盖 Gemma 3 全系列模型(270M 至 27B 参数)的开源可解释性工具套件。该套件结合稀疏自编码器(SAEs)与 transcoders,覆盖 Gemma 3 的每一层,并新增 skip-transcoder 与跨层 transcoder,便于解读分布在模型中的多步计算。训练采用 Matryoshka 等技术,DeepMind 称制作过程存储约 110 PB 数据、训练超过 1 万亿参数,并称这是迄今 AI 实验室规模最大的开源可解释性工具发布。套件还包含面向 Gemma 3 对话版本的组件,可用于分析越狱、拒答机制与思维链忠实性等行为,交互式 demo 由 Neuronpedia 提供。

推荐理由

Gemma Scope 2 覆盖 Gemma 3 全部尺寸并细化到每一层,研究者可据此追踪越狱、拒答与思维链忠实性等行为在模型内部的成因。

阅读原文deepmind.google