RouterInterp:解释 MoE 路由中的叠加特化现象
RouterInterp: Understanding Superposed Specialisation in Mixture of Experts Routing
RouterInterp用SAE解释MoE路由;作者称gpt-oss-20b上比token统计高约65%。
- 稀疏MoE常被说成每个专家掌管一个连贯领域,但按此很难解释路由。作者提出另一可能:专家特化于多个语义上不相交的细粒度特征。
- RouterInterp用SAE分解激活,按梯度归因选出最能预测各专家路由的特征,收集该特征激活且路由到或不路由到该专家的窗口,再写成统一自然语言解释并用另一模型打分。
- 作者报告gpt-oss-20b(s=128)解释mean F1为0.492,OLMoE-1B-7B为0.602,高于token共现与Expert Impact AutoInterp。第20/15层平均簇数G为11.3与10.8,作者称这支持叠加特化。
- 作者称效果随SAE重建变差而变弱,解释会随特征数变长,评测为两个1B–20B模型。实验覆盖这两个模型的若干层、每专家15个正例与85个负例;gpt-oss的batch size未报告。
- 被测模型
- gpt-oss-20bOLMoE-1B-7B
- 基准
- PileOLMoE-mix-0924
- 指标
- explanation F1macro-F1G(Ei)FVUSpearman ρ
论文提出叠加特化假设(SSH),认为 MoE 专家并非各自对应单一领域,而是特化于一组细粒度特征的并集,并据此提出解释专家路由的方法 RouterInterp。该方法通过识别最能预测路由决策的 Sparse Autoencoder 特征,生成统一的自然语言解释。在 gpt-oss-20b 上,RouterInterp 解释专家路由的检测准确率比此前基于 token 统计的方法高约 65%。作者称这为生成更准确的专家路由解释提供了可扩展方法,并加深了对基础模型中这一此前难以解释组件的理解。
深度解读
这篇论文试图解决什么问题?
作者提出叠加特化假说,并用RouterInterp解释MoE专家路由。
稀疏MoE的专家路由应否被理解成单一连贯领域,还是多个语义不相交的细粒度特征。
- 场景:稀疏MoE为每个token只选少量专家。作者引用Shazeer et al.(2017)与Liu et al.(2024),称每输入可只激活2–15%参数。性能常被归于专家特化;但作者指出细粒度类别远多于每层专家(典型8到128),由鸽巢原理,多个微域必然进入同一专家。
- 现有不足:作者称若默认「一个专家一个领域」,先前工作难以恢复清晰、可解释的特化模式(Jiang et al., 2024; Lewis et al., 2021; Zoph et al., 2022)。作者认为这一困难来自未区分两种特化假说。
- 核心假说:领域特化假说(DSH)认为相似微域聚成一个语义连贯领域。叠加特化假说(SSH)认为专家特化于彼此并不高度相关的微域之不相交并,类比神经元叠加(Elhage et al., 2022)。作者用SAE latent作为微域的特征级代理。
- 本文提出:RouterInterp。它选出最能预测路由的SAE特征,收集这些特征与专家共同激活的输入,生成统一自然语言解释,并用语言模型检测解释能否预测留出样本上的专家激活。
有哪些相关研究?
作者把本文放在MoE路由解释、叠加理论与自动解释之间。
论文在引言、Related Work与Discussion里把相关工作分成路由解释、叠加/SAE,以及表面领域特化三条线。
稀疏MoE的路由解释
- 早期工作:Shazeer et al.(2017)设计现代稀疏MoE层,以扩大网络并降低每输入计算。Jacobs et al.(1991)与Fedus et al.(2022a)曾希望特化路由也能带来可解释性。
- token统计:Jiang et al.(2024)在Mixtral上称,未观察到按输入主题分配专家的明显模式。Lewis et al.(2021)与Zoph et al.(2022)分析unigram路由,称特化程度变化很大。Tigges(2025)报告少数专家(如business专家)的unigram分析有一些成功。作者认为改用SAE特征而非token,能得到更准确的解释。
- 专家数量:Yang et al.(2025b)认为专家非常多时路由可以变得较可解释。作者称该设定所需专家数多于稀疏模型缩放律下的计算最优,也多于文中列举的高性能开源MoE的典型专家数。Park et al.(2025)的MoNET显示,专家数大很多时路由更单义、更可解释。
叠加、SAE与单义性
- 叠加:Elhage et al.(2022)论证不常共激活的稀疏特征可共享神经元,相关特征若不正交会带来高干扰。作者把这一论证类比到路由器,并引用Hänni et al.(2024)等的叠加中计算。
- SAE与自动解释:Bricken et al.(2023)、Cunningham et al.(2024)用SAE把叠加表示分解为更单义的latent;本文OLMoE SAE采用Gao et al.(2025)的Top-K。Paulo et al.(2025)的AutoInterp Detection用另一个语言模型根据解释预测激活,本文的解释分数改编自该设置。
- 专家权重与路由:Chaudhari et al.(2025)在玩具设定中发现单个专家的权重矩阵比等价稠密模型更单义。作者指出该分析度量的是专家权重而非路由决策,并认为即使专家内表示单义,路由划分本身仍可能多义。
表面特化与解释基线
- Expert Impact AutoInterp:Herbst et al.(2026)用对残差流写入最强的段落(按gi(x)∥Ei(x)∥2排序)和Logit Lens词表token生成专家解释。作者将其作基线,并称其评测集、正负平衡和接受标准与本文不同,绝对F1不宜直接比较。
- 任务或语言上的特化:Lasby et al.(2026)在代码生成上剪掉一半专家仍保留该任务的大部分质量;Bandarkar et al.(2026)发现部分多语模型有偏好特定语言的专家;Fayyaz et al.(2026)称消融一小部分专家可以切换安全拒答。作者认为这些结果只说明专家参与某语言、任务或行为,并未说明这是该专家唯一的角色。
基线与数据
- 基线方法:Unigram/Bigram Lookup,Unigram/Bigram AutoInterp,Expert Activations AutoInterp,Expert Impact AutoInterp;路由预测另有neuron basis与PCA basis稀疏探针。
- 数据集:解释打分与路由分析用Pile;OLMoE的SAE在OLMoE-mix-0924上训练。
作者把本文定位为:不假设专家单义,而用SAE特征枚举不相交微域,并形式化DSH与SSH。Discussion还引用Peng et al.(2026),称SAE更适合发现未知概念而非操作已知概念。
论文如何解决这个问题?
RouterInterp用最能预测路由的SAE特征生成专家解释。
RouterInterp把专家路由解释成一组SAE特征的组合,而不是一个单义领域。
两种特化假说
- 设一层有E个专家、语料中有D个微域。D=E时每个专家可对应一个微域;D<E时多个专家可对应同一微域,或存在从不被路由的专家。两种假说在这两种情形一致。
- D>E时多个微域必须进入同一专家。DSH预测相似微域聚成连贯领域,特化可用单一概念解释。SSH预测不相似微域进入同一专家,特化只能用多个概念解释。微域可以是主题、体裁、句法,或需要相同后续处理的输入区域。
- 作者给出两条动机。一是干扰最小化:不常共激活的领域共享专家时,作者认为干扰更低,专家可按输入施加不同变换。二是负载均衡:小batch往往只含少数宏域,均衡损失仍要求token摊到全部专家。脚注写OLMoE的batch为4M token,约为训练数据的8×10−7;gpt-oss的batch size未报告。
SAE与路由
- SAE把激活x映到更稀疏的z,再重建原激活。OLMoE使用Top-K SAE,每token保留s个最大激活,训练目标是重建误差。gpt-oss使用已训练的BatchTopK SAE。
- 路由器给出logit并经softmax得到gi(x),只保留top-k集合T。层输出为y=∑i∈ T gi(x)· Ei(x),即被选专家输出的加权和。
- 选特征时定义路由边际mi(x)=h(x)i−τi(x),τi是其他专家中第k大logit。消融特征f对边际的近似影响为cif(x)=zf df⊤∇x mi(x)。分数Sif是该正贡献在「路由到Ei」与「未路由到Ei」上的期望之差。作者注明该分数不计SAE重建误差,也不处理消融后阈值专家发生变化的情形。每特征至多分给一个专家。
RouterInterp三步
- 选特征:按Sif取每专家top-n。解释实验用梯度归因的top-45。Appendix C比较了ρ-usefulness,以及解码方向与路由器权重的余弦;作者报告归因更强。n=45被作者当作预测覆盖与解释长度的折中。
- 收集窗口:对特征f,正例Pi,f是f激活且token路由到该专家;负例Ni,f是f激活但未路由到该专家。
- 写解释:explainer按特征看到按激活强度排序的正负窗口,激活token被高亮。正负对比用来写:给定该特征时,何种上下文使专家被选中。重叠模式合并,真正不同的情形分开。Appendix J给出完整提示词。
解释如何打分
- 评分改编自AutoInterp Detection。正例窗口至少有一个token路由到该专家;负例从该专家从未被选的窗口均匀抽取。正例高亮被路由token;负例随机高亮,数量从正例高亮数的经验分布采样。
- scorer判断是否至少一个高亮token在上下文中匹配解释。Appendix J把0–4分中≥2视为正例,再与真实路由标签比较,报告F1。Lookup基线不用scorer:高亮token落在该专家最常共现的top-100 token中则为正。
- 分数按每层全部专家计算,每专家15个正例、85个负例,正例率15%。作者称这接近k/E≈12.5%(gpt-oss:k=4,E=32;OLMoE:k=8,E=64)。explainer为Claude Sonnet 5,scorer为GPT-5.6 Luna,经Delphi调用。
检验SSH的聚类
- 每专家取top n=20个最能预测其激活的SAE latent,为其最激活例子生成解释,用all-MiniLM-L6-v2嵌入后做k-means。轮廓系数选出K≈50。G(Ei)是这n个latent所占的不同簇数。DSH预测G=1;SSH预测G趋向n。
论文做了哪些实验?
gpt-oss-20b(s=128)解释F1为0.492,OLMoE-1B-7B为0.602。
实验设置
- 被解释模型:OLMoE-1B-7B(16层,E=64,k=8)与gpt-oss-20b(24层,E=32,k=4)。
- SAE:OLMoE在层3、7、11、15上,用OLMoE-mix-0924的100M token激活训练Top-K SAE,32,768个特征,s=32。gpt-oss使用Lin(2025)的BatchTopK SAE,层4、8、12、16、20,131,072个特征,s∈{64,128}。
- 数据:路由分析与解释打分收集Pile激活。Appendix D处理约10M token、16个Pile子集。路由探针用约1M token。
- 解释流程:每专家top-45个梯度归因特征;explainer为Claude Sonnet 5,scorer为GPT-5.6 Luna。每专家15正例、85负例。Appendix J将scorer的0–4分中≥2视为正例。
- 基线:Unigram/Bigram Lookup(top-100共现token),Unigram/Bigram AutoInterp,Expert Activations AutoInterp,Expert Impact AutoInterp。路由预测另有匹配稀疏度的neuron basis与PCA basis线性探针。
- 指标:解释分数是scorer二分类的F1;路由预测是各专家F1的macro-F1。论文未报告解释分数的重复次数。
主结果
Figure 4正文给出的跨层mean F1如下。gpt-oss-20b的0.492对应s=128;OLMoE的SAE为s=32,正文未再标稀疏度。
方法 gpt-oss-20b OLMoE-1B-7B Unigram Lookup 0.299 0.342 Expert Impact AutoInterp 0.383 0.305 RouterInterp 0.492(s=128) 0.602 - 作者称两个模型的每个被评估层都高于这两类基线。Figure 4图注写,相对Unigram Lookup的mean F1约高65%(gpt-oss-20b)与约76%(OLMoE-1B-7B),相对Expert Impact AutoInterp约高28%(gpt-oss-20b)。贡献列表写0.49/0.60,Section 4.4写0.492/0.602。
- Table 1只报告gpt-oss-20b。作者称把token统计交给LLM复述,mean F1只从0.30/0.31升到0.35/0.42;Expert Activations AutoInterp与Bigram AutoInterp同为0.417。按SAE特征分组后precision/recall为0.47/0.64(s=64,mean F1 0.495),bigram为0.39/0.59,全窗口为0.30/0.81。作者称对稀疏度稳健(s=64为0.495,s=128为0.492);Table 1中s=128并非每层更高,层8为0.509对0.542,层20为0.448对0.470。
- 作者称Expert Impact在gpt-oss-20b上为0.383,低于只展示激活窗口的0.417;在OLMoE上为0.305,低于Unigram Lookup的0.342,且19%专家的描述过窄、分数恰好为0。Herbst et al.报告的F1>0.8来自另一设置。作者给出对照:始终预测激活的分类器在10/10平衡下F1为0.67,在本文15%正例率下为0.26。
叠加特化的聚类
- 测了什么:每专家top n=20个预测latent,解释经all-MiniLM-L6-v2嵌入后k-means,K≈50。G为所占簇数。DSH预测G=1,上界为20;随机分配约16.6簇。
- 结果:Figure 2中,gpt-oss-20b层20的平均G为11.3,OLMoE-1B-7B层15为10.8。
- 作者解读:作者称这远高于DSH的1,又略低于随机,因而专家仍有一些主题连贯性,但跨多个不相交微域,并据此支持SSH。Appendix D的图注称,Pile子集上的专家路由偏好密度集中在语料比例(虚线为1)附近;个别专家对Github或ArXiv有尖峰,大于4.0的值被截断。作者称这与「专家领域等于Pile子集」的DSH不符。
路由预测探针
- Table 2:约1M token上的macro-F1。OLMoE层11/gpt-oss层12:SAE为0.740/0.730,unigram为0.564/0.296,bigram为0.633/0.356,neuron探针为0.666/0.586,PCA探针为0.680/0.536。探针稀疏度与SAE匹配(OLMoE s=32,gpt-oss s=128)。
- Table 3:s=128时,SAE在五层中的四层高于neuron与PCA。层16例外:neuron为0.559,SAE为0.439。作者称该层SAE重建最差,也是匹配稀疏度下neuron探针超过SAE基的唯一一层。
- Table 4:保留的每token特征数m从1增到128时,F1大体上升。层20从0.280到0.789,层16从0.089到0.439。作者称五层中有四层在m=128达到峰值;层4的m=64为0.576,m=128为0.569。
人工评估
- 测了什么:Appendix H在gpt-oss-20b层12取150个text/context对、25个专家,每例两名人类标注者,并与LLM scorer比较。
- 结果:Human–Human一致率0.807±0.070,Cohen's κ为0.487±0.165;Human–LLM为0.857±0.050与0.602±0.150。
- 作者解读:作者称二者相当,该差异没有统计显著性,因而把LLM scorer当作人类可解释性判断的代理。标注者为每例两人。
其他消融与分析
- Figure 5:梯度归因在gpt-oss五层、各特征集大小n上都高于ρ-usefulness与余弦;均值在约50个特征之后上升变缓。
- Figure 6:n从25到45,解释约增90 token,分数约升0.03;评估点为n∈{1,5,15,25,45}。
- Table 8:探针只按top-k成员做二分类训练。Spearman ρ在层8/12/20为0.809/0.741/0.817;层4为0.258,层16为0.413;MSE约0.03。
- Appendix G:gpt-oss层16的FVU最高,s=64为0.232、s=128为0.191;对应路由macro-F1从0.297到0.439。
- OLMoE的FVU在层3/7/11/15为0.007、0.024、0.064、0.218;死特征在层3为4.11%,层7/11/15为0.51%、0.59%、0.51%。
- 正文举例:解释常把专家写成无关特征的逻辑析取,如预处理指令与香料,或医疗状况与电子元件。Appendix K给出层12 Expert 2的示例。
有什么可以进一步探索的点?
作者称方法依赖SAE质量,并希望扩展到更大MoE与功能路由。
作者指出的局限与后续方向
- 方法效果依赖SAE与自动解释流水线的质量;作者称更高的FVU对应更弱的路由预测(Section 5.1,指向Appendix G)。
- 聚合更多特征时自然语言解释变长;作者认为进一步压缩解释,或用Neuronpedia一类特征看板做交互展示,可能有用(Section 5.1)。
- 评测在OLMoE-1B-7B与gpt-oss-20b、1B–20B参数范围;作者希望后续扩展到更多参数、共享专家,以及Expert Choice等不同路由(Section 5.1)。
- 作者提出尚未检验的问题:共同路由是因为输入相似,还是因为需要相似的下游变换,并希望后续检验功能路由假说(Section 5)。
- 作者把「专家为何收敛到特定特征组合,以及负载均衡或容量约束是否迫使专家之间冗余」列为开放问题(Section 7)。
- 作者希望追踪训练checkpoint上路由如何出现,并类比发展性可解释性中对注意力头特化的研究(Section 7)。
实验覆盖范围
- 解释与SAE分析覆盖OLMoE-1B-7B的层3、7、11、15,以及gpt-oss-20b的层4、8、12、16、20(Section 4.3)。
- 解释分数按每层全部专家计算,每专家15个正例与85个负例,正例率15%(Section 4.3)。
- 路由预测探针在约1M token上训练并报告macro-F1(Appendix B,Table 2);Pile子集分析处理约10M token、16个子集(Appendix D)。
- 人工对照在gpt-oss-20b第12层的25个专家、150个例子上完成,每例两名人类标注者(Appendix H)。
- 论文写明gpt-oss的batch size未报告(Section 3.2脚注);论文未报告解释分数的重复次数。
总结一下论文的主要内容
作者报告gpt-oss-20b(s=128)与OLMoE的解释F1为0.492、0.602。
RouterInterp用SAE特征解释稀疏MoE的专家路由,并对照两种特化假说。
- 问题:若每个专家掌管一个连贯领域,路由本应可被人理解。作者称按token共现或输入主题的分析并未稳定得到这种模式,因而区分DSH与SSH:后者认为专家对应多个语义上不相交的微域。
- 做法:梯度归因选出每专家一组互不重叠的SAE特征,解释实验用top-45。explainer根据「特征激活且路由到该专家」与「特征激活但未路由」的窗口写一段解释;scorer在15%正例率的留出窗口上计算F1。同一套latent也用于路由预测探针和微域聚类。
- 解释分数:作者报告mean F1在gpt-oss-20b(s=128)为0.492,在OLMoE-1B-7B为0.602;Unigram Lookup为0.299与0.342,Expert Impact AutoInterp为0.383与0.305(Figure 4正文)。贡献列表中的对应数字是0.49与0.60。作者称相对token统计的检测准确率约高65%。
- 特化证据:层20与层15上,top-20预测latent的平均簇数G为11.3与10.8,上界20,DSH预测为1(Figure 2)。作者认为这支持SSH。层12的SAE路由预测macro-F1为0.730,层11的OLMoE为0.740(Table 2);层16是匹配稀疏度下neuron探针高于SAE的例外。
- 作者结论:作者认为专家高度多义,先前解释困难与隐含的单义假设有关;并认为SAE在这里用于发现未知的路由相关特征。作者同时写明效果依赖SAE质量,并把功能相似性、训练过程中的特化,以及更大MoE,列为后续问题。