用路由稀疏自编码器解耦语音编码器中的语言学与副语言学信息
Disentangling Linguistic and Paralinguistic Information with Routed Sparse Autoencoders
路由TopK SAE把冻结SPEAR与WavLM的稀疏码分成语言和副语言通路,独立探针上两类因子分别留在对应通路。
- 自监督语音编码器把音素、说话人、情感和韵律放在共享表示里,选择性解释或改写单个属性困难。已有语音SAE主要分析被发现的特征,稀疏本身也不保证单元对应事先选定的因子。
- 在冻结的SPEAR与WavLM上,TopK SAE用互补掩码把稀疏码分成语言通路与副语言通路。前者由音素识别监督,后者由说话人、情感和韵律监督,并用梯度反转对抗压低交叉因子。比较固定预算与配额冻结。
- 探针上音素更多留在语言通路,说话人、情感和韵律更多留在副语言通路。LibriSpeech训练的SPEAR不重训表示,迁到MSP-Podcast仍保持该模式。250对交换转移被交换因子;去掉对抗后交叉因子又可恢复。
- 论文未专门讨论局限。覆盖冻结SPEAR XLarge与WavLM Large,以及LibriSpeech和MSP-Podcast上的独立探针;干预与对抗消融写的是SPEAR。未报告γ、λrecon、重复次数和探针与人工的一致性。
- 被测模型
- SPEAR XLargeWavLM Large
- 基准
- LibriSpeech train-clean-100MSP-Podcast
- 指标
- PERSID accuracyUARF0 correlationenergy correlationreconstruction MSE
研究将 TopK 稀疏自编码器与路由专属监督、跨因子对抗训练结合,在冻结的 SPEAR 和 WavLM 语音编码器上分离语言学与副语言学信息。独立探针显示,语言学信息在语言学路由中更强,说话人身份、情感、韵律等副语言学因子则保留在副语言学路由中,并在语言学路由中被大幅削弱。在 LibriSpeech 上学到的路由组织无需在表示侧重训练即可迁移到 MSP-Podcast,特征空间的路由干预还能在基本保留未改动路由信息的同时转移被交换的因子。
深度解读
这篇论文试图解决什么问题?
SSL语音表示缠住语言与副语言信息,路由SAE试图按预定因子拆开。
自监督语音编码器把语言信息与副语言信息放在同一纠缠表示中,难以按因子做选择性解释、去除或修改。
- 场景: 作者称自监督学习已是语音表示学习的核心:编码器从大量无标注音频学习表示,并支撑音素识别、自动语音识别、说话人识别、情感识别和韵律相关预测。同一激活可同时携带音素内容、说话人身份、韵律和其他信息,因而难以选择性解释或控制单个属性。
- 现有不足: 解耦已用扰动不变性、信息瓶颈、架构机制和对抗训练处理。稀疏自编码器把稠密表示映射成更宽的稀疏码并重构原表示,但作者称稀疏不能保证单元对应事先选定的因子;字典可依赖宽度和训练选择,重构目标也不必恢复预定分解。作者称已有语音与音频 SAE 研究主要分析被发现的特征,而不是在显式解耦目标下把稀疏码路由到任务特定子空间。
- 要检验的问题: 冻结 SSL 编码器上的 SAE 稀疏码能否被组织成语言通路与副语言通路,并做到因子特异性保留与抑制。语言通路对应音素和转写信息;副语言通路对应说话人身份、情感和韵律。
- 本文做法: 把 TopK SAE、单元级路由、通路特异性任务监督和跨因子对抗结合起来,在冻结的 SPEAR 与 WavLM 上用独立探针、跨语料评测和表示层通路干预检查这一组织。
有哪些相关研究?
论文把缺口放在:用显式解耦目标把SAE稀疏码路由到预定通路。
自监督语音表示
- wav2vec 2.0(Baevski et al., NeurIPS 2020)、HuBERT(Hsu et al., 2021)、WavLM(Chen et al., 2022)和语音基础模型大规模评测(Yang et al., 2024):论文用它们说明 SSL 表示同时支撑音素、识别、说话人、情感和韵律相关任务。SPEAR(Yang et al., ICML 2026)与 WavLM Large 是本文实际使用的冻结编码器。
语音表示解耦
- 论文把 ContentVec(Qian et al., ICML 2022)、三重信息瓶颈(Qian et al., ICML 2020)、SpeechTripleNet(Lu et al., ACMMM 2023)、对抗式多因子声音转换(Wang et al., Interspeech 2021)和域对抗训练(Ganin et al., JMLR 2016)概括为扰动不变性、信息瓶颈、架构机制和对抗训练。论文没有逐篇写这些方法与本文的差别。
稀疏自编码器
- Bricken et al.(2023)用字典学习分解语言模型;Parra(IJCNLP 2025)、Mariotte et al.(ICASSP 2026)和 AudioSAE(Aparin et al., EACL 2026)分析自监督语音或音频模型中的可解释稀疏特征。作者称这类语音与音频 SAE 工作主要分析被发现的特征。
- 论文称稀疏不能保证事先选定的因子,并引用 Leask et al.(ICML 2025)与 Peng et al.(ICML 2026):字典可依赖宽度和训练选择,重构目标不必恢复预定或规范分解。
- 实现上使用 k-sparse 自编码器(Makhzani and Frey, ICLR 2014)和 Gao et al.(ICLR 2025)的 TopK SAE 与 AuxK;可学习路由使用 Gumbel-Softmax(Jang et al., ICLR 2017)。
基线与数据
- 基线方法: 重建-only SAE、固定路由、配额冻结,以及 Eta-WavLM(Ruggiero et al., Findings of ACL 2025)。后者从 ECAPA-TDNN 嵌入拟合仿射说话人分量,并从 WavLM 表示中减去。
- 基准/数据集: LibriSpeech(Panayotov et al., 2015)与 MSP-Podcast(Busso et al., 2026)。评测协议另引用 Elazar and Goldberg(EMNLP 2018):论文称不能把训练时对抗器当作信息已被移除的证据。
作者把本文的位置放在:在显式解耦目标下,把 SSL 语音编码器上的 SAE 稀疏码组织成语言与副语言通路,而不是只分析事后发现的特征。
论文如何解决这个问题?
TopK SAE用互补掩码、通路监督和跨因子对抗,把稀疏码拆成两条通路。
在冻结 SSL 编码器上训练 TopK 稀疏自编码器,再用互补掩码把活跃单元分成语言通路 zL 与副语言通路 zP。编码器全程冻结;SAE、路由掩码和任务头联合训练。实验报告的是固定路由、配额冻结和重建-only;配额冻结在冻结步之前学习归属。
编码器与 TopK SAE
- 输入是帧级表示 xt。两种编码器都先对每层做无参数 LayerNorm,再均匀平均。线性层得到预激活,TopK 保留 k 个单元作为 zt,再线性解码重构 xt。重构损失是逐帧均方误差。
- TopK 固定活跃个数,不对保留激活做收缩。AuxK 用未入选单元预测重构残差,用来减少死单元。实验设置中字典宽度 K=5120,k=256,AuxK 预算 64,AuxK 权重 1/32。
- SPEAR 的重建-only 与固定路由训练 12,000 步;WavLM 配置为 12,000 步,配额冻结为 16,000 步。论文未写 SPEAR 配额冻结的总步数。
单元路由
每个隐单元进入且只进入一条通路。学习路由时,掩码是跨帧、跨话语共享的全局向量。
z_L = m_L \odot z_t,\ z_P = m_P \odot z_t该式表示同一稀疏码被互补掩码拆开,且每个单元的两个掩码之和为 1。因此 zt 等于 zL 与 zP 之和,完整稀疏码仍重构编码器表示。
- 学习赋值: 单元有可训练 logit,硬分配由 straight-through hard Gumbel-Softmax 得到。路由损失是各单元 softmax 路由分布的熵,最小化它鼓励接近确定的分配。论文未给出温度。
- 固定路由: 归属预先指定,kL 与 kP 分开且相加为 k,训练中不变。实验用连续的 KL/KP=4096/1024 个单元,活跃预算 kL/kP=240/16。作者称该设置来自验证集上目标因子保留与跨因子抑制的权衡。
- 配额冻结: 先由全局 TopK 选出每帧 k 个激活并学习全局归属;到 step 4,000 固定归属,用 20 个采样训练 batch 的平均活跃划分确定 kL 与 kP,之后各通路内分别做 TopK。
任务监督与跨因子对抗
- 音素标签由转写得到,使用 CMU 发音词典,缺项用字素到音素回退,词表 74 个符号。zL 用 CTC 做音素识别。zP 接受说话人分类、带类别权重的情感分类,以及帧级 log-F0 和均值中心化 log-energy 的韵律均方误差。说话人与情感先做时间均值池化。论文未给出情感类别权重的数值。
- 音素对抗器作用在 zP;说话人、情感和韵律对抗器作用在 zL。梯度反转层前向为恒等,反向梯度乘以 −γ。论文未给出 γ。
Ltrain=λreconLrecon+λAuxKLAuxK+Ltask+Ladv
该式是总训练目标。学习路由时再加路由损失。式中 Ltask 与 Ladv 没有额外系数;论文给出的 AuxK 权重为 1/32,未给出 λrecon。
探针与干预如何计分
- 探针在冻结表示上事后训练,参数与 SAE、路由掩码和训练时对抗器完全分开。论文引用 Elazar and Goldberg,称不能把训练时对抗器当作信息已被移除的证据。指标是 PER、SID 准确率、情感非加权平均召回 UAR、F0 与能量相关,以及 xt 与重构之间的均方误差。
- 干预使用固定的 250 对留出 recipient–donor 话语,说话人不同,时长差至多 10%,两种路由模型共用。供体通路在归一化话语时间上线性插值,以匹配受体帧数。P-swap 用受体 zL 加重采样的供体 zP;L-swap 相反。重组码经冻结 SAE 解码器得到 SPEAR 特征。音素与说话人评估器只在不相交的未交换重构上拟合。
- 报告的百分比包括:P-swap 后仍为受体音素、L-swap 后不再是受体音素、L-swap 后匹配供体音素,以及 P-swap 后被判为供体说话人、L-swap 后仍为受体说话人。
论文做了哪些实验?
独立探针与通路交换中,音素更多留在zL,说话人与韵律更多留在zP。
实验设置
- 编码器: 冻结 SPEAR XLarge 与 WavLM Large。每层无参数 LayerNorm 后均匀平均。另评测 Eta-WavLM:由 ECAPA-TDNN 嵌入拟合仿射说话人分量,再从 WavLM 表示中减去。上游编码器在 SAE 训练中保持冻结。
- 数据: LibriSpeech train-clean-100。音素识别用 dev-clean 验证、test-clean 评测。闭集说话人识别在 train-clean-100 内按话语不相交划分,各划分同一 251 个说话人。MSP-Podcast 评测音素、说话人、情感和韵律。
- SAE 与训练: K=5120,k=256,AuxK 预算 64、权重 1/32。固定路由为连续 4096/1024 个单元,活跃预算 240/16。配额冻结在 step 4,000 锁定归属。SPEAR 的重建-only 与固定路由训练 12,000 步;WavLM 为 12,000 步,其配额冻结为 16,000 步。论文未写 SPEAR 配额冻结总步数,也未写优化器、学习率、γ、λrecon 和重复次数。
- 对照: 重建-only、固定路由、配额冻结,以及 Eta-WavLM 相对 Raw WavLM。Section 4.1 写 Table 1 的 SAE 在 LibriSpeech 或 MSP-Podcast 之一上训练。
- 判定: 事后独立探针,不使用训练时对抗器的参数。指标为 PER、SID 准确率、情感 UAR、F0 与能量相关、重构 MSE。论文未指定命名的 LLM 裁判,也未报告人工一致性。
- 干预清单: 250 对,结果只报告 SPEAR(Table 2)。
主结果
下表只取 Table 1 的 LibriSpeech 列,对应在 LibriSpeech 上训练的 SAE。重建-only 没有 zL/zP,未放入表内。表中 PER、SID 按 Table 1 抄录。
| 模型与路由 | zL PER | zL SID | zP PER | zP SID | | SPEAR XLarge 固定 | 10.02 | 6.2 | 99.60 | 99.8 | | SPEAR XLarge 配额冻结 | 8.94 | 0.6 | 80.26 | 99.8 | | WavLM Large 固定 | 10.68 | 0.8 | 94.81 | 99.6 | | WavLM Large 配额冻结 | 9.40 | 14.8 | 80.84 | 99.8 |
- 作者称重建-only 仍保留语言与副语言信息,稀疏本身不产生所选分解;两种编码器上音素信息在 zL 更强,说话人身份在 zP 更强。
- 在 MSP-Podcast 上训练的模型也被作者用来支持同一通路组织。SPEAR 固定路由的 F0 相关为 zL 0.118、zP 0.564,情感 UAR 为 51.71 与 67.40,能量相关为 0.781 与 0.918。WavLM 固定路由的 F0 相关为 0.077 与 0.524,情感 UAR 为 47.95 与 60.12,能量相关为 0.803 与 0.956(Table 1)。
- 作者称固定路由对 zL 的副语言抑制更强,配额冻结对 zP 的语言信息抑制更强,并在重构与选择性上更均衡。Table 1 并不处处同向:LibriSpeech 上 SPEAR 的 zL SID 是配额冻结更低;该语料上 zP 的 PER 是固定路由更高。MSP-Podcast 上配额冻结的重构 MSE 高于固定路由,SPEAR 为 0.171 对 0.146,WavLM 为 0.104 对 0.097。Eta-WavLM 的 hη 相对 Raw WavLM,LibriSpeech PER/SID 从 6.08/97.35 变为 7.25/95.41;作者称其因子特异性抑制弱于路由表示。
跨语料迁移
- 测了什么: LibriSpeech 上训练的 SPEAR 固定路由与配额冻结。SAE 编码器、解码器、路由掩码和配额保持冻结,只另训 MSP 专用的音素与说话人探针。子集为 51,017 条话语、700 个说话人,划分 41,067/4,975/4,975;该闭集 SID 随机水平为 0.143%。
- 结果: 固定路由 zL/zP 的 PER 为 43.92%/99.72%,SID 准确率为 12.82%/82.71%。配额冻结的 PER 为 44.56%/90.38%,SID 为 3.00%/82.29%。
- 作者解读: 作者称两种路由在语料偏移下仍保持相反的通路模式。该段未报告情感与韵律。
受控通路干预
- 测了什么: 250 对留出话语,说话人不同、时长差至多 10%,SPEAR 的两种路由共用。评估器只在不相交的未交换重构上拟合(Section 3.2、Table 2)。
- 结果: 固定路由 / 配额冻结(表头 Freeze)的样本百分比为:P-swap 音素保留 99.57 / 99.16,供体说话人匹配 98.00 / 97.20;L-swap 音素替换 94.26 / 94.12,供体音素保留 99.10 / 98.84,受体说话人匹配 96.00 / 96.80。
- 作者解读: 作者称交换 zP 保留受体音素并转移供体说话人,交换 zL 转移供体音素并保留受体说话人,因而通路在功能上可区分,而不只是统计上可区分。
对抗目标消融
- 测了什么: Table 3 在 SPEAR 上去掉全部对抗项、只去掉说话人对抗或只去掉音素对抗。更低的 zL SID 和更高的 zP PER 被作者用作更强跨因子抑制的读数。
- 结果: 固定路由完整模型的 zL PER、zP PER、zL SID、zP SID 为 10.02、99.60、6.2%、98.6%;去掉全部对抗后为 4.49、66.64、99.8%、100.0%。配额冻结完整模型为 8.94、80.26、0.6%、99.6%;去掉全部对抗后为 4.75、12.36、99.8%、100.0%。只去掉说话人对抗时,两种路由的 zL SID 为 100.0% 与 99.8%。只去掉音素对抗时,zP PER 为 47.82% 与 15.04%,zL SID 仍为 1.6% 与 0.6%。
- 作者解读: 作者称没有对抗器时目标信息仍被保留,但交叉因子也可恢复;说话人对抗器降低 zL 的说话人可恢复性,音素对抗器降低 zP 的音素可恢复性,二者互补。Table 1 中 SPEAR 固定路由 zP 的 SID 为 99.8,Table 3 完整模型为 98.6%,论文未解释这一差异。
其他消融与分析
- LibriSpeech 重构 MSE(Table 1):SPEAR 重建-only / 固定 / 配额冻结为 0.066 / 0.179 / 0.163;WavLM 为 0.043 / 0.113 / 0.108。
- MSP-Podcast 重构 MSE(Table 1):SPEAR 为 0.075 / 0.146 / 0.171;WavLM 为 0.048 / 0.097 / 0.104。
- 重建-only 的完整码在 LibriSpeech 上 PER/SID:SPEAR 6.00/99.6,WavLM 6.84/100.0(Table 1)。
- Eta-WavLM 在 MSP-Podcast 上,Raw WavLM 的 PER/SID/F0 相关为 28.82/74.86/0.637,hη 为 29.80/66.22/0.589(Table 1)。
- MSP-Podcast 上配额冻结 zL 的情感 UAR:SPEAR 60.26,WavLM 53.56;对应 zP 为 67.92 与 60.67(Table 1)。
- Table 3 中,固定路由只去掉说话人对抗时 zP PER 为 85.25%,配额冻结为 86.10%;zP SID 为 99.4% 与 99.2%。
有什么可以进一步探索的点?
论文未专节讨论局限或后续工作。
作者指出的局限与后续方向
论文未专门讨论局限。正文没有 Limitations、Discussion 或 Future Work,结论也没有把某项结果写成不足,或写出计划中的下一步。
实验覆盖范围
- 冻结编码器为 SPEAR XLarge 与 WavLM Large;SAE 使用 K=5120、TopK k=256、AuxK 预算 64(Section 3.1)。
- Table 1 报告 LibriSpeech train-clean-100 与 MSP-Podcast 上的 PER 和 SID;MSP-Podcast 列另有情感 UAR、F0 相关和能量相关。这些 SAE 在其中一个语料上训练。
- 跨语料数字只包括 LibriSpeech 训练的 SPEAR 两种路由,在 MSP-Podcast 的 51,017 条、700 说话人子集上报告 PER 与 SID;表示侧不重训(Section 4.1)。
- 通路干预的数字来自 SPEAR 固定路由与配额冻结,清单为 250 对(Table 2)。对抗项消融来自 SPEAR 的两种路由(Table 3)。Eta-WavLM 与 Raw WavLM 的对比在 Table 1。
- 论文未报告 γ、λrecon、优化器、学习率、重复次数或方差,也未报告探针结构,以及探针与人工判定的一致性。SPEAR 配额冻结的总训练步数未写出;WavLM 配额冻结写的是 16,000 步。
总结一下论文的主要内容
路由SAE在冻结SPEAR与WavLM上分开语言和副语言因子,探针与交换支持通路分工。
TopK SAE 的稀疏码被分成语言通路与副语言通路,用来分开冻结语音编码器里同时存在的音素信息和说话人、情感、韵律。
只重构不能得到作者选定的这一分解。语言通路由音素识别监督,副语言通路由说话人识别、情感分类和韵律预测监督,作用在对方通路上的梯度反转对抗用来压低交叉因子。实验比较预先固定的单元预算,以及先学习归属再冻结配额;编码器是冻结的 SPEAR XLarge 与 WavLM Large。
- Table 1 的 LibriSpeech 独立探针:SPEAR 固定路由 zL 的 PER/SID 为 10.02/6.2,zP 为 99.60/99.8;配额冻结 zL 的 SID 为 0.6。WavLM 固定路由 zL 的 SID 为 0.8,配额冻结为 14.8。
- 在 MSP-Podcast 上训练的 SPEAR 固定路由,F0 相关为 zL 0.118、zP 0.564,情感 UAR 为 51.71 与 67.40。
- 表示不重训时,LibriSpeech 训练的 SPEAR 固定路由在 MSP-Podcast 子集上 zL/zP 的 PER 为 43.92%/99.72%,SID 为 12.82%/82.71%。
- 250 对 SPEAR 交换中,固定路由 P-swap 保留受话人音素的比例为 99.57%,匹配供体说话人的比例为 98.00%(Table 2)。
- 去掉全部对抗项后,SPEAR 固定路由 zL 的 SID 为 99.8%(Table 3)。LibriSpeech 上 SPEAR 的重构 MSE 从重建-only 的 0.066 升到固定路由的 0.179(Table 1)。
作者在结论中称,在合适的归纳偏置下,SAE 可以做出通路选择性分离;通路交换进一步说明两条通路的功能角色不同。