研究:SAE 相关性恢复的特征最高 77% 因果无效
From Geometric Recovery to Causal Validation: A Reproducible Audit of Sparse Autoencoder Features, from Superposition Geometry to Causal Inertness
AI 导读
研究者 Mohamed Abdessalem Bal 对稀疏自编码器(SAE)的评估实践提出质疑:领域主流的余弦相似度恢复指标衡量的是解码器几何对齐,而原子是否真正激活由编码器与 TopK/ReLU 选择决定,二者是两种不同的经验主张。在真值完全已知的合成模型上,作者对每个相关性恢复的特征施加消融与符号正确的引导干预,发现退化 SAE 中通过余弦 ≥0.90 恢复门槛的特征最高 77% 因果无效,训练良好的 SAE 中为 9%,无效匹配的余弦最高达约 1.000。对已发布的生产 SAE(GPT-2-small,83 个概念,单 hook 层)的审计在小规模上复现了定性模式(恢复特征中 14% 因果无效),并发现少数解码器原子在数十个语义无关概念中反复成为最近匹配,在三个独立构建的概念批次中复现。
推荐理由
论文在已知真值的合成模型上对 SAE 特征做消融与引导验证,量化了相关性恢复与因果有效性的差距,并给出可复用的审计工具。