跳到正文
原文
arXiv:可解释性· arXiv:2610.07389· Hadi Vafaii, Tejas Rao, David Chanin, Thomas Fel, Jacob L. Yates, Bruno Olshausen, David Klindt, Dileep George, Miguel L\'azaro-Gredilla·本站收录 · 原文发表 日期未标

BeFOND 将稀疏自编码器的推断与学习统一为自然梯度流

Inference and learning in sparse autoencoders as natural gradient flow

AI 导读

研究提出 BeFOND,一个无编码器的稀疏编码模型,把稀疏自编码器的推断与字典学习统一为同一变分自由能上的自然梯度流。该方法用循环 explaining away 减少重叠特征之间的干扰,并用 Fisher 预条件补偿稀有特征学习偏慢的问题。在合成数据上,其字典恢复与稀有特征检测优于 amortized 基线,且随叠加程度提高优势扩大;在语言模型激活上,单特征概念检测与选择性干预优于预训练参考 SAE,所用训练数据明显更少。其特征质量随字典宽度继续提升,而所评估的基线大多趋于停滞。

阅读原文arxiv.org