跳到正文
原文
Goodfire Research·· 2025-12-05

Goodfire 研究:特征流形存在下的稀疏自编码器扩展

Understanding Sparse Autoencoder Scaling in the Presence of Feature Manifolds - Goodfire

AI 导读

Goodfire 研究探讨了在特征流形存在时稀疏自编码器(SAE)的扩展行为。研究指出模型在奖励作弊时自身能够察觉,并可在大规模上被捕获。该工作还涉及用块稀疏特征化器揭示视觉模型的神经几何结构。

阅读原文goodfire.com