跳到正文
原文
arXiv:可解释性· arXiv:2609.07681· Yuval Koren·· 24 天前

Mamba 的召回缩放定律:基于哈希的理论与机制可解释性研究

On the Recall Scaling Laws in Mamba: A Theoretical and Mechanistic Study via Hashing

AI 导读

研究从机制可解释性角度逆向出 Mamba 执行联想召回(AR)的内部算法,发现其通过隐式学习线性哈希函数完成召回,并定位了实现该行为的底层电路。受 Johnson-Lindenstrauss 引理等保相似哈希理论启发,作者提出"召回缩放定律"框架,可依据词表规模和上下文中事实数量,预测 Mamba 实现完美召回所需的嵌入与状态维度、给定模型维度下的召回成功概率,并分析多层模型与多头 SSM 模式。实验表明该理论预测准确,揭示了 AR 能力随词表、状态、嵌入规模和架构的缩放规律。

阅读原文arxiv.org