Goodfire Research·2025-12-05 20:44· 2025-12-05Goodfire 梳理机制可解释性领域的开放问题Open Problems in Mechanistic Interpretability - GoodfireAI 导读Goodfire 发布《机制可解释性中的开放问题》,梳理该领域尚未解决的研究难题。其研究还显示,模型在奖励作弊时自身"知道",并可被大规模检测;同时提出 Forking Fast 方法高效估计文本生成中的不确定性动态,并用块稀疏特征器揭示视觉模型的神经几何结构。阅读原文goodfire.com#可解释性#观点/讨论