跳到正文
原文
Goodfire Research·· 2025-12-05

Goodfire 梳理机制可解释性领域的开放问题

Open Problems in Mechanistic Interpretability - Goodfire

AI 导读

Goodfire 发布《机制可解释性中的开放问题》,梳理该领域尚未解决的研究难题。其研究还显示,模型在奖励作弊时自身"知道",并可被大规模检测;同时提出 Forking Fast 方法高效估计文本生成中的不确定性动态,并用块稀疏特征器揭示视觉模型的神经几何结构。

阅读原文goodfire.com