Anthropic 解读机械可解释性中的变量与可解释基
Mechanistic Interpretability, Variables, and the Importance of Interpretable Bases
AI 导读
Anthropic 的可解释性团队提出将神经网络逆向工程类比于编译二进制程序的逆向工程,主张寻找并理解可解释神经元——相当于程序中的变量——才是机械可解释性的中心任务而非众多问题之一。该观点指出参数本身就是神经网络的有限描述,因此不必穷举高维输入空间即可理解网络行为,但也意味着这项工作的难度至少等同于逆向大型复杂程序,不应期待简单答案或固定流程。