跳到正文
原文
Transformer Circuits(Anthropic 可解释性)·· 2025-10-21

Anthropic 揭示模型计数任务背后的流形几何机制

When Models Manipulate Manifolds: The Geometry of a Counting Task

AI 导读

Anthropic 可解释性团队发现,语言模型完成计数任务时存在可被刻画的几何结构,其机制建立在流形之上。该研究聚焦这一基础语言模型行为的内部机理,从几何角度解释模型如何操控流形完成计数。

阅读原文transformer-circuits.pub