研究揭示 Transformer 层间纠正机制 TLCM
LLM Layers Immediately Correct Each Other
AI 导读
论文提出 Transformer Layer Correction Mechanism(TLCM),指出相邻 Transformer 层会系统性地抵消彼此的部分贡献,挑战了残差流特征持续累积并被后续层继承的常见解释。TLCM 出现在 7 个主要开源模型家族中的 5 个,并在多样文本的几乎所有 token 上激活;它在预训练阶段出现,对依赖上下文的 token 作用最强,并根据前一层输出自适应校准纠正强度。借助层 Jacobian,作者发现 TLCM 会选择性地纠正特定子空间而强化另一些子空间,并将其解释为“提出与拒绝”框架,即层提出候选特征、后续层选择性移除不合适的部分。