跳到正文
原文
arXiv:对齐与欺骗· arXiv:2609.33144· Jia Liang·· 5 天前

循环 Transformer 长度泛化的机制与边界:MR-Loop 与 DR-Loop 的机制对比研究

Beyond the Training Horizon: Mechanisms and Limits of Length Generalization in Looped Transformers

AI 导读

研究机制性对比了两种循环 Transformer 配置 MR-Loop 与 DR-Loop,在多项式迭代、有限状态组合和知识图谱遍历任务上分析其长度泛化机制。MR-Loop 在固定读出下更新中间状态,通过相邻 token 交互推进关系选择;DR-Loop 则跨关系位置传播中间状态,形成推进式计算前沿。两者在更深层均不可靠:MR-Loop 读出状态与进度线索退化,DR-Loop 状态传播可靠性下降,且有限的自纠正使局部错误持续累积。循环状态还编码内容的计算状态,可迁移的 live-consumed 与 fresh-aged 残差方向因果控制信息能否参与后续计算,且长度泛化不必依赖忠实的逐步推理。

阅读原文arxiv.org