论文发现隐式推理中的引导失效:隐式到语言的转换鸿沟
When Steering Fails in Latent Reasoning: A Latent-to-Language Transition Gap
AI 导读
论文发现,对连续思维(隐式 CoT)做激活引导,对后续语言生成的影响明显弱于对显式 CoT 的引导,即使隐层表征被移动的幅度相当。作者首先确认任务信息在连续思维中仍可识别,据此提出隐式到语言的转换鸿沟假设,即隐空间中的干预效果无法传递到语言生成。两项进一步结果支持该假设:输出分布在转换边界处发生突变,任务相关方向在隐式 CoT 中的双向控制力远弱于显式 CoT。作者认为转换接口是评估和设计未来隐式引导方法的核心目标。