研究:任务难度决定思维链是装饰还是承重
论文提出基于续写的因果测试:扰动一个推理步骤、截断思维链并强制模型从被破坏的前缀继续生成,衡量思维链对最终答案的承载程度(不同于机制忠实性)。在 Gemma-2-9B-IT、Llama-3.1-8B-Instruct 和 DeepSeek-R1-Distill-Qwen-7B 上测 GSM8K、MMLU 和 BIG-Bench Hard,承载性随模型相对任务难度变化:简单任务上模型静默绕过自身推理,困难任务上则跟随被破坏的步骤传播错误。任务难度压倒扰动类型:从 GSM8K 到 BBH 多步算术,错误传播增加 16 倍,98.8% 的可解释偏差归于任务难度;推理专用 RL 会抑制错误传播。作者指出这给基于思维链的监督带来结构性问题:轨迹易读处信号少,关键处错误在监控介入前已传播;隐藏状态上的线性探针能读出这些模式,但激活引导最多只翻转约 25% 的错误传播情形。
推荐理由论文用扰动续写实验量化思维链对答案的因果约束,并给出难度主导的方差分解,为思维链监控的适用边界提供可迁移方法。