研究:任务难度决定思维链是装饰还是承重
From Decorative to Load-Bearing: Task Difficulty Shapes the Causal Role of Chain-of-Thought
AI 导读
论文提出基于续写的因果测试:扰动一个推理步骤、截断思维链并强制模型从被破坏的前缀继续生成,衡量思维链对最终答案的承载程度(不同于机制忠实性)。在 Gemma-2-9B-IT、Llama-3.1-8B-Instruct 和 DeepSeek-R1-Distill-Qwen-7B 上测 GSM8K、MMLU 和 BIG-Bench Hard,承载性随模型相对任务难度变化:简单任务上模型静默绕过自身推理,困难任务上则跟随被破坏的步骤传播错误。任务难度压倒扰动类型:从 GSM8K 到 BBH 多步算术,错误传播增加 16 倍,98.8% 的可解释偏差归于任务难度;推理专用 RL 会抑制错误传播。作者指出这给基于思维链的监督带来结构性问题:轨迹易读处信号少,关键处错误在监控介入前已传播;隐藏状态上的线性探针能读出这些模式,但激活引导最多只翻转约 25% 的错误传播情形。
论文速读
- CoT prompting 被广泛提议用于监控模型推理,但只有当写出的推理链因果地约束答案时监控才有意义。已有工作显示模型常不忠实:合理化偏见答案、很少承认提示依赖,而机制层面的证据又难以规模化。
- 提出 continuation-based causal testing:把 CoT 解析成步骤,扰动其中一步、截断,再强制模型从被污染的 prefix 继续,比较新答案与原始答案。据此把行为分为 silent bypass、self-correction、error propagation 三类,并训练 hidden-state 探针、尝试 additive activation steering。
- 在 Gemma-2-9B-IT、Llama-3.1-8B-Instruct、DeepSeek-R1-Distill-Qwen-7B 上跑 GSM8K、MMLU、BBH:CoT 的 load-bearingness 随模型相对任务难度上升,从装饰性转为承重。n=28,584 的方差分解把 98.8% 可解释偏差归给任务难度、0.8% 归给扰动类型。探针能读出行为类型,但 additive steering 基本无法翻转类型。
- 规模限于 8–9B 指令微调模型,未测 ≥70B;一次只扰动一步;A/B 标签边界主观,三种标签的人类一致率仅 76%,BBH 的 Type C 标签存在校准偏差。作者提出多步一致扰动、causal scrubbing、attention-circuit 干预等方向。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
论文用扰动续写实验量化思维链对答案的因果约束,并给出难度主导的方差分解,为思维链监控的适用边界提供可迁移方法。