研究:思维链对答案的约束随模型相对任务难度而变化
作者通过扰动续写发现CoT承重性随难度上升:Gemma在GSM8K错误传播率3.9%,在BBH达40.9%。
- 94.5%Gemma-2-9B-IT,GSM8K,旁路率(Table 1)
- 40.9%Gemma-2-9B-IT,BBH,错误传播率(Table 1)
- 98.8%Gemma-2-9B-IT,序贯模型已解释离差中难度项占比(Table 5)
探究思维链是否真正因果约束最终答案,发现思维链承重性随任务难度提升而由装饰性向承重性转变。
围绕思维链忠实性行为分析、机制可解释性与模型自我修正展开,本文在可扩展的因果扰动与表征分析上确立定位。
提出基于续写的因果测试协议,通过单步扰动与截断续写度量思维链承重性,并结合探针与激活引导检验其表征与可控性。
作者在被测模型和正确多步基线中比较难度、扰动、表征与干预;结果支持承重性与模型相对难度相关,但不构成跨模型的普遍因果规律。
汇总作者明确提出的模型规模、单步扰动与标签噪声等局限,并客观梳理实验覆盖的边界。
在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变;这种单向承重性不能等同完整机制忠实性。