跳到正文
原文
arXiv:对齐、欺骗与监督· arXiv:2610.03509· Samuel Lewis-Lim, Xingwei Tan, Mario Sanger, Zhixue Zhao, Nikolaos Aletras·本站收录 · 原文发表

高效推理训练并非总损害思维链忠实性与可监控性

Efficient Reasoning Training Does Not Always Harm CoT Faithfulness and Monitorability

AI 导读

研究团队用三种施加长度压力的方法微调多类模型,考察高效推理训练对思维链忠实性与可监控性的影响。三种方法分别是固定生成预算、按样本设定长度目标和组相对长度奖励。结果显示,两者受影响的方式不同:忠实性在多数设置下下降,主要因为训练后的模型一致性变差;可监控性更稳健,即使思维链大幅缩短,模型仍会承认输入干预对答案的影响。

阅读原文arxiv.org