跳到正文
原文
arXiv:对齐、欺骗与监督· arXiv:2610.02741· Han Wang, Ishwar B Balappanawar, Huan Zhang·本站收录 · 原文发表

研究系统评估循环语言模型的思维链可监控性

On the Chain-of-Thought Monitorability of Looped Language Models

AI 导读

研究首次系统评估循环语言模型(LoopLMs)的思维链可监控性。作者在 MonitorBench 的八项任务上,分别考察同一模型族内不同循环深度的影响,以及循环模型与参数量、Transformer 层数或有效深度匹配的非循环模型的对比。在标准与压力测试设置下,特定 Logic、Science、Engineering 的 Cue Answer 任务出现任务相关的可监控性下降,其他任务趋势较弱或性质不同。诊断显示这些下降无法完全由任务难度、验证通过率或生成 token 长度解释,定性样例提示更深循环模型对给定线索的使用或归因方式发生变化。跨模型比较未发现循环模型在同等规模或深度下系统性更难监控的证据。

阅读原文arxiv.org