评测与基准arXiv 2610.02741
研究系统评估循环语言模型的思维链可监控性
系统评估循环语言模型加深 loop 后的 CoT 可监控性
- arXiv
- 2610.02741
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Ouro-1.4B-Thinking、Ouro-2.6B-Thinking、Nanbeige4.2-3B 等 10 个
摘要加深 loop 可在部分压力测试任务降低可监测性,循环架构本身并不必然更难监测。
这项工作评估 LoopLM 的 CoT 可监测性:加深共享层的重复次数,以及“有循环结构”本身,会不会让决策关键因素更少出现在可监测文本里。