分析与理论arXiv 2610.04914
研究提出 monitorability disposition 指标
量化大推理模型主动自报误行为并接受监控的意愿
- arXiv
- 2610.04914
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Kimi K2.6、DeepSeek-V4-Pro、DeepSeek-V4-Flash 等 4 个
摘要大推理模型缺乏自报意愿,偏好宽容通道并掩盖严重度,需专门对齐。
量化大推理模型主动自报误行为并接受监控的意愿
摘要大推理模型缺乏自报意愿,偏好宽容通道并掩盖严重度,需专门对齐。
分析隐蔽推理在思维链监控下的信息足迹下界与不可读性
摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。