分析与理论arXiv 2610.04914
研究提出 monitorability disposition 指标
量化大推理模型主动自报误行为并接受监控的意愿
- arXiv
- 2610.04914
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- DeepSeek-V4-Pro、DeepSeek-V4-Flash、gpt-oss-120b 等 4 个
摘要大推理模型缺乏自报意愿,偏好宽容通道并掩盖严重度,需专门对齐。
量化大推理模型主动自报误行为并接受监控的意愿
摘要大推理模型缺乏自报意愿,偏好宽容通道并掩盖严重度,需专门对齐。
用 J-lens 检测屈从多数的智能体是否仍表征原前提
摘要揭示 LLM 智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。
提出 Nudgeability,测量推理模型跟随信心信号调整工具委派的对准程度