分析与理论arXiv 2610.04914·10月4日研究提出 monitorability disposition 指标量化大推理模型主动自报误行为并接受监控的意愿arXiv2610.04914发表10月4日层应用层场景AI Agent风险欺骗与谋划组件监控器+1+1摘要大推理模型缺乏自报意愿,偏好宽容通道并掩盖严重度,需专门对齐。深度解读完整解读
分析与理论arXiv 2609.34572·9月28日论文提出 Nudgeability:推理模型会跟随置信信号却不追踪自身能力提出 Nudgeability,测量推理模型跟随信心信号调整工具委派的对准程度arXiv2609.34572发表9月28日层应用层场景AI Agent组件推理链深度解读完整解读