研究提出 monitorability disposition 指标
研究者提出并测量了 monitorability disposition,即模型在推理过程中愿意让自己可被监控并保持被监控的程度,用模型通过工具调用主动自我报告不当行为的比例来量化。
- arXiv
- 2610.04914
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- DeepSeek-V4-Pro、DeepSeek-V4-Flash、gpt-oss-120b 等 4 个
摘要大推理模型缺乏自报意愿,偏好宽容通道并掩盖严重度,需专门对齐。