分析与理论arXiv 2610.04914
研究提出 monitorability disposition 指标
量化大推理模型主动自报误行为并接受监控的意愿
- arXiv
- 2610.04914
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- DeepSeek-V4-Pro、DeepSeek-V4-Flash、gpt-oss-120b 等 4 个
摘要大推理模型缺乏自报意愿,偏好宽容通道并掩盖严重度,需专门对齐。
量化大推理模型主动自报误行为并接受监控的意愿
摘要大推理模型缺乏自报意愿,偏好宽容通道并掩盖严重度,需专门对齐。
用因果审计检验视觉工具观察是否真正改变答案
对六个 thinking-with-images 模型做因果审计,检查 crop-and-zoom 返回的观察是否中介最终答案。
分析零训练 LLM+OVOD 流水线中 CAAP 与 SNAP 分离的来源
提出 Nudgeability,测量推理模型跟随信心信号调整工具委派的对准程度