论文提出 ISE 框架,评测 LLM Agent 在知识冲突下的认知谦逊
提出 ISE 框架,评测 LLM Agent 在知识冲突下的认知谦逊
- arXiv
- 2610.12360
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Nemotron-Orchestrator-8B、Claude Sonnet 4.6、GPT-5 等 5 个
摘要ISE 轨迹评测显示,四个智能体的高任务准确率并不对应更高的认知谦逊。
作者要测的不是智能体最终答得对不对,而是知识冲突出现时,它有没有在轨迹里认出缺口、做有界的工具跟进,并把没解决的不确定性写给用户。