研究:工具型智能体判断结果无用却仍继续检索,强制整合步骤可纠正
在检索失效实验中,7个智能体判定结果无用达97–100%却多耗尽预算,框架强制连续5次无用即答使各模型成功率上升。
- 97–100%7个模型在HotpotQA与FEVER侧信道将失效结果判为无用的比例(正文§3)
- 1/292HotpotQA持续失效下,无干预Qwen3-8B连续5次判为无用后作答的问题比例(Figure 1)
- +0.097HotpotQA test300上,强制规则相比无干预使Claude Haiku 4.5 mean6提升值(Table 15)
探究工具检索连续失效时,智能体能否识别无效证据并将判定转化为停止检索动作。
梳理不可靠工具、搜索停止机制、智能体弃权及知行差距四类相关工作与对比。
通过受控失效环境分离判定、信念与动作,设计时间匹配对比量并引入框架强制整合规则。
实验表明智能体准确判定失效却鲜少主动停止,框架强制整合规则使多模型成功率上升。
作者指出合成替换失效、阈值设定、自报告测量及记忆错误等局限,未来需探索真实自然失效。
论文揭示智能体判定工具失效却无法转化为停止行动,证实通过框架规则强制整合判定可提升表现。