研究:Agent 更依赖工具报错通道
测量工具调用 Agent 对显式报错与静默损坏的检测和恢复
- arXiv
- 2610.10062
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- claude-haiku-4.5-thinking、claude-haiku-4.5、deepseek-r1 等 6 个
摘要作者称智能体看错误通道而非返回内容,静默损坏更少被当作问题。
作者在 BFCL 多轮可执行环境上注入一次工具层故障,把注意到、改计划、恢复和重复分开记分,而不是只看任务有没有做完。
测量工具调用 Agent 对显式报错与静默损坏的检测和恢复
作者在 BFCL 多轮可执行环境上注入一次工具层故障,把注意到、改计划、恢复和重复分开记分,而不是只看任务有没有做完。
提出 AgentTime 基准,评测智能体按时长工作与估时能力
AgentTime 是对智能体时间自控的评测:预测任务耗时、按要求时长工作、事后估计已用时间。
提出 AdvSim2Real,协同训练网页智能体抵御页面注入
提出 ParanoiaEval 评测编码智能体的不必要风险处置
作者提出 ParanoiaEval,并称它是编码智能体风险处置能力的首个统一基准。要解决的问题是:证据已经确定风险应如何处置之后,智能体仍可能扩大验证、增加保护或备份,而现有评测要么只看功能正确性,要么把相关行为拆开研究。做法是把 NIST 的 ATMA 落到仓库任务。
提出 TasteVal 基准,衡量模型设计实验并解释结果的研究品味
评测 coding agent 在非公开漏洞上的利用生成、修复与后续攻击
作者比较编程智能体在利用生成与漏洞修复上的自主表现,并检查修复之后还能不能被攻破。文中的 help 指自主完成任务,不是提升人类操作者。
提出 HERA,协同演化 harness 与环境以提升 Agent 拒答准确性
HERA 在模型权重固定时,让 harness 与可执行环境按失败协同演化,以改进 agentic abstention。
提出 SWE-CC 基准,评测编码 Agent 对仓库贡献策略的遵守
SWE-CC 评测编码智能体是否遵守仓库贡献策略,而不只看补丁能否通过测试。
提出选择性长时程精炼,筛选轨迹以提升终端智能体训练可靠性
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
揭示工具型智能体判定无用后仍不停止检索,并检验强制整合纠正效果
本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。
提出 Perturbot 扰动训练,打破 VLA 的模态捷径
Perturbot 是一套不改推理的 VLA 训练期数据干预,用来削弱模态捷径,并用离线分数区分“任务变好”和“靠捷径变好”。
在 GOAD 上评测 NeuroSploit 编排对 AD 自主渗透的提升
评测 Agent 选择并早期操作高风险生物工具的能力
这项评估测量七个前沿 LLM 智能体与生物工具交互的最早两步:为设计任务选工具,以及在仓库里完成玩具级操作。作者关心的是,有生命科学背景但不会专门操作高风险工具的行为者,能否借此降低门槛。范围限于预测性、生成性工具。
提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性
SceneFactory-3D 是 GPU 批处理的多智能体驾驶仿真器,用来在场景和控制器固定时只改路面物理,并比较闭环结果。
重测提示注入检测器在 Agent 工具输出上的检出与任务阻断
摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
构建 Agent Error Dataset,把智能体自然失败转为诊断与修复训练数据
AED是一个面向文本智能体的错误–诊断集合,用来把失败轨迹转成可分析、可训练的诊断与修正,而不是只保留最终奖励。
提出 FAIL BANK,用运行时 CBF 反馈自进化更新 VLA 策略
提出 ReSAIL,用选择蒸馏与特权保留缓解智能体自蒸馏崩塌
提出 Drift-Bench++ 评测 Agent 在错位沟通和意图漂移下的对齐
Drift-Bench++ 是面向 Interactive Intent Alignment 的可执行基准:智能体要在用户说错、目标会变、耐心有限时,持续跟上当前意图。
测量面向开发者的 MCP 错误信息对工具调用 Agent 恢复的影响
MCP 错误信息里的下一步常常按人类开发者来写,而只能调用服务器工具的智能体会照着做。做不到就结束回合。作者先统计这类文本,再在 BFCL V4 上只更换错误文本,看回合状态能否回到参考调用之后。