研究:Agent 更依赖工具报错通道
测量工具调用 Agent 对显式报错与静默损坏的检测和恢复
- arXiv
- 2610.10062
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- claude-haiku-4.5-thinking、claude-haiku-4.5、deepseek-r1 等 6 个
摘要作者称智能体看错误通道而非返回内容,静默损坏更少被当作问题。
作者在 BFCL 多轮可执行环境上注入一次工具层故障,把注意到、改计划、恢复和重复分开记分,而不是只看任务有没有做完。
另有 244 篇论文还没打上分类标签,暂不在筛选结果里。
测量工具调用 Agent 对显式报错与静默损坏的检测和恢复
作者在 BFCL 多轮可执行环境上注入一次工具层故障,把注意到、改计划、恢复和重复分开记分,而不是只看任务有没有做完。
提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体
提出 AgentTime 基准,评测智能体按时长工作与估时能力
AgentTime 是对智能体时间自控的评测:预测任务耗时、按要求时长工作、事后估计已用时间。
提出 AdvSim2Real,协同训练网页智能体抵御页面注入
提出 ParanoiaEval 评测编码智能体的不必要风险处置
作者提出 ParanoiaEval,并称它是编码智能体风险处置能力的首个统一基准。要解决的问题是:证据已经确定风险应如何处置之后,智能体仍可能扩大验证、增加保护或备份,而现有评测要么只看功能正确性,要么把相关行为拆开研究。做法是把 NIST 的 ATMA 落到仓库任务。
提出 HERA,协同演化 harness 与环境以提升 Agent 拒答准确性
HERA 在模型权重固定时,让 harness 与可执行环境按失败协同演化,以改进 agentic abstention。
提出 Inspect Robots,在真实机器人上评测具身模型的能力与拒答
提出危害窗口与区间指标,统一评测分解攻击和提示注入下的智能体滥用监视
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
提出 SWE-CC 基准,评测编码 Agent 对仓库贡献策略的遵守
SWE-CC 评测编码智能体是否遵守仓库贡献策略,而不只看补丁能否通过测试。
提出选择性长时程精炼,筛选轨迹以提升终端智能体训练可靠性
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
揭示工具型智能体判定无用后仍不停止检索,并检验强制整合纠正效果
本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。
提出 Perturbot 扰动训练,打破 VLA 的模态捷径
Perturbot 是一套不改推理的 VLA 训练期数据干预,用来削弱模态捷径,并用离线分数区分“任务变好”和“靠捷径变好”。
评测 ReAct 工具调用对多模态模型拒答有害请求的削弱
论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。
提出 Persona Guardrail,强制客服智能体守住功能边界
Persona Guardrail 是客服向智能体的同步运行时防御:先写明功能边界,再决定放行或拦截,而不是只检测某一攻击类。
提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性
SceneFactory-3D 是 GPU 批处理的多智能体驾驶仿真器,用来在场景和控制器固定时只改路面物理,并比较闭环结果。
重测提示注入检测器在 Agent 工具输出上的检出与任务阻断
摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
构建 Agent Error Dataset,把智能体自然失败转为诊断与修复训练数据
AED是一个面向文本智能体的错误–诊断集合,用来把失败轨迹转成可分析、可训练的诊断与修正,而不是只保留最终奖励。
提出 FAIL BANK,用运行时 CBF 反馈自进化更新 VLA 策略
提出只训练或篡改多智能体潜在通信链路来提高有害遵从
学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。
提出 ReSAIL,用选择蒸馏与特权保留缓解智能体自蒸馏崩塌