跳到正文
原文
论文追踪· arXiv:2610.07359·本站收录 · 原文发表 精选关注度55

论文实测 Agent 工具调用门控栈的失败相关性

Evaluate the Stack

AI 导读

论文在 1119 条标注的 Agent 动作上测量运行时门控栈的失败相关性,覆盖一个确定性规则层和四个 LLM 判官,且不设自适应攻击者。作者提出 nmult 指标,把观测到的联合漏检率换算成等效独立层数:在 STRICT 定义下任意两个判官组合约等于 1.22 至 1.44 层,规则层加一个判官约等于 1.86 至 2.09 层,两组区间在合并数据上分离,但单个语料上点估计分裂、区间重叠。单独准确率无法预测一层给栈带来的增量,一个云端规则包把规则层单独漏检率从 0.139 降到 0.111,却未增加任何新的联合覆盖。难度对判官耦合的贡献份额不可识别,随难度探针和漏检定义在 31.8% 到 61.8% 之间变动。研究还报告了两个改变结论的评测约定:review 判定算拦截还是算漏检使五项结论反转,以及一个判官层在 112 个批次中有 50 个由非请求的模型版本服务。

深度解读生成中

推荐理由

论文用 1119 条标注动作实测 Agent 运行时门控的失败相关性,给出规则层与 LLM 判官组合的等效独立层数,可迁移到门控栈选型。

阅读原文arxiv.org