评测与基准arXiv 2610.07359
论文实测 Agent 工具调用门控栈的失败相关性
提出 nmult 指标,测量智能体动作门禁堆叠的错误相关性与等效层数
- arXiv
- 2610.07359
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- GPT-5.5 (gpt55)、claude-haiku-4-5-20251001、claude-sonnet-5 等 6 个
- 组件护栏与评审
摘要论文实测发现大模型裁判间错误显著相关,作者主张按机制选型并在整栈层面度量防护增益。
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。