评测与基准arXiv 2610.07359
论文实测 Agent 工具调用门控栈的失败相关性
提出 nmult 并评测 Agent 动作门禁堆叠的错误相关性
- arXiv
- 2610.07359
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- AgentTrust runtime (174 rules)、GPT-5.5 (gpt55)、claude-haiku-4-5-20251001 等 7 个
- 风险Agent 危险操作
- 组件权限与沙箱
摘要论文实测发现大模型裁判间错误显著相关,作者主张按机制选型并在整栈层面度量防护增益。
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。