评测与基准arXiv 2610.06406
AgentMonBench:面向长时程智能体行为监控的软件工程基准
提出 AgentMonBench 评测长时程编程智能体监控并检验 EBG
- arXiv
- 2610.06406
- 发表
- 层
- 应用层
- 被测模型
- GPT-5.6 Luna、GPT-5.6 Terra、GPT-5.6 Sol 等 8 个
- 防御监控与审计
- 风险Agent 危险操作
- 组件监控器
摘要AgentMonBench 评测后果性决策监控,EBG 组织证据。
长时程软件工程任务里,用户要判断智能体哪些选择值得核验。作者用 AgentMonBench 评测监控器,并用免训练的 EBG 组织带源证据。