跳到正文
原文
arXiv· arXiv:2610.04672· Qizhi Chu, Zekai Yu, Sijie Wen, Yang Liu, Chen Qian, Cheng Yang, Chuan Shi, Zhiyuan Liu·本站收录 · 原文发表 日期未标

MASBench:部分可观测条件下的 LLM 多智能体协作基准

MASBench: Benchmarking LLM-based Multi-Agent Collaboration under Partial Observability

AI 导读

针对现有多智能体基准多假设全局可观测、难以系统评估协作机制的问题,研究者提出 MASBench,在部分可观测约束下评测 LLM 多智能体协作。该基准分为 Reasoning、Scheduling、Game 三类递进任务,分别考察 Protocol、Memory、Routing 三种协作机制,并提供性能分数、通信成本与成本效益等确定性指标,在多种 LLM 骨干与机制配置上开展实验,为 MAS 设计提供实证参考。

阅读原文arxiv.org