MADBench:多智能体辩论安全性评测基准发布
MADBench: Benchmarking the Security of Multi-Agent Debate
AI 导读
研究者提出 MADBench,用于系统评估多智能体辩论(MAD)在多种攻击下的安全性。该基准按 MAD 工作流建立分层攻击分类,涵盖已有攻击和针对辩论设计的新策略,在 356 个源任务、3958 个测试用例上评估了六个攻击家族对最终答案和对抗影响传播的作用。结果显示,受攻击时 MAD 未必提升 LLM 推理能力:在问答任务中相比单智能体基线可缓解对答案准确率的攻击,但在问答和工作区任务中都会放大未授权读写;即便五个智能体中三个合谋,也只在 28.30% 原本答对的任务上把最终答案由对改错,辩论过程中仅 3.26% 初始正确的诚实智能体转向错误答案。