评测与基准arXiv 2609.39146
MADBench:多智能体辩论安全性评测基准发布
提出 MADBench,评测多智能体辩论是吸收还是放大对抗影响
- arXiv
- 2609.39146
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 被测模型
- gpt-4o、GPT-5、GPT-6 Astra
摘要MADBench 显示辩论能吸收部分准确率攻击,同时放大未授权读写。
MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。
提出 MADBench,评测多智能体辩论是吸收还是放大对抗影响
MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。
提出 FlowReview,用授权配对与确定性提交门控控制多智能体组合信息流
这篇工作把多智能体安全写成一件必须同时成立的事:拦住组合信息所启用的禁止使用,并完成同一场景里任务所需的授权使用。
提出多智能体系统提示注入的威胁模型与四层架构防御
用任务绑定令牌和策略预言机拦住多智能体流水线的未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。