MAStrike:用 Shapley 值引导多智能体系统协同红队攻击
MAStrike: Shapley-Guided Collusive Red-Teaming on Multi-Agent Systems
MAS TRIKE用Shapley选联盟做共谋红队,k=2时Claude Opus 4.7平均ASR为61.8%。
攻击者要让MAS执行正常情况下会被拒绝的目标工具。
- 分层MAS把安全检查分到多个角色,共谋和跨智能体协调扩大了攻击面。现有红队靠启发式选目标、扰动孤立消息,既不量化各智能体对系统安全的贡献,也不生成协同绕过分布式检查的攻击。
- MAS TRIKE以联盟ASR为价值,抽样估计智能体Shapley值与成对交互指数,再按任务相似度迁移,在预算k下最大化协同得分以选联盟。红队智能体联合生成角色感知注入,执行后按失败诊断迭代。评测环境是自建的MABENCH。
- MABENCH上k=2时,MAS TRIKE平均ASR:Claude Opus 4.7为61.8%(直接优化),GPT-5.5为55.6%、Gemini 3.1 Pro为51.0%(二者为迁移)。Table 2中AiTM均为0.0%。
- 论文未单列局限。覆盖三个骨干、三域与k=2;AiTM和MAS TRIKE在Claude Opus 4.7上优化后迁移。金融Shapley穷举,工程与CRM抽样。护栏为CRM上3个场景、超过1000轮。未报告τ与重复次数。
- 威胁模型
- 攻击者要让MAS执行正常情况下会被拒绝的目标工具。已知角色、通信拓扑和智能体间输入输出,无模型参数。可在预算k内攻陷不含目标工具所属智能体的子集,经提示注入、工具操纵、环境注入或其组合,借通信间接影响目标智能体,并允许跨功能组共谋。
- 被测模型
- Claude Opus 4.7GPT-5.5Gemini 3.1 Pro
- 基准
- MABENCH
- 指标
- ASRBSR
研究者提出 MAStrike,一个针对分层多智能体系统(MAS)的闭环协同红队框架,通过智能体级 Shapley 值分析量化每个智能体对系统鲁棒性的边际贡献,据此识别脆弱智能体联盟并生成角色感知的协同对抗操纵。攻击通过结构化因果诊断迭代优化,将失败案例归因于阻断攻击的未受损智能体。作者还构建了覆盖金融、软件工程和 CRM 等分层拓扑与领域的 MAS 红队基准和可控环境。在基于多个前沿模型构建的 MAS 上,MAStrike 显著优于启发式基线,并揭示出此前单智能体或模板化方法忽略的高阶交互结构与关键漏洞。
深度解读
这篇论文试图解决什么问题?
分层MAS的共谋攻击面缺少定量选目标与协同注入,作者提出MAS TRIKE。
分层多智能体系统把检查分散到多个角色上,现有红队既不定量归因各智能体对系统安全的贡献,也不生成可协同绕过这些检查的攻击。
- 场景:作者称分层MAS正用于金融、软件工程等高风险流程。safety与security分布在角色化子智能体上,权限提升、跨智能体共谋等协调类风险使攻击面扩大。
- 现有不足:作者称现有MAS红队靠角色描述、拓扑或人工直觉选目标,并扰动孤立消息流,因此答不出谁对系统安全最负责,以及被攻陷智能体如何协同绕过防御。
- 假设:作者认为攻击成败取决于哪些智能体被攻陷,以及它们如何协调出相互强化、能绕过系统级防护并造成伤害的行为。
- 本文做法:提出闭环框架MAS TRIKE,以及覆盖金融、软件工程、CRM的基准MABENCH。作者称这是首个智能体级Shapley分析:以ASR为联盟价值,选脆弱联盟,生成角色感知的协同操纵,并按失败诊断迭代。
- 威胁模型:
- 目标:诱导正常操作下会被拒绝的不安全或违反策略的系统行为。每个恶意任务对应一个敏感或受限动作的目标工具;MAS执行该工具以达成恶意目标即成功。
- 知识:已知结构,含角色与通信拓扑,并可见智能体间输入、输出消息;无底层模型参数。
- 能力:可攻陷S⊆A,且排除直接关联目标工具的智能体,预算|S|≤k。通道为提示注入、工具操纵、环境注入或其组合;攻击须经智能体间通信间接影响目标智能体。
- 共谋:允许跨功能组的协同操纵,并将其作为核心攻击机制。
有哪些相关研究?
相关工作是启发式MAS红队、Shapley归因和单智能体安全基准,基线为四个红队方法。
MAS红队
- 论文把已有MAS红队概括为恶意内容注入、说服、操纵智能体特质和基于通信的攻击,引用Huang等(2024)、Amayuelas等(2024)、Zhang等(2024)、He等(2025)、Gu等(2024)。论文指出这些方法靠启发式选择攻击智能体,且不建模智能体之间的联系。
- Hammond等(2025)归纳可能提高系统失败风险的三类行为:conflict、miscoordination、collusion。论文指出他们未提出度量这些失败的方法,也未利用这些行为改进MAS。
Shapley值与归因
- Shapley(1953)给出合作博弈中的价值;Lundberg与Lee(2017)用它归因特征重要性。
- LLM侧有token级归因(Xiao等,2025)和句法单元归因(Amara等,2024)。多智能体侧,Wang等(2020)用Shapley值分配合作博弈奖励,Ruggeri等(2024)给出智能体的局部与全局解释。
- 论文把区别写成:本文的近似不只用于功劳分配或归责,而是用来组建能共同完成任务的智能体联盟。引用里的抽样估计包括Castro等(2009)以及Jia等(2019)、Kang等(2022),正文未逐篇展开对比。
智能体安全评测
- AgentHarm、AgentDojo、ToolEmu主要评估单智能体安全。论文称明确用于安全评测的MAS环境较少,并引用TAMAS(Kavathekar等,2025)。
- 论文称本文提供同时含良性与恶意任务的MAS基准。
基线方法与基准
- 实验基线为TAMAS(人工对抗后缀)、GCA(基于模板的共谋提示;Tao等,2026)、AutoTransform(用LLM重写智能体画像)、AiTM(基于反思的攻击优化)。论文称基线通常按角色描述做启发式选智能体,并做自适应红队。评测用作者构建的MABENCH,而不是上述单智能体基准。
作者把MAS TRIKE放在启发式选目标的MAS红队和只做归因的Shapley工作之间:用智能体级Shapley同时度量个体重要性与成对协同,并据此做共谋红队。
论文如何解决这个问题?
以联盟ASR估计Shapley值与交互,选预算内联盟后闭环生成协同注入。
给定恶意任务q和攻陷预算k,MAS TRIKE先用智能体级Shapley值决定干预哪里,再用红队智能体决定被攻陷智能体如何协同。
问题设定
- 系统记为M=(A, E, T):智能体集合、通信拓扑、分角色工具集。请求被分解并按角色委派,经E协作后给出规划与输出。
- 联盟C的价值是该任务下的攻击成功率:vq(C)=ASRq(C)。数值越高,表示该联盟下系统越容易被攻破。
- Section 3.2以执行目标工具为成功;Section 6.1的ASR还要求MAS不拒绝请求。被攻陷集合不含直接关联目标工具的智能体。
智能体级Shapley分析
- 先按拓扑和角色手工设计代表性恶意场景,再扩展成任务集,用来估计联盟级ASR。
- 全联盟枚举是指数复杂度,故按样本组抽样;作者称复杂度降到次线性。对抽样联盟,覆盖被攻陷智能体的输出,使其给出协调、完全对抗但外观良性的响应,其余智能体正常行动。
- ϕi(q)是ai对ASR的期望边际贡献。成对交互指数Iij(q)衡量同时攻陷ai与aj时,ASR是否高于二者单独效应之和。二者作为后续选联盟的信号。
- 金融可攻击集|A|=6时穷举幂集并精确计算。工程与CRM用分层样本,覆盖联盟大小0、1、2、3及部分更大联盟,再做权重重归一化的Monte Carlo估计(附录A)。实验中每域抽64个联盟,优先小联盟;Shapley用每域4个workflow、各20个任务。
相似度迁移与选联盟
- 在样本任务上预计算,推理时嵌入任务指令、取质心、算余弦相似度,再以温度τ的softmax加权,得到目标任务的个体值与交互指数。论文未给出τ。
- 在大小为k的联盟中最大化个体项与成对交互项之和:Ck⋆(q)=argmax|C|=k(∑ai∈ Cϕ̂i(q)+∑{ai,aj}⊆ CÎij(q))。作者称这样同时偏向高影响智能体和正交互强的组合。
- Figure 1标注KNN检索相似任务并聚合协同得分;正文4.2写的是对样本任务集做加权,未给出邻居数。
闭环生成与失败诊断
- 红队智能体对选中联盟一次性联合生成操纵,通道包括提示注入、工具操纵、环境注入及其组合。作者称联合生成是为了让各智能体的信号相互一致,以通过交叉检查。
- 攻击在完整MAS上执行。设计的judge判断成败并给出结构化反馈。失败则诊断阻塞条件并改注入,直到成功或预算耗尽。Algorithm 1的循环上界写为Imax;附录D的成本表使用Tmax=3。论文未说明二者是否同一预算,主文也未给出Imax。
- 除非另有说明,红队智能体骨干为Gemini 3.1 Pro。AiTM与MAS TRIKE先在Claude Opus 4.7上优化注入,再迁到GPT-5.5与Gemini 3.1 Pro;论文称这是为了在不能直接访问目标模型时做black-box比较。
MABENCH
- 三域均为树状三层:主编排器、组级协调器、专家智能体。工具经MCP沙箱,可确定性重置。作者称成功攻击需要跨角色协调,而不是只攻陷单个智能体。
- 良性任务覆盖合法操作;恶意任务针对正常操作下应被阻止的敏感动作,并按风险类别报告ASR。智能体、工具与任务类别见附录C。附录B给出三域良性轨迹和成功攻击轨迹。
论文做了哪些实验?
k=2时MAS TRIKE对Claude Opus 4.7的平均ASR为61.8%,迁至GPT-5.5为55.6%。
实验设置
- 骨干:MAS骨干为GPT-5.5、Gemini 3.1 Pro、Claude Opus 4.7。除非另有说明,红队智能体骨干为Gemini 3.1 Pro。
- 基准:MABENCH。良性workflow为金融10个、工程14个、CRM评测套件10个,每个20个实例,全文良性例数为200、280、200。恶意任务为每域手工设计10个原型,各配一个正常时应被阻止的目标工具,并归入风险类别。
- 指标:BSR要求正确协作并调用所需工具;ASR要求不拒绝请求且执行任务特定目标工具。二者都在每个workflow的20个任务上计算,ASR另按风险类别汇总。
- 基线与协议:TAMAS、GCA、AutoTransform、AiTM。Section 6.1写前三者改写原提示后直接在各目标模型上评测;AiTM与MAS TRIKE先在Claude Opus 4.7上优化,再迁移。Table 2标题则把该表红队结果写成在Claude上直接优化,GPT-5.5与Gemini 3.1 Pro报告迁移ASR。
- 归因设置:Shapley分析为每域4个workflow、各20个任务,每域抽样64个联盟,优先小联盟。主攻击表的预算为k=2。
- 评审:良性用基于执行的judge,附录C.3还核对proceed决策与期望工具调用。恶意用结构化judge,核对动作是否写入环境状态。论文未写评审LLM名称、重复次数或人工一致性。
主结果
据Table 2,k=2,平均ASR(%)。GPT-5.5与Gemini 3.1 Pro按该表标题为迁移结果;Claude Opus 4.7为直接优化。
表格较宽,可左右滑动
MAS骨干 MAS TRIKE TAMAS GCA AutoTransform AiTM GPT-5.5 55.6 2.3 2.8 1.0 0.0 Gemini 3.1 Pro 51.0 15.3 14.0 19.4 0.0 Claude Opus 4.7 61.8 0.0 0.0 1.0 0.0 - 作者称各模型、各域上MAS TRIKE都高于基线,并称k=2下无协调或启发式扰动大多无效。Table 2的反例是Gemini 3.1 Pro的工程PSB:TAMAS与GCA为60.0%,AutoTransform为73.3%。
- 作者称工程与金融的差距更大,MAS TRIKE的ASR经常高于70%–100%。同表CRM更低,例如GPT-5.5的PCV为2.5%;Claude Opus 4.7的PCV、UDA、FFR为27.5%、25.0%、35.0%。
- AiTM在三个骨干的各类别均为0.0%。作者称在k=2且针对Claude Opus 4.7时,这显示该方法面对更强前沿模型的多智能体设置时效果有限。
良性任务
- 测的是三骨干完成合法workflow的BSR(Table 1)。平均BSR:Gemini 3.1 Pro为72.3%,Claude Opus 4.7为69.6%,GPT-5.5为64.8%。作者称Gemini最高。
- 三模型在工程的Code Changes、DevOps、Data Operations上均为100.0%。CRM的Deal & Opportunity为0.0%、2.5%、0.0%(顺序为GPT-5.5、Gemini 3.1 Pro、Claude Opus 4.7)。
- 作者称当前LLM MAS能完成结构化、工具驱动的流程,而在需要长程推理和跨智能体一致的CRM上更困难。
联盟规模与Shapley
- Figure 3画Claude Opus 4.7上ASR随联盟大小k的变化,横轴标有2、3、4、5,图例为TAMAS、GCA、AutoTransform、AiTM、MAStrike (Ours)。正文未给出各k的具体ASR。作者称MAS TRIKE在小联盟时已高于更大k的基线,且ASR随k单调上升;启发式选智能体时,更大联盟可能因消息冲突而使ASR下降。
- Figure 4给出三域、若干workflow的智能体Shapley分布,横轴为Shapley ϕi,范围为0.0到1.0,零值智能体被省略。作者称分布偏斜,只有少部分智能体贡献大,且高影响智能体随任务变化;例如交易检索智能体在支付相关workflow中关键,在其他任务中重要性低。
- Figure 5的色标为Iij,可见端点-1.00与1.00;图注又写单元格是组成智能体对的ASR,与正文所称的交互指数不一致。作者称高Shapley并不意味着成对协同强,并举工程PII泄漏任务:data engineer与SRE的Shapley值高,但成对交互弱。Figure 6给出三域的成对指数。
企业护栏案例
- Section 6.5把若干Salesforce企业护栏组成轨迹级检测器,输入为完整MAS轨迹。对象是CRM域MAS TRIKE的3个协同攻击场景,合计超过1000个对话轮次,做事后分析。论文未给出各护栏的原始准确率表。
- 作者称,相互一致的跨智能体信号会减少检测器通常依赖的信号,使对抗执行在结构上像良性轨迹。
- 作者称检测随联盟和风险类别而不同:一些护栏在不同联盟之间的检测准确率为两倍,不同风险类别之间有15%的准确率差。作者还称,缺口常常来自一串各自看起来合理的决策,而不是单步异常。
其他消融与分析
- 附录D、金融、k=2、Tmax=3:MAS TRIKE直接攻击每例1.48次MAS执行、2.95次改写调用;迁移为1.00与0.00。AiTM为2.94与5.89;AutoTransform为1.00与2.00;TAMAS、GCA为1.00与0.00。
- 该成本表写AiTM与MAS TRIKE成功即早停,否则最多跑到Tmax;迁移复用直接攻击的注入库,改写调用为0。
- Claude Opus 4.7上TAMAS、GCA平均ASR为0.0%,AutoTransform为1.0%,其非零格只有CRM的PCV 10.0%(Table 2)。
- 论文未对GPT-5.5上MAS TRIKE的PCV为2.5%、而工程PSB为100.0%给出单独解释。
有什么可以进一步探索的点?
论文未写出局限、讨论或后续工作小节。
作者指出的局限与后续方向
论文未专门讨论局限。提供的正文、结论和附录没有单列的Limitations、Discussion或Future Work,也没有把某项结果写成作者自己的不足或计划中的后续实验。
实验覆盖范围
- 被测MAS骨干为GPT-5.5、Gemini 3.1 Pro、Claude Opus 4.7,共3个;红队智能体骨干为Gemini 3.1 Pro(Section 6.1)。
- 域为金融、软件工程、CRM。主ASR按风险类别报告,预算k=2(Table 2);BSR按任务类别报告(Table 1)。BSR与ASR都在每个workflow的20个任务上计算。
- 基线为TAMAS、GCA、AutoTransform、AiTM。Section 6.1写AiTM与MAS TRIKE的注入在Claude Opus 4.7上优化后迁到另两个骨干,前三个基线在各目标模型上直接评测。
- 联盟大小曲线只画了Claude Opus 4.7,横轴k为2、3、4、5(Figure 3)。Shapley为每域4个workflow、各20个任务、64个联盟;金融可攻击集|A|=6时穷举,工程与CRM为抽样估计(Section 6.1、附录A)。
- 护栏案例把若干Salesforce企业护栏组成轨迹级检测器,输入为CRM上3个协同攻击场景、超过1000个对话轮次(Section 6.5)。论文未报告温度τ、主文Imax的取值、重复次数,以及评审与人工的一致性;附录D只在金融、k=2、Tmax=3下报告计算量。
总结一下论文的主要内容
作者称MAS TRIKE在k=2时对Claude Opus 4.7的平均ASR为61.8%。
MAS TRIKE是面向分层MAS的共谋红队框架,评测环境是作者构建的三域基准MABENCH。作者称其中的智能体级Shapley分析是首个。
- 问题:安全检查分属多个角色时,启发式选目标和孤立消息扰动答不出该攻陷谁,也生成不出能一起绕过分布式检查的行为。攻击者已知角色、拓扑和智能体间消息,无模型参数;预算k内可攻陷不含目标工具所属智能体的子集,并允许跨功能组共谋。
- 方法:以联盟ASR为价值,抽样估计个体Shapley值和成对交互指数,再按任务相似度迁移,在大小为k的联盟上最大化协同得分。红队智能体联合生成提示注入、工具操纵、环境注入或其组合,再根据执行轨迹中的阻塞条件迭代。金融可攻击集穷举,工程与CRM抽样。
- 攻击结果:Table 2在k=2下,Claude Opus 4.7上直接优化的平均ASR为61.8%;迁到GPT-5.5、Gemini 3.1 Pro为55.6%与51.0%。同表AiTM在三个骨干上均为0.0%。CRM类别低于工程、金融的多个格子,例如GPT-5.5的PCV为2.5%。
- 其他结果:Table 1平均BSR为GPT-5.5 64.8%、Gemini 3.1 Pro 72.3%、Claude Opus 4.7 69.6%。作者称Shapley分布随任务变化,高个体重要性不一定带来高成对协同;Figure 3上作者称MAS TRIKE的ASR随k上升,启发式基线则可能因消息冲突下降。作者还称,CRM轨迹上的企业护栏在不同联盟和风险类别之间检测不一致。
- 作者结论:作者称度量个体重要性与智能体交互,对分层MAS红队是必要的;针对轨迹的护栏所依赖的信号,不一定能直接对应到多智能体设置。