论文建模多智能体网络中的子智能体继承攻击面
When Child Inherits: Modeling and Exploiting Subagent Spawn in Multi-Agent Networks
作者在OpenClaw 3.13上演示四类继承漏洞,称Table III五模型均复现
假定至少一个智能体已通过提示注入或越狱被攻破。
- 多智能体框架会在生成子智能体时继承父记忆并下放资源与终止权。作者认为一个已被攻破的智能体因此能把恶意指令和过时状态传过信任边界。
- 作者把角色化多智能体网络写成层次、能力、记忆模式和交互模式,并给出终止范围、记忆隔离与资源访问三条不变量。防御是生成后不可变的能力注册表、按角色投影记忆,以及追加式修订日志。
- OpenClaw 3.13的四类PoC分别做成过期验证提交、越权自启动、子智能体沿用父规则和兄弟终止。Table III五模型均复现。Agent Zero与Hermes仅任务型子智能体,跨模式终止按构造不出现。
- 作者称形式模型不含执行语义,且不覆盖非角色或基于身份的访问控制;后续要在确定性边界内用推理,并把防御适配到不同场景。实验为OpenClaw 3.13定性PoC加Table III五模型,论文未报告成功率、重复次数和主PoC的LLM。
- 威胁模型
- 假定至少一个智能体已通过提示注入或越狱被攻破。攻击者只经正常交互通道放入恶意内容,再借委托链和智能体间通信影响下游与未来子智能体。目标是破坏完整性与控制流并造成用户侧有害动作。宿主、操作系统、企业网络和物理攻击不在范围内。
- 被测模型
- MiniMax M2.5Llama-4-Maverick-17B-128E-Instruct-FP8Qwen3.5-PlusDeepSeek-V3.2GPT-5.2-Codex
- 基准
- OpenClaw 3.13HermesAgent Zero M v1.13
- 指标
- 核心漏洞行为复现
论文提出从子智能体继承的角度建模多智能体网络,指出父智能体的记忆会把恶意指令、过期状态或非预期行为规则带入新建子智能体,使局部失陷跨越智能体边界扩散。作者称当前框架在记忆继承不安全、资源控制薄弱、派生后状态陈旧和终止权限不当等方面会违反信任边界,并在真实智能体框架中演示了这些风险,进而提出基于显式安全不变量的防御方案。研究认为继承不只是实现细节,而是影响多智能体系统安全的核心组成部分。
深度解读
这篇论文试图解决什么问题?
作者称子智能体继承会让单点妥协跨越编排层信任边界扩散
一个已被攻破的智能体,能否经子智能体生成时的记忆继承和编排层缺陷,把妥协扩散到多智能体网络。
- 场景:作者称智能体可由其他智能体在运行时持续创建和终止,每次生命周期转换的人类监督有限。继承记忆可把恶意指令、过时状态或非预期行为规则带入新建子智能体,使局部妥协跨过智能体边界。
- 现有不足:作者称提示注入、越狱、投毒检索和恶意扩展等单点攻破已有研究,攻破之后在网络内如何扩散则较少被理解。传统PKI、访问控制列表和防火墙面向相对稳定的主体,不能直接约束动态实例之间的能力传播。
- 核心判断:作者认为当前框架会经不安全的记忆继承、弱资源控制、生成后的陈旧状态和不正当终止权限违反信任边界。这些被归为编排层结构缺陷,而不是某一厂商模型的行为。
- 本文做法:作者给出角色化多智能体网络的形式模型,把记忆隔离、访问控制和终止范围写成可检验不变量,在真实框架上做概念验证(PoC),并提出恢复这些不变量的防御。作者称据其所知,这是对这些问题的首次系统分析。
- 威胁模型:
- 目标:破坏完整性与控制流,造成用户侧有害动作,并影响未来子智能体的创建与协调。
- 知识:不假定攻破宿主、操作系统或企业网络;攻击从应用/智能体层开始。初始提示注入和越狱视为已知,不作为本文对象。
- 能力:至少攻破一个实例;可向输出、中间消息或创建提示注入恶意指令或后门逻辑,再经委托链和智能体间通信影响下游。正常交互通道即可。
- 环境:用户提交良性任务,但通常不能逐项核验中间决策;起始时基础设施未被直接攻破。物理攻击和非智能体通道不在范围内。
有哪些相关研究?
相关工作覆盖单智能体、注入、多智能体攻击与系统级防御,作者把注入成功当作给定前提
LLM与智能体安全
- 模型层综述:Das et al.(2025)与Berini et al.(2026)覆盖模型生命周期中的威胁;OWASP Top 10(2025)把提示注入列为首要风险。
- 智能体系统:Raza et al.(2025)、Lazer et al.(2026)、Sibai et al.(2026)和Wu et al.(2024)把讨论扩到智能体系统与已部署系统。
- 经典原则:Zhang et al.(2025)主张智能体采用最小权限等原则,并呼应Saltzer and Schroeder(1975)。
提示注入
- 直接与间接:Liu et al.(2025)形式化直接注入;论文称其在36个真实LLM应用中攻破31个。Greshake et al.(2023)提出经检索内容的间接注入;Zou et al.(2024)报告RAG可作为投毒向量。
- 工具智能体基准:Yi et al.(2025)、Zhan et al.(2024)与AgentDojo(Debenedetti et al.,2024)为工具集成智能体提供评测。论文称这些基准衡量单个智能体能否被劫持,而本文研究一次注入成功后如何在网络中传播。
- 攻击者最小能力:作者把间接注入当作已给定的入口,不把它本身当作待测对象。
多智能体攻击与供应链
- 传播:Tian et al.(2023)考察智能体级安全;Lee and Tiwari(2024)演示LLM到LLM的传播。论文称Lupinacci et al.(2025)报告,即使模型能抵抗相同的直接注入,对恶意对等请求仍有100% compliance。论文称与这类工作的区别是看框架层而非模型层,并把每条通道写成结构不变量的违反。
- 拓扑与内部威胁:Triedman et al.(2025)将相关失败框为confused deputy。Yu et al.(2024)的NetSafe与He et al.(2025)研究拓扑或通信传播;Shapira et al.(2026)记录混乱失败模式;Lynch et al.(2025)把智能体作为内部威胁考察。
- 协议与技能:Hou et al.(2025)和Song et al.(2025)调查MCP;Louck et al.(2025)考察A2A;Li et al.(2025)指出跨工具采集;Schmotz et al.(2026)测量对恶意SKILL.md的脆弱性。论文称此处把注入成功当作给定,研究载荷进入之后发生什么。
防御与现有基准
- 模型层与提示层:Wallace et al.(2024)的instruction hierarchy属于模型层。Wang et al.(2025)系统化delimiting、spotlighting等提示层防御;论文称这些防御可被绕过。
- 系统层:CaMeL(Debenedetti et al.,2025)用自定义解释器做基于能力的控制与数据流;论文称其在AgentDojo任务上达到67%的可证明安全。Ghosh et al.(2025)提出更宽的框架。Kang et al.(2025)把记忆当作操作系统问题;论文称其没有把隔离写成安全不变量。作者称本文的能力注册表把同一PDP/PEP模式用到角色到资源的映射。
- 基准:AgentDojo、ASB(2024)和AgentHarm(2024)评测单智能体对抗鲁棒性或有害行为。论文称它们不评测层次完整性、智能体间授权和记忆一致性。
基线方法与基准/数据集:论文没有设置可对比的攻击算法基线,也没有在AgentDojo、ASB或AgentHarm上跑实验。对照对象是OpenClaw、Hermes和Agent Zero的架构选择。
作者把本文放在单点注入成功之后,用显式结构不变量解释继承、资源、异步状态和终止,并给出不绑定特定LLM供应商的编排层防御。
论文如何解决这个问题?
用角色化网络形式化三条不变量,并以能力注册表与记忆投影修复违反
作者用角色化多智能体网络刻画根编排者与可递归生成的子智能体,把记忆、资源和终止写成不变量,再把实现偏离映射为四类漏洞,并用同一套机制来修复。
问题设定与形式化
- 网络元组:智能体集合A、根a0、有向父子边E、角色ρ、能力κ、资源宇宙T及角色到资源映射τ、记忆模式μ、寿命λ、交互模式ι。相关能力包括spawn、kill、delegate、access-memory、communicate、user-interact。
- 结构:每个子智能体恰有一个父节点。作者陈述Theorem 1:在该假设下,若每个智能体都可从a0到达,则(A, E)是以a0为根的arborescence。子智能体按任务分工,如规划、检索、监控、工具使用或验证。
- 生命周期:记忆模式为inherit-full、inherit-partial、agent-agnostic;寿命为one-time或persistent;交互为session-based或task-oriented。会话型智能体可在一次会话中挂接多个任务型子智能体。直接与用户交互要求持有user-interact。
- 三条不变量:终止范围写成 Terminate(a, b) ⇒ kill ∈ κ(a) ∧ ((a, b) ∈ E ∨ a = a0),即持有kill,且为直接父节点或根a0。资源访问写成 Access(b) ⊆ τ(ρ(b)),即有效资源不得超出角色授权集。记忆只能按模式取全量、父节点选定子集或空集。正文另称直接父节点与根编排者可终止其后代,默认策略可被逐智能体授权覆盖。
四类结构违反
- 无限制继承:在生成时全量复制上下文的框架中,作者把有效记忆写成与父记忆相同,从而在预期模式不是inherit-full时违反记忆隔离。OpenClaw的sessions_spawn会注入AGENTS.md和TOOLS.md,并把父认证配置作后备合并;作者称实践中子智能体得到聊天历史和工具配置在内的完整运行状态。作者称该传递对会话型后裔无条件成立;任务型后裔仅当受污染片段进入初始化提示才传播,窄提示构成部分屏障。
- 无资源访问控制:调用点不强制角色到资源映射时,有效访问包含框架暴露面。OpenClaw默认给子智能体除sessions_list、sessions_history、sessions_send、sessions_spawn以外的工具,含exec、文件系统、网页浏览和已安装插件。
- 异步分歧:子智能体在生成时刻拿到父记忆快照,之后父记忆更新不同步。持久写入可以是会话历史,或由底层模型自行选择SQLite或MEMORY.md;论文称没有确定性策略。作者称即便继承被收窄,缺少生成后同步仍可利用陈旧上下文,二者正交并可叠加。
- 兄弟终止:会话型子智能体可在自身会话里按自然语言指令终止任务型兄弟。二者没有父子边,行为者也不是a0,违反终止范围。作者称这不需要单独提权,终止是推理层按上下文行动的结果。Table I把后果写成终止或劫持兄弟会话;正文称被攻破者还可能借助过量工具访问接管被终止对等体的职责。
防御机制
- Agent Capability Registry:生成时按角色登记κ(b)与资源集,资源集等于该角色的授权集,登记后不可变。kill只在存在父子边时授予目标。父节点不能授予自己没有的能力或资源。PEP在每次调用时许可或拒绝。作者陈述Theorem 2:资源访问被登记集包住,结构操作必须属于κ(b)。兄弟终止由此被统一检查拦住,不区分命令驱动和指令驱动。
- 角色化记忆投影:父记忆分成带敏感度标签的段,示例格为public ⊏ task-local ⊏ privileged。生成时只保留角色敏感度覆盖其标签的段。作者称载荷只有落在子角色许可内才会进入子记忆,并把写时标注的准确性留作未来工作。
- 修订日志:共享、仅追加的日志记录update或revoke,由父节点控制。子智能体在依据某上下文项行动前,检查该段在快照之后是否被撤销。作者称父节点发出撤销后,生成时带入的载荷即失效,不必重同步整个会话,日志也可作审计。
- 对应:Table II把无限制继承映射到生成时投影,把缺资源控制和兄弟终止映射到运行时注册表,把异步分歧映射到行动前的有效性检查。作者称记忆管理已有工作把记忆当作系统问题,这里更强调安全不变量。
判定方式
- 是否构成漏洞,以行为是否违反对应不变量来观察:不应继承的规则是否被执行,角色之外的资源是否被调用,父状态已变后是否仍按旧快照提交,以及非授权方是否终止对等体。
- 论文未给出数值阈值、评审模型或自动评分规则。模型本身不形式化执行语义、并发和传输协议。
论文做了哪些实验?
作者称OpenClaw 3.13上四类PoC成立,Table III五模型均复现
实验设置
- 主平台:OpenClaw 3.13,运行在Ubuntu Desktop 24.04 LTS容器;大体为默认配置,启用命令行工具以扩展能力。专用Discord服务器供用户与智能体通信。作者称它是GitHub上星标最多的开源个人智能体之一,且设计被后续项目借用。
- 对照框架:Hermes(论文未写版本)和Agent Zero M v1.13。二者被选来对照只使用任务型子智能体的架构。
- 模型:主PoC所用LLM论文未说明。消融为Table III的五个额外厂商模型:MiniMax M2.5、Llama-4-Maverick-17B-128E-Instruct-FP8、Qwen3.5-Plus、DeepSeek-V3.2、GPT-5.2-Codex。
- 对象:四类漏洞各自单独利用。论文没有攻击算法基线,也没有使用AgentDojo、ASB或AgentHarm。
- 判定:观察是否出现论文描述的违规行为,包括文件终态、自启动是否执行、子智能体是否沿用父规则、对等体是否被终止。论文未写评审模型、阈值、样本量或重复次数。
- 环境约束:实验在受控的本地虚拟机或容器中进行;提示、文件和资源为合成,未连接真实账户、生产服务或外部系统。作者称公开前已向维护者报告。
主结果
漏洞 OpenClaw 3.13上的观察 出处 异步记忆分歧 共享资源初值为SAFE;结束后验证结果文件为VERIFIED_SAFE,共享资源为COMPROMISED Figure 3,Section VI-A 无资源访问控制 权限修改、执行和用户级自启动注册未被拦截;重启并登录后载荷自动执行 Section VI-B 无限制记忆继承 被派无关任务的子智能体仍读取并回报更新后的目标文件 Figure 4,Section VI-C 未授权兄弟终止 会话型子智能体终止了仍在执行的任务型兄弟 Section VI-D - 作者称四类问题来自编排层而非模型行为,并且会叠加:继承把载荷送到子智能体,缺访问控制使其能以过量权限执行,异步分歧使父侧补救到不了已生成的子智能体,兄弟终止可去掉承担监督的对等体(Section V-F、Table I)。
- 分歧PoC中,主智能体按自己的缓存视图提交验证,子智能体独立改写同一资源,框架没有在双方动作落定前对账。作者称若资源大或复查成本高,过期的VERIFIED_SAFE可能继续被信任。
- 继承PoC里,父会话中的关键词触发规则在文件内容更新后仍被子智能体执行。作者称子智能体会悄悄继承任务规则、文件访问方式和关键词触发,且继承是实时的;再与缺访问控制结合,恶意提示可传到新建子智能体。兄弟终止PoC中,报告任务为每30分钟一次,跟踪任务为每10秒更新、持续1小时,终止发生在执行途中,且无父授权。
跨厂商消融
- 测了什么:Table III的五个模型接受与前述相同的漏洞测试,用来区分模型行为与框架设计(Section VI-E1)。
- 结果:作者称五个模型都表现出易感性,并复现核心漏洞行为。论文未给出分模型、分漏洞的成功率。
- 作者的解读:作者将这种跨厂商一致性归因于多智能体框架的结构性质,而不是底层模型的共同缺陷;并称更换底层LLM不能带来有意义的安全改进,协调层才是需要修补的主要威胁面。
框架架构对照
- 测了什么:Agent Zero M v1.13与Hermes。二者都不支持会话型子智能体生成,只以任务导向方式实例化(Section VI-E2)。
- 结果:作者称跨模式兄弟终止因此按构造不适用。记忆分歧仍在:任务执行中的工具输出、中间结果和工作区写入不会同步回父节点或对等体,父节点在生成后的更正也不会传到执行中的子智能体。继承比OpenClaw更窄,子智能体从按角色限定的预定义系统提示初始化,而不是全量复制;作者称传递污染的推论并不无条件成立,这构成对记忆隔离的部分非正式执行。
- 作者的解读:二者都未在调用时强制角色到资源映射,作者称资源访问控制违反仍然适用。相对OpenClaw,利用更难,因为交互面更窄,且Hermes在执行关键命令前用关键词检查请求用户确认。作者称这些防御主要保护操作系统级而非工作区级资产,仍依赖LLM内部护栏,并把安全负担转给用户;所看到的安全差别主要来自更小的功能范围,会话型生成和运行时终止是功能缺失而不是被访问控制,继承变窄是惯例而不是强制策略。
其他消融与分析
- OpenClaw子智能体默认工具面排除四个session工具,其余包括exec、文件系统、网页浏览和已安装插件(Section V-C)。
- 持久记忆写入会话历史,或由模型自行选择SQLite或MEMORY.md;论文称无确定性策略(Section V-D)。
- 作者称任务型后裔只有在受污染片段进入初始化提示时才继承载荷(Remark 3)。
- 作者称快照分歧不易表现为可单独检测的异常事件,因为各会话记忆不共享(Section VI-A)。
- 作者称兄弟终止较容易被所有者注意到,因为网络功能中断可被观察,同时仍具破坏性(Section VI-D)。
- 各PoC后的PoC Fix按所提机制说明越权调用会被拒绝、父规则可不被投影、非父节点终止会被拦住、过期修订会使验证不能直接提交;论文未报告这些修复的拦截率或实现后的量化结果(Section VI、VIII)。
有什么可以进一步探索的点?
作者将执行语义、非角色化访问控制和防御适配留作后续
作者指出的局限与后续方向
- 形式模型只覆盖智能体的创建与组合,不形式化前后端角色、执行并发模型或智能体间通信协议。作者称这些运行维度可能引入额外攻击面,例如并发委托中的竞态或不安全传输,但不在本研究范围内。(Section III-F)
- 模型以角色中介资源访问和行为预期,不覆盖能力集相同的无差别智能体,也不覆盖基于身份而非角色的访问控制。作者称扩展到基于属性或基于身份的范式仍是未来工作。(Section III-F)
- 作者称LLM的概率性在分布式系统与多智能体系统之间造成主要缺口。未来工作应尽量把安全建立在确定性系统设计上,同时利用LLM的推理能力,使LLM在受约束的系统边界内运行。(Section VIII)
- 作者称本文聚焦理论建模、防御设计以及所识别漏洞的概念性存在,并称多智能体系统的多样性要求后续研究这些防御如何适配不同场景。(Section VIII)
实验覆盖范围
- 主PoC在OpenClaw 3.13、Ubuntu Desktop 24.04 LTS容器中进行,启用命令行工具,并用专用Discord服务器通信;四类漏洞各自单独利用(Section VI)。
- 跨模型部分为Table III的五个模型,作者称均复现核心漏洞行为;论文未按模型或漏洞给出成功率(Section VI-E1)。
- 架构对照为Agent Zero M v1.13与Hermes。论文说明二者只有任务型子智能体,因而跨模式兄弟终止按构造不适用;记忆分歧和缺少角色到资源映射仍然适用(Section VI-E2)。
- 防御以能力注册表、角色化投影和修订日志作机制说明及PoC Fix。论文未报告这些机制实现后的拦截率、延迟或效用变化。
- 论文未报告主PoC所用LLM、重复次数和查询次数,也未报告Hermes的版本号。
总结一下论文的主要内容
形式化子智能体继承,在OpenClaw上演示四类编排层漏洞并提出防御
作者对多智能体网络里的子智能体继承做形式化分析,并用开源框架上的PoC演示编排层如何让单点妥协继续扩散。
- 问题:一个智能体被攻破之后,父记忆、工具面和终止权会在生成子智能体时传下去。作者认为这使局部妥协跨过信任边界;既有工作更多停在单点注入、协议或单智能体基准。
- 方法:角色化网络规定唯一父节点、角色能力、三种记忆继承、两种寿命和两种交互模式。终止范围、记忆隔离和资源访问被写成不变量。修复手段是生成后不可变的Agent Capability Registry、按敏感度投影记忆,以及父节点控制的追加式修订日志。
- OpenClaw 3.13:共享资源已被改成COMPROMISED时,主智能体仍提交VERIFIED_SAFE(Figure 3)。无关任务的子智能体仍执行父会话里的文件读取规则(Figure 4)。权限修改、执行和用户级自启动未被框架拦截,重启登录后载荷自动执行。会话型子智能体在无父授权下终止了仍在运行的任务型兄弟。
- 其他设置:Table III的五个额外厂商模型均复现核心漏洞行为。作者称Agent Zero与Hermes因为只有任务型子智能体,跨模式终止按构造不出现,继承也更窄,但记忆分歧和缺少角色到资源映射仍然适用;这些差别主要来自更小的功能范围。
- 作者结论:作者称继承不是实现细节,而是影响多智能体安全的中心组件。作者称应尽量让LLM的推理落在确定性系统边界内,并把防御适配到不同场景留作后续。