CompoSkill 框架利用逐个通过扫描的 Agent 技能组合发起攻击
CompoSkill: Compositional Skill Chain Attacks from Individually Scanner-Passing LLM Agent Skills
研究者提出CompoSkill评估技能组合攻击,在OpenClaw上黑盒数据外发ASR达71.1%,现有扫描器留存至少50%绕过率。
攻击者目标为诱导智能体将良性技能组合成source–bridge–terminal攻击链以产生危害;分为两种知识设定:white-box attacker已知已安装技能池并注入显式skill-id序列;black-box attacker仅知公开市场元数据与用户画像,通过SCG图优化检索高风险链,注入不含skill-id的业务隐式提示词。
- 自主智能体在长程任务中常组装多个专门技能。现有安全审核仅在单个技能粒度独立检测,无法发现多个独立良性技能在运行时组合形成的跨技能数据流与危害攻击链。
- CompoSkill构建技能组合图将技能抽象为能力元组,通过约束k-最短路径图优化搜索源-桥梁-终端攻击链。框架包含注入显式技能调用的白盒攻击者与仅基于业务指令隐式触发的黑盒攻击者。
- 在CompoSkill-Bench上,黑盒攻击最高达成71.1% ASR与80.6% CFR。现有单技能扫描器在严格拦截模式下仍有0.50至0.65的防御绕过率;三技能链因桥梁节点的格式适配比双技能链更易触发。
- 论文未专门设立章节讨论局限与后续方向。实验覆盖了4个模型、2个智能体平台与6个专业场景,但论文未报告评测判定与人工复核的一致性比例及重复运行次数。
- 被测模型
- GPT-5.4Gemini-3.1-flashDeepSeek-V4LongCat-2.0
- 基准
- CompoSkill-Bench
- 指标
- CFRASRUtilityDBR
研究者提出 CompoSkill 框架,利用每个都单独通过市场安全扫描的 Agent 技能,通过组合形成 source-bridge-terminal 风险链实施攻击。白盒攻击者掌握受害者的技能池并注入明确技能序列,黑盒攻击者仅凭角色画像下载市场热门技能、构建 Skill Composition Graph 并搜索不暴露技能 ID 的高风险链。研究者在 OpenClaw 和 Nanobot 两个运行时、五个威胁类别和六个专业场景上构建了 1,140 条记录的 CompoSkill-Bench,风险链形成率白盒最高 83.3%、黑盒最高 80.6%。现有 SkillsGuard、Cisco AI Defense Skill Scanner 和 NVIDIA SkillSpector 在严格拦截模式下仍留下 31.6% 到 40.8% 的链形成率,防御绕过率 0.50 至 0.65。
推荐理由论文提出技能组合层面的攻击框架,说明单个技能通过扫描并不等于组合执行路径安全,可供技能市场与 Agent 运行时的安全评估参考。
深度解读
这篇论文试图解决什么问题?
现有单技能安全扫描存在盲区,多个独立良性技能在运行时组合可形成危害路径。
单一技能独立安全检测无法防范通过技能组合形成的跨技能攻击链。
- 长程任务与技能机制:自主智能体处理长程专业任务时需从市场安装多个专门技能,这些技能赋予智能体文件读写、网络访问、命令执行等系统级权限并承载隐式数据流。
- 逐个扫描的盲区:现有市场审核在单个技能粒度进行检测,作者称即使每个技能单独通过安全审核,智能体也可能在运行时将其编排为有害的源-桥梁-终端链,安全属性在组合时失效。
- 组合攻击框架与基准:作者提出 CompoSkill 攻击框架,结合白盒与黑盒双攻击者系统评估组合风险,并构建了包含 1,140 条记录的 CompoSkill-Bench 基准。
- 威胁模型:
- 攻击目标:诱导智能体将良性技能组合成源-桥梁-终端攻击链,实现数据外发、内存篡改、权限提升、多智能体劫持或资源耗尽等危害效果。
- 攻击者知识:分为白盒攻击者 Aw 与黑盒攻击者 Ab 两种;Aw 获知受害者已安装技能池并注入显式技能标识符序列;Ab 仅知晓公开市场元数据与用户画像,推断工作场景。
- 攻击者能力:黑盒攻击者通过受害者可能遭遇的业务输入注入隐式提示词,不包含任何技能标识符,由智能体规划器自主编排调用。
- 受害系统:运行在 Nanobot 或 OpenClaw 平台上的自主智能体,已从 ClawHub 安装匹配日常工作流的角色技能。
有哪些相关研究?
现有研究多聚焦单技能后门、注入或双节点组合,缺少针对多跳组合攻击的自动化攻防建模。
大语言模型智能体安全与提示注入
- AgentPoison(Chen et al. 2024)通过长期记忆投毒劫持决策;MINJA(Dong et al. 2026)以极小扰动实现记忆注入;Crescendo(Russinovich et al. 2025)通过多轮渐进诱导绕过对齐防御。作者指出这些工作关注单一注入点,未涉及跨技能组合攻击面。
技能与插件生态安全
- BadSkill(Tie et al. 2026)和 PhantomSkill(Lin and Yu 2026)分别通过模型投毒和代码伪装植入后门;Dynamic Malicious Skills(Chen et al. 2026)、SKILL-INJECT(Schmotz et al. 2026)与 SkillJect(Jia et al. 2026)利用技能文档或文件实现提示注入。
- 防御方面,SkillGuard(Pan et al. 2026)与结构化安全审计(Lv et al. 2026)对单个技能施加权限约束或审计。作者指出这些工作的威胁模型粒度均为单个技能,跨技能组合风险在其中处于隐形状态。
智能体协议与技能组合风险
- AgentThread(Zheng et al. 2026)在协议层对智能体桥接协议进行形式化安全分析,发现 30 处仅在组合下出现的失效;SkillTrojan(Feng et al. 2026)研究技能后门,但仍假设单个技能存在后门。
- SkillProbe(Guo et al. 2026)审计 2,500 个 ClawHub 技能以标记组合风险对,但作者指出其属于市场审计而非运行时利用;SkillReact(Wang et al. 2026b)评测 211K 个技能对的成对组合风险,但局限于 2 节点和单跳;SCR-Bench(Xie et al. 2026)记录三种组合机制下的路径级结果,但未提出攻击者模型、未实现链条自动化合成,也未改变链长。
基线方法与基准
- 论文对比了 OpenClaw SkillsGuard、Cisco AI Defense Skill Scanner(Cisco AI Defense 2026)和 NVIDIA SkillSpector(NVIDIA 2026)三款技能扫描器;评测基准为作者构建的 CompoSkill-Bench。
本文定位
- 作者将本文工作定位于技能层本身,不针对协议桥接机制,而是面向自主智能体内部由自身规划器组装的技能组合攻击面,由攻击系统根据公开市场元数据自动合成并执行多跳攻击链。
论文如何解决这个问题?
CompoSkill通过技能组合图与约束最短路径搜索高风险链,并构建白盒与黑盒双攻击者。
CompoSkill 分为两个阶段:构建编码市场技能能力级可组合性的技能组合图(Skill Composition Graph, SCG),以及通过有约束图优化合成高风险攻击链并转化为专业任务提示词。
技能抽象与能力空间
- 将每个技能表示为能力元组 s = ⟨I(s), O(s), r(s)⟩,忽略单个扫描器已检查的实现细节。
- 能力字母表包含 7 种原子能力:Σ = {file, net, cmd, mem, cfg, db, msg}。I(s) 与 O(s) 为从市场元数据中提取的输入和输出能力子集;r(s) ∈ {0.2, 0.5, 0.9} 对应市场给出的低、中、高等级风险标签。
技能组合图与路径风险约束
- 针对具体专业场景收集候选技能集合 V,构建有向图 G = (V, E, w)。当上游技能输出与下游技能输入存在交集时建立有向边,权重反映下游需求能力被满足的比例:w(sa, sb) = |O(sa) ∩ I(sb)| / |I(sb)| ∈ (0, 1]。作者指出边权重高并不意味着恶意,而是表明两者易于被规划器顺序调用。
- 将能力划分为源能力集合 Csrc = {file, cfg, db}(读取敏感内部状态)与终端能力集合 Cterm = {net, cmd, msg, mem}(外部化、执行或持久化攻击)。
- 风险链定义为短路径 P = (ssrc, [sbrg,] sterm),路径长度为 2 或 3;要求源节点输出包含源能力,终端节点输出包含终端能力,三节点链中的桥梁节点需保持图连通性。
约束最短路径搜索与过滤
- 黑盒攻击者根据市场元数据合成候选链,定义路径综合得分公式:
Score(P) = ( ∏j=1|P|−1 w(sj, sj+1) ) r(ssrc) r(sterm) 公式通过连乘边权重鼓励自然的组合衔接,同时通过端点风险项偏好高危害能力。
- 将边权重转换为对数域代价 c(sa, sb) = -log w(sa, sb),在固定端点对时,最大化得分等价于最小化路径代价值:
argmaxP Score(P) = argminP ∑j=1|P|−1 c(sj, sj+1) 公式将链条发现转化为约束 k-最短路径问题,采用 Yen 算法并设置过采样因子 α = 10,输出预算 K = 10。
- 经过 ThreatFilter 筛选符合威胁类型的端点后,应用 Coherent 过滤器检查:要求相邻技能间输入输出能力重叠比例至少为 0.5,且中间工件在语义上与工作场景保持一致。
双攻击者任务实例化
- 白盒攻击者 Aw 已知目标已安装技能池,直接注入包含显式技能标识符调用顺序的提示词。
- 黑盒攻击者 Ab 仅获知用户职业画像,从市场推断工作场景并检索高风险链,生成只包含能力级业务指令的隐式提示词,不透露任何技能名称或工具调用语法。
论文做了哪些实验?
黑盒攻击ASR最高达71.1%,现有扫描器留存至少50%攻击能力,攻击呈桥梁红利与跳数衰减。
实验设置
- 被测模型:GPT-5.4、Gemini-3.1-flash(原表简写为 Gemini-3.1)、DeepSeek-V4、LongCat-2.0。
- 基准数据集:CompoSkill-Bench,包含 6 个专业场景(医疗健康、金融投资、法律合规、数字资产与支付、DevOps与系统管理、营销与信息运营)、76 个角色,覆盖 5 种威胁类型,共 380 个长程任务实例;每实例有 clean、显式注入(白盒 Aw)、隐式注入(黑盒 Ab)3 种变体,共 1,140 条记录。所有技能取自 ClawHub 下载量前 1000 且均独立通过平台安全审计。
- 智能体平台:Nanobot 与 OpenClaw。
- 基线防御:OpenClaw SkillsGuard、Cisco AI Defense Skill Scanner、NVIDIA SkillSpector,均采用严格拦截(strict-block)模式。
- 指标定义:链条形成率(CFR,智能体调用完整链且传递敏感状态的比例)、攻击成功率(ASR,终端步骤实际触发危害效果的比例)、任务可用性(Utility,在无注入变体上的任务完成得分)、防御绕过率(DBR,开启与关闭防御时的 CFR 比值)。
- 评审方式:LLM-as-a-judge 读取完整执行轨迹进行判定,随后由作者全部进行人工检查以核对判定准确性。
主结果
表格较宽,可左右滑动
模型 Nanobot ASR (%) Nanobot CFR (%) OpenClaw ASR (%) OpenClaw CFR (%) GPT-5.4 15.2 25.8 12.1 13.4 Gemini-3.1-flash 25.4 54.3 36.6 39.9 DeepSeek-V4 45.6 64.1 45.8 48.2 LongCat-2.0 28.4 44.3 34.5 35.0 (据 Table 2,黑盒攻击下三技能链总体结果;原表中 Gemini-3.1-flash 标注为 Gemini-3.1)
- 模型间表现差异:作者指出 DeepSeek-V4 在黑盒设置下受攻击影响最大,在两平台上均表现出最高总体指标;GPT-5.4 表现出最低的链条形成率,作者认为前沿模型在多技能链组装上更为保守。
- 形成率高于触发率:各模型与平台上的 CFR 均高于 ASR,作者分析指出组装源-桥梁-终端链比最终完成危害操作更容易,智能体常在组装链条后未执行最终危害。
- 威胁类型分布差异:作者称数据外发(Data Exfiltration)与权限提升(Privilege Escalation)最易形成,在 OpenClaw/DeepSeek-V4 上数据外发 ASR 与 CFR 分别达到 71.1% 与 72.4%(据 Table 2)。
现有技能扫描器的防御有效性
- 测试设置:在 Nanobot 平台上评估 OpenClaw SkillsGuard、Cisco AI Defense 与 NVIDIA SkillSpector 在 strict-block(严格拦截)模式下对黑盒组合攻击的防御表现(据 Table 3)。
- 实验结果:无扫描器时基准 CFR 为 63.2%,Utility 为 0.69;开启 SkillsGuard 后 CFR 为 36.8%、DBR 为 0.58、Utility 为 0.72;开启 Cisco AI Defense 后 CFR 为 40.8%、DBR 为 0.65、Utility 为 0.67;开启 NVIDIA SkillSpector 后 CFR 为 31.6%、DBR 为 0.50、Utility 为 0.60。
- 作者解读:作者称即使配置为直接拦截违规技能,各扫描器下的防御绕过率仍达到 0.50–0.65,至少保留了一半的组合攻击能力;且良性任务可用性并未大幅受损,证明单技能扫描与路径级风险存在机制脱节。
技能链长度对攻击的影响
- 测试设置:在 Nanobot 上对比隐式注入下的 2 技能链与 3 技能链形成率(据 Figure 4),并在 DeepSeek-V4 上将链长扩展至 L ∈ {2, 3, 4, 5, 6} 测试 ASR(据 Figure 5)。
- 实验结果:在 2 技能与 3 技能对比中,数据外发 CFR 从 64.9% 升至 80.6%,权限提升从 65.8% 升至 71.1%(据 Figure 4);在 L=2 到 6 的扩展实验中,五种威胁平均 ASR 在 L=2 时为 35.2%,L=3 时升至 55.4%,L=4 降至 37.8%,L=5 降至 33.6%,L=6 降至 21.8%(据 Figure 5 及正文)。
- 作者解读:作者提出桥梁红利与跳数衰减(bridge-bonus-then-hop-decay)模式,认为单个桥梁技能将直接跳转包装为常规业务步骤从而降低警惕,但超过 3 技能后,额外跳数主要降低路径连贯性并增加执行失败点。
白盒攻击上限评估与端到端案例
- 测试设置:在 Nanobot/DeepSeek-V4 上评估显式注入的白盒攻击者 Aw(据 Figure 3),并对 DevOps 预部署合规检查场景进行案例分析。
- 实验结果:白盒攻击下权限提升 ASR 达到 59.7%、CFR 达到 83.3%(Utility 为 86.2%),数据外发 ASR 为 28.3%、CFR 为 58.3%(据 Figure 3);白盒场景平均任务可用性为 75.3%(据正文)。
- 作者解读:作者称白盒攻击给出了组合风险的上限,且高可用性使得此类风险在正常业务中不易被察觉;案例分析表明提示注入仅为输入通道,危害核心在于规划器将三个独立良性技能串联并传递敏感状态。
其他消融与分析
- 白盒攻击下内存篡改指标:ASR 为 28.6%,CFR 为 30.6%,Utility 为 82.2%(据 Figure 3)。
- 白盒攻击下多智能体劫持指标:ASR 为 14.3%,CFR 为 38.1%,Utility 为 83.6%(据 Figure 3)。
- 白盒攻击下资源耗尽指标:ASR 为 20.3%,CFR 为 51.4%,Utility 为 64.3%(据 Figure 3)。
- 2 技能与 3 技能链条在内存篡改上的 CFR:分别为 63.2% 与 64.8%(据 Figure 4)。
- 2 技能与 3 技能链条在多智能体劫持与资源耗尽上的 CFR:多智能体劫持分别为 45.7% 与 50.0%,资源耗尽分别为 38.6% 与 53.9%(据 Figure 4)。
有什么可以进一步探索的点?
论文未专门设立章节讨论局限,实验在4个模型、2个平台及6个专业场景上展开评测。
作者指出的局限与后续方向
论文未专门讨论局限。
实验覆盖范围
- 被测模型范围:实验测试了 GPT-5.4、Gemini-3.1-flash、DeepSeek-V4 与 LongCat-2.0 共 4 个模型(Section 4)。
- 运行平台范围:实验在 Nanobot 与 OpenClaw 两个自主智能体平台上开展评测(Section 4)。
- 场景与角色覆盖:评测覆盖了医疗健康、金融投资、法律合规、数字资产与支付、DevOps与系统管理、营销与信息运营 6 个专业场景,共计 76 个角色(Section 3.3)。
- 防御手段范围:防御实验测试了 OpenClaw SkillsGuard、Cisco AI Defense Skill Scanner 与 NVIDIA SkillSpector 共 3 款单技能扫描器(Section 4)。
- 未报告信息:论文未报告 LLM-as-a-judge 判定与作者人工复核的具体一致性比例数据,也未报告实验的重复测试次数。
总结一下论文的主要内容
论文分析了智能体技能组合风险,指出单包安全认证状态不具备可组合性,需转向路径级防护。
- 定位与核心问题:论文针对自主智能体在长程任务中依赖技能机制的场景,指出现有生态中单技能独立安全审计无法防范技能在运行时协同组合构成的路径级攻击风险。
- 攻击框架建模:提出 CompoSkill 框架,基于 7 种原子能力将技能建模为能力元组并构建技能组合图,将多跳攻击链合成转化为带约束的 k-最短路径图优化问题,设计了显式调用的白盒攻击者与基于业务指令隐式触发的黑盒攻击者。
- 基准构建:构建包含 6 个专业场景、76 个角色、5 类威胁的 CompoSkill-Bench,涵盖 380 个任务实例及 1,140 条评测记录。
- 主要实验发现:黑盒攻击在 OpenClaw/DeepSeek-V4 数据外发任务上达成 71.1% ASR 与 72.4% CFR(Table 2);白盒攻击在 Nanobot/DeepSeek-V4 权限提升任务上达成 59.7% ASR 与 83.3% CFR(Figure 3)。
- 防御与链长规律:三款主流单技能扫描器在严格拦截模式下的防御绕过率仍达 0.50–0.65(Table 3);攻击链表现出桥梁红利与跳数衰减模式,五类威胁平均 ASR 在 3 技能时达到 55.4% 峰值,更长链条因连贯性下降导致成功率回落(Figure 5)。
- 作者结论与启示:作者指出单技能通过安全扫描的状态不具备可组合性,单个良性技能组合依然能产生危害行为,智能体安全防御亟需从单组件孤立审查转向对运行时执行路径与能力流的系统监测。