跳到正文
原文
论文追踪· arXiv:2608.09732· Puyu Zeng, Simeng Qin, Jingzhi Li, Ju Jia, Zheli Liu, Xiaojun Jia·本站收录 · 原文发表 精选关注度56

ColluSkill 用跨技能组合绕过 Agent 技能扫描器,平均攻击成功率 96.0%

ColluSkill: Adversarial Cross-Skill Composition for Evading Agent Skill Scanners

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

作者提出多技能链攻击ColluSkill,在六款扫描器上平均ASR达96.0%;防御ChainGuard将其降至22.5%(Table 1)。

威胁模型攻击者旨在绕过技能扫描器孤立审查并在智能体执行时恢复链级恶意意图;掌握黑盒或灰盒扫描器反馈,能将恶意载荷分解打包为多个独立的SKILL.md子技能并基于反馈迭代改写;受害者为运行多技能工作流的智能体与技能扫描器。

问题
现有智能体技能扫描器主要孤立审查单个技能,无法检测通过上下文依赖、产物传递与执行交接拼装完整恶意意图的跨技能共谋风险。
方法
ColluSkill将恶意载荷分解为子技能链,利用LLM规划依赖并通过扫描器反馈迭代改写;防御ChainGuard结合已安装技能上下文重构依赖路径进行联合审查。
实验与结果
ColluSkill在六款扫描器上平均ASR达96.0%,在三款代码智能体上激活成功率为58.5%–92.5%;ChainGuard将ColluSkill的ASR降至22.5%,良性通过率为99.5%(Table 1、2、4)。
局限与可以继续做的
论文未专门讨论局限与后续方向。实验覆盖200条攻击链、6款扫描器与3款代码智能体;未报告载荷来源分布、单次扫描耗时与重复测试次数。
实验设置GPT-5.5、DeepSeek-V4-Pro 等 · 200 malicious payloads dataset、OpenCode 等 · Attack Success Rate (ASR)、Chain Activation Success Rate 等
被测模型
GPT-5.5DeepSeek-V4-ProGLM-5.2
基准
200 malicious payloads datasetOpenCodeClaude CodeCodex
指标
Attack Success Rate (ASR)Chain Activation Success RateBenign Workflow Pass Rate
AI 导读和推荐理由研究者提出 ColluSkill,一种将完整恶意意图拆分为多个相互依赖子技能、通过上下文依赖与执行交接在链级重建攻击的协同式多技能链攻击框架,在六款代表性技能扫描器上平均攻击成功率 96.0%。消融实验显示,简单拆分载荷的平均成功率为 36.7%,加入链式规划后升至 68.2%,再用扫描器反馈迭代改写被标记子技能后达到 96.0%。该攻击链在 OpenCode、Claude Code 和 Codex 上配合 GPT-5.5、DeepSeek-V4-Pro、GLM-5.2 运行时激活成功率为 58.5% 至 92.5%。作者同时提出上下文感知的链级扫描器 ChainGuard,将 ColluSkill 的攻击成功率降至 22.5%,同时放行 99.5% 的良性工作流。

研究者提出 ColluSkill,一种将完整恶意意图拆分为多个相互依赖子技能、通过上下文依赖与执行交接在链级重建攻击的协同式多技能链攻击框架,在六款代表性技能扫描器上平均攻击成功率 96.0%。消融实验显示,简单拆分载荷的平均成功率为 36.7%,加入链式规划后升至 68.2%,再用扫描器反馈迭代改写被标记子技能后达到 96.0%。该攻击链在 OpenCode、Claude Code 和 Codex 上配合 GPT-5.5、DeepSeek-V4-Pro、GLM-5.2 运行时激活成功率为 58.5% 至 92.5%。作者同时提出上下文感知的链级扫描器 ChainGuard,将 ColluSkill 的攻击成功率降至 22.5%,同时放行 99.5% 的良性工作流。

推荐理由论文同时给出跨技能组合攻击在六款扫描器上的成功率和链级防御的拦截效果,可对照现有技能扫描流程评估盲区。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    现有扫描器仅孤立审查单技能,论文提出通过有序依赖规避检测的多技能链攻击ColluSkill及防御ChainGuard。

    现有智能体技能扫描器主要孤立审查单个技能,无法检测将完整恶意意图拆分至多个局部看似合理的子技能中的跨技能共谋攻击。

    • 应用场景与重要性:智能体技能将指令、工具接口与执行脚本封装为可复用模块,支持在实际工作流中安装并组合执行(作者称)。但恶意技能可滥用代码执行、系统资源或外部 API 权限造成敏感数据泄露或破坏(作者称)。
    • 现有防御的不足:作者称现有技能扫描器主要审查单个技能的指令、权限、依赖与代码行为,忽视了跨技能组合带来的安全盲区,无法发现拆分后单看合理的技能组合。
    • 核心观察与假设:作者借鉴社会学中埃利亚斯(Elias)的相互依赖链概念,认为完整恶意行为不必由单个技能承担,而是可以通过上下文依赖、产物传递与执行交接在有序组合中涌现。
    • 威胁模型:
      • 目标:构造多技能工作流,使每个子技能独立通过扫描器审查,而在智能体执行时恢复链级恶意意图(作者称)。
      • 知识:攻击者掌握黑盒或灰盒形式的目标扫描器反馈,通过向目标扫描器提交子技能获取判定结果与重写建议。
      • 能力:攻击者可将恶意载荷分解并分别打包为独立的 SKILL.md 子技能文件,利用 LLM 进行时序依赖规划并基于扫描器反馈迭代改写。
      • 受害系统:基于 LLM 的智能体环境(如 OpenCode、Claude Code、Codex)及各类技能扫描器(如 CISCO Skill Scanner、SkillFortify 等)。
    • 提出的方法:作者提出了共谋多技能链攻击框架 ColluSkill,以及感知已安装技能上下文的技能链扫描器 ChainGuard。
  2. 有哪些相关研究?

    已有研究聚焦单技能漏洞与孤立扫描,论文将ColluSkill与5种单技能和1种多技能基线对比并提出链级检测。

    论文从智能体技能风险、多技能组合安全以及技能扫描防御三个方面讨论了相关工作。

    • 智能体技能及其安全风险:
      • Anthropic 等推动将技能标准化为包含脚本与资源的 SKILL.md 文件夹(Li et al. 2026b; Li 2026),Claude Code、Codex、Cursor、OpenCode 以及 OpenClaw、ClawHub 等平台支持技能生态(作者称)。
      • Liu et al. (2026b) 分析了收集的 42,447 个技能中的 31,132 个公开技能,报告 26.1% 包含至少一个漏洞;Liu et al. (2026a) 与 Beurer-Kellner et al. (2026) 报告真实技能仓库中存在可验证的恶意技能。
      • Schmotz et al. (2026) 提出 Skill-Inject,报告技能文件可作为提示注入通道;Jia et al. (2026a) 提出 SkillJect,通过闭环优化为代码智能体生成隐蔽且可触发的恶意技能;此外单技能攻击还包括 SkillTrojan (Feng et al. 2026)、Badskill (Tie et al. 2026) 和 Cloak (Ji et al. 2026)。作者称这些先前攻击主要研究单个技能内的恶意行为。
    • 多技能组合安全风险:
      • Xie et al. (2026) 形式化并评估了受控基准设置下多技能组合带来的安全风险(SCRBench)。作者称其仅在受控基准中评估,而未针对扫描器规避系统研究基于 LLM 规划与扫描器反馈的对抗性共谋链构建。
    • 技能扫描器与防御:
      • 工业界工具包括 CISCO Skill Scanner(结合规则、LLM 裁判与行为数据流分析)、Snyk Agent Scan(覆盖组件发现、提示注入与敏感数据处理)、Skill Vetter(审查权限与可疑命令)以及 VirusTotal Code Insight(分析 OpenClaw 技能行为)(Cisco AI Defense 2026; Snyk 2025; fedrov 2025; Quintero 2026)。
      • 学术界防御包括 ClawGuard / Auditor 模板(Ying et al. 2026)、SkillScan(Liu et al. 2026b)、SkillFortify(Bhardwaj 2026)、SkillSieve(Hou and Yang 2026)与 SkillProbe(Guo et al. 2026b)。作者称这些扫描器主要关注单技能的内容、权限、依赖与行为证据,对跨技能组合风险探索较少。
    • 对比基线与数据集:
      • 基线方法:单技能攻击基线包括 SkillJect (Jia et al. 2026a)、Skill-Inject (Schmotz et al. 2026)、SkillTrojan (Feng et al. 2026)、POISE (Hao et al. 2026) 与 SkillSafetyBench (Jin et al. 2026);多技能攻击基线为 SCRBench (Xie et al. 2026)。
      • 评测数据集与目标:评测针对包含 200 个恶意载荷构建的数据集,目标扫描器包括 CISCO Skill Scanner、SkillFortify、Auditor、SlowMist、Vetter、SkillSpector。
    • 本文定位:作者将 ColluSkill 定位为结合相互依赖链规划与扫描器反馈迭代重写的对抗性攻击框架;将 ChainGuard 定位为结合完整已安装技能上下文重构依赖路径并联合检测组合风险的上下文感知扫描器。
  3. 论文如何解决这个问题?

    ColluSkill通过规划子载荷依赖与扫描器反馈迭代重写绕过检测,ChainGuard重构跨技能依赖实现安装时防御。

    论文提出 ColluSkill 框架将恶意载荷分解为相互依赖的子技能链并基于扫描器反馈进行迭代精炼,同时提出 ChainGuard 扫描器结合已安装技能上下文重构跨技能依赖以识别工作流级风险。

    相互依赖链构建与形式化

    • 概念链定义:作者借鉴 Elias 的相互依赖链概念,将多技能攻击建模为局部角色的有序链,定义概念链为包含 3 个抽象角色与时序关系的有序结构。
    • 具体链实例化:对原始载荷 p,实例化为 3 个有序子载荷 p1、p2、p3,每个子载荷仅保留部分恶意意图并映射至一个局部角色。
    • 攻击目标:形式化为 maxi D(si) = 0 且 Rchain(W) ≥ τrisk,表示每个子技能均通过孤立扫描,而组合后的工作流保持链级恶意风险。

    链内攻击生成流程

    • 推断载荷计划:攻击者 LLM 根据原始载荷与实例化链生成有序载荷计划,确保后序子载荷依赖前序子载荷形成连贯链条。
    • 生成技能计划:攻击者 LLM 在不与真实运行时交互的情况下预测各步骤中间结果,将每个步骤写入独立的 SKILL.md 文件生成工作流。
    • 扫描器反馈精炼:在每轮迭代将各子技能提交给目标扫描器集合,仅提取被拦截子技能的反馈并提示 LLM 重写,未被拦截的保持不变,直到全部通过或达到最大迭代次数。

    ChainGuard 上下文感知扫描

    • 依赖关系重构:解析候选技能与所有已安装技能的名称、描述、指令、输入输出、工具、权限和触发条件;双向检查工件、文件、环境变量、上下文引用与状态,重构以候选技能为中心的依赖路径。
    • 三类风险评估:联合评估单体风险(自身包含的不安全行为)、跨技能依赖风险(与已安装技能形成依赖以促成下游有害操作)及能力拆分风险(完整不安全能力的组件分散在多个技能中)。
    • 决策规则:形式化为 Dchain(W) = maxi DCG(si, Hi),在安装时对每个候选技能结合其已安装上下文进行检测,若任一环节被判定为风险则拦截整个链。
  4. 论文做了哪些实验?

    ColluSkill在六款扫描器上达96.0%平均ASR并在三款智能体上成功激活,ChainGuard将其降至22.5%。

    实验设置

    • 被测模型与智能体:代码智能体采用 OpenCode、Claude Code、Codex;模型底座测试了 GPT-5.5、DeepSeek-V4-Pro、GLM-5.2。
    • 数据集规模:从 200 个恶意载荷构建多技能攻击数据集,每个载荷分解为 3 个子技能,共包含 200 条攻击链与 600 个子技能。
    • 攻击基线:单技能基线包含 SkillJect、Skill-Inject、SkillTrojan、POISE、SkillSafetyBench;多技能基线包含 SCRBench。
    • 被测扫描器:包含 CISCO Skill Scanner、SkillFortify、Auditor、SlowMist、Vetter、SkillSpector 共 6 款扫描器。
    • 指标定义:主要指标为攻击成功率(ASR,全链所有子技能均通过扫描器判定为成功)、链激活成功率(智能体执行成功触发链级行为)与良性工作流通过率。
    • 实现细节:所有攻击样本均由 GPT-5.5 生成;基于 LLM 的扫描器(Auditor、SlowMist、Vetter、SkillSpector)底层模型均固定为 GPT-5.5。

    主结果

    表格较宽,可左右滑动

    方法类型方法CISCOSkillFortifyAuditorSlowMistVetterSkillSpectorAvgChainGuard
    单技能攻击SkillJect8.225.050.00.00.064.824.70.0
    单技能攻击Skill-Inject53.06.918.00.30.36.514.20.5
    单技能攻击SkillTrojan0.0100.00.00.00.02.017.01.0
    单技能攻击POISE63.485.624.60.31.458.939.00.5
    单技能攻击SkillSafetyBench17.658.639.833.733.743.337.83.2
    多技能攻击SCRBench49.564.913.733.239.48.034.81.1
    多技能攻击ColluSkill (ours)100.0100.091.593.592.099.096.022.5
    • 单技能扫描的检测盲区:ColluSkill 在六款第三方扫描器上取得 91.5%–100.0% 的 ASR,平均 ASR 为 96.0%(据 Table 1),作者称这表明现有扫描器在恶意行为被拆分至多个子技能时检测能力会下降。
    • 多技能拆分与对抗规划的差距:普通多技能基线 SCRBench 的平均 ASR 仅为 34.8%(据 Table 1),作者称这表明单纯的多技能组合不足以可靠规避扫描,LLM 链规划与迭代精炼对攻击表现至关重要。
    • ChainGuard 的防御效果:在 ChainGuard 扫描下,ColluSkill 的 ASR 降至 22.5%(据 Table 1),作者称这表明候选技能结合上下文扫描能检测到孤立扫描遗漏的组合风险,但未能降至 0% 仍说明多技能防御具有挑战性。

    运行时代码智能体链激活评测

    • 评测内容:在 OpenCode、Claude Code、Codex 上测试 ColluSkill 在不同模型底座下的链激活成功率(Table 2)。
    • 实验结果:OpenCode 上激活率为 87.5%–92.5%;Claude Code 上为 62.0%–78.2%;Codex 上为 58.5%–72.0%(据 Table 2)。
    • 作者解读:作者称这表明 ColluSkill 攻击链能够在不同代码智能体和模型底座上实际执行,跨技能组合风险不仅存在于规避扫描阶段,也能在真实智能体执行中出现。

    LLM 迭代精炼与技能链长度消融

    • 评测内容:评估扫描器反馈迭代重写轮数(0–7 轮)及子技能链长度(2 步、3 步、4 步)对平均 ASR 的影响(Figure 3)。
    • 实验结果:未精炼时 3 步链 ASR 为 64.9%,第 1 轮升至 84.7%,第 3 轮达 90.3%,第 5 轮达 94.4%,第 7 轮达 96.0%;最终 2 步链为 93.6%,3 步链为 96.0%,4 步链为 90.7%(据 Figure 3 与正文)。
    • 作者解读:作者称迭代重写能消除局部可疑信号,大部分收益来自前几轮;链长存在权衡,3 步链在语义分散与工作流连贯性之间取得了最佳平衡。

    已安装技能上下文对 ChainGuard 的效用评估

    • 评测内容:对比 ChainGuard 在未使用与使用已安装技能上下文时的良性通过率与攻击 ASR(Table 4)。
    • 实验结果:不使用上下文时良性通过率为 99.7%、ColluSkill ASR 为 69.0%;使用上下文后良性通过率为 99.5%、ColluSkill ASR 降至 22.5%(据 Table 4)。
    • 作者解读:作者称上下文信息有助于关联分散在不同技能中的局部行为并识别组合风险,且良性工作流通过率仅下降 0.2 个百分点,表明防御并非靠无差别拦截多技能工作流来实现。

    其他消融与分析

    • 组件消融中 Naive Split 在六款扫描器上的平均 ASR 为 36.7%(Table 3)。
    • 仅引入 Chain Planning 时平均 ASR 提升至 68.2%,其中 SkillFortify 上从 11.5% 升至 100.0%(Table 3)。
    • 结合扫描器反馈的 Full ColluSkill 平均 ASR 达到 96.0%(Table 3)。
  5. 有什么可以进一步探索的点?

    论文未专门讨论局限,实验覆盖了200条攻击链、6款扫描器与3款代码智能体。

    作者指出的局限与后续方向

    论文未专门讨论局限与后续方向。

    实验覆盖范围

    • 被测恶意载荷规模:实验构建并测试了包含 200 个恶意载荷的数据集,生成 200 条多技能攻击链与 600 个子技能(Experimental Setup)。
    • 扫描器与基线覆盖:防御端评估了 CISCO Skill Scanner、SkillFortify、Auditor、SlowMist、Vetter、SkillSpector 共 6 款扫描器;对比了 5 个单技能基线与 1 个多技能基线 SCRBench(Experimental Setup)。
    • 运行时智能体与模型:运行时激活实验在 OpenCode、Claude Code、Codex 共 3 款代码智能体上进行,模型底座测试了 GPT-5.5、DeepSeek-V4-Pro、GLM-5.2 共 3 个(Runtime Chain Activation Study)。
    • 攻击生成与扫描底座:所有攻击样本生成均使用 GPT-5.5,基于 LLM 的扫描器底座同样固定为 GPT-5.5(Implementation details)。
    • 未报告信息:论文未报告 200 个原始恶意载荷的具体场景分类与来源分布,未报告各扫描器的推理延时或 API 开销,亦未报告各实验设置下的重复测试次数或方差(Experimental Setup)。
  6. 总结一下论文的主要内容

    论文揭示了单技能孤立扫描的盲区,提出多技能链攻击ColluSkill与上下文防御ChainGuard并验证了有效性。
    • 定位与核心问题:论文揭示了现有智能体技能扫描器仅孤立审查单个技能导致的安全盲区,提出通过共谋多技能链绕过检测的攻击框架 ColluSkill 及上下文感知防御扫描器 ChainGuard。
    • 攻击机制:依据社会学相互依赖链概念,将恶意意图拆解为包含上下文与产物传递关系的子技能链,并利用扫描器判决反馈针对性迭代重写被拦截的子技能。
    • 防御机制:ChainGuard 在安装阶段结合已有技能环境重构跨技能依赖路径,联合判定单体风险、依赖风险与能力拆分风险。
    • 规避效果:ColluSkill 在六款第三方扫描器上取得 96.0% 的平均 ASR,高于单技能基线(平均 14.2%–39.0%)与普通多技能基线 SCRBench(平均 34.8%)(Table 1)。
    • 运行时可行性与防御表现:在 OpenCode、Claude Code 和 Codex 上激活成功率为 58.5% 至 92.5%(Table 2);ChainGuard 将 ColluSkill 的平均 ASR 降至 22.5%,良性工作流通过率为 99.5%(Table 4)。
    • 作者结论:作者认为跨技能组合构成智能体生态中现实且被忽视的攻击面,单纯孤立检查单技能无法防范隐蔽共谋,安全防御必须转向结合执行环境的链级与上下文感知审查。
阅读原文arxiv.org