研究者提出技能级联攻击,在 OpenClaw、Claude Code 与 Codex 上平均成功率 89.4%
Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems
AI 导读
研究者提出技能级联攻击(skill cascading attacks),把恶意目标分散到多个 Agent 技能中,使每个被改动的技能单独看都通过安全扫描,组合执行后才产生危害。作者构建了多智能体红队框架 SkillCascade,并基于 ClawHub 上的真实技能发布 SkillCascade-Bench,包含 10 个领域的 213 个验证用例,平均级联长度为 3.25 个技能。在 OpenClaw、Claude Code 和 Codex 三类 Agent 系统与 8 个 LLM 后端上,攻击平均成功率为 89.4%,各后端介于 76.5% 至 97.1%,其中 Claude Opus 4.6 与 GPT-5.4 最抗攻击,开源权重后端 Qwen 3 72B 最易受攻击。攻击对逐技能扫描器、跨技能联合扫描器和运行时防御均保持较高规避率,运行时防御平均规避率为 88.5%。
论文速读
- 基于 skill 的 LLM agent 系统(如 Claude Code、OpenClaw、Codex)通过共享 context window 加载第三方 skill,风险可跨 skill 传播。已有研究只关注单个 skill 内的漏洞,per-skill 扫描器无法审查跨 skill 交互,留下系统级安全盲区。
- 作者提出 skill cascading attacks:把恶意目标分散到多个 skill,使每个改动单独看都通过 per-skill 扫描(individual stealth),组合执行才产生危害(joint harm),且回退任一改动危害即消失(indispensability)。并构建 SkillCascade 多智能体红队框架,含场景发现、攻击、扫描、测试用例生成、评判五个 agent,在 ClawHub 真实 skill 上自动生成并验证级联攻击。
- 发布 SkillCascade-Bench,含 10 个领域 213 个验证用例,平均级联长度 3.25 个 skill,覆盖 7 类目标和 3 种级联模式。在 3 个 agent 系统与 8 个 LLM backbone 上平均 ASR 达 89.4%;per-skill 扫描器 stealth 率均高于 86%,joint 扫描器同样多数放行,运行时防御平均 evasion 率 88.5%。回退任一改动后残余 ASR 降至 13–18%。作者还提出 Behavior-Composition Scanner 作为概念验证,对 causal 级联降低 stealth 超 30 点。
- 评估在沙箱而非真实部署中进行,绝对攻击率应视为压力测试而非实际发生率;Judge Agent 依赖 LLM,需补充人工复核;攻击者控制的 skill 被共同安装的实际发生率仍是未解问题。Behavior-Composition Scanner 只是概念验证,对 compositional 和 hybrid 级联效果有限,完整防御留待未来工作。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
论文把恶意目标拆到多个技能中,单个技能都能通过扫描,组合后才产生危害,并给出跨技能防御的初步尝试。