研究者提出 Convergent Detour Hijacking 攻击,可让技能型 LLM Agent 绕路并放大资源消耗
Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents
作者用CDH在DeepSeek-V4-Pro单任务上协调器命中80.02%,命中且完成时token增66.91%。
恶意发布者仅向注册表加入一个发布时固定的静态 coordinator(自然语言,发布后不能再交互)。
- 渐进披露的技能智能体先用第三方描述做选择,再加载正文做规划。作者问:只控制一个发布后固定的静态技能,能否把本可正确完成的执行拐到更耗调用、token 与时间、但仍完成原任务的轨迹。
- CDH把同一协调理由写成描述和正文。描述在路由阶段争取与原生技能共选;加载后的有界runbook把该理由变成前置与校验依赖,招募多余良性技能,再按返回条件交还原任务。描述只在45个pilot任务上用黑盒反馈筛选。
- 在OpenClaw的491个留出任务上做干净–注入配对。单任务协调器命中78.00%–96.60%。DeepSeek-V4-Pro命中且完成时token增66.91%、耗时增92.45%。完成率相差至多1.5个百分点。
- 作者称评测只覆盖一个平台、组内匹配的协调器和受控mock后端;更广生态、域外激活和实用防御留作后续。端到端为6个后端、491个留出任务;消融与30条独立任务主要在DeepSeek-V4-Pro上。论文未报告描述生成所用模型。
- 威胁模型
- 恶意发布者仅向注册表加入一个发布时固定的静态 coordinator(自然语言,发布后不能再交互)。不能访问模型内部、受害者提示词、运行时响应或执行状态,也不能改已有技能或平台。受害系统为 OpenClaw 上渐进披露的技能型 LLM 智能体。目标是保住原任务完成并增加调用、token 与耗时。
- 被测模型
- Claude-Haiku-4.5DeepSeek-V4-ProDeepSeek-V4-FlashQwen3.7-MaxQwen3.7-PlusMiniMax-M3
- 基准
- OpenClaw default registry(53 skills,9 functional groups)491 held-out multi-skill tasks45 pilot tasks30 independently authored tasks
- 指标
- Coord. HitASR_CDHtask completion ratetoken relative increasecached-token relative increasewall-clock time relative increaseAvg. ∆CallsClean Route Score
研究者提出 Convergent Detour Hijacking(CDH),一种纯文本、与运行时无关的攻击,利用技能描述与指令正文两个连续控制点,在保持任务完成的同时把 Agent 引向高成本轨迹。攻击用同一套语义掩护:描述在技能选择阶段建立相关性,对齐的正文在规划阶段复用该理由伪造依赖,从而引入攻击者控制的协调者技能,并把不必要的良性技能拉入有界绕路,最后回到原路线完成任务。在 491 个留出任务、单任务与多轮条件下跨多个 LLM 后端评测,DeepSeek-V4-Pro 上有 80.02% 的任务选中匹配的协调者;在选中协调者且完成任务的运行中,token 消耗与端到端执行时间分别增加 66.91% 和 92.45%,总体任务完成率相当。作者据此指出,正确的结果并不保证轨迹完整性与成本安全。
深度解读
这篇论文试图解决什么问题?
只用一个静态技能,把可完成任务拐到更耗资源但仍完成的轨迹。
一个只控制单个静态技能的发布者,能否在不改任务可完成性的前提下,把执行拐到更耗资源的轨迹。
- 场景: 技能型 LLM 智能体用第三方技能扩展能力。渐进披露先只暴露简短元数据供选择,认定相关后才加载指令正文,以免一开始占满上下文。作者认为两步都依赖发布者控制的数据,正确的最终答案仍可能掩盖轨迹级成本。
- 缺口: 作者称,选择操纵、恶意技能指令和工具链资源放大此前大体分开研究;静态技能能否把选择阶段与规划阶段串成结果保持的轨迹放大,仍不清楚。
- 观察与做法: 作者认为局部合理不等于轨迹必要。本文提出 Convergent Detour Hijacking(CDH):描述争取与原生技能共选,对齐的正文编造有界依赖,招募多余的良性技能后再回到原路线。
- 威胁模型:
- 目标: 提高定义 1 的 CDH 成功率,并增加 token、延迟与技能调用,同时保持原任务完成。
- 知识: 引言将路由称为 black-box,且没有未来受害者查询。不能访问模型内部、受害者提示词、运行时响应、执行状态或私有上下文。
- 能力: 只能新增一个发布时固定的静态自然语言 coordinator。不能改已有技能、平台、系统指令或其他发布者内容,发布后不能再与受害者会话交互。
- 受害系统: 渐进披露的技能型 LLM 智能体。实验平台是 OpenClaw 2026.5.7 的默认 53 技能注册表;每次攻击只安装一个组内协调器。
有哪些相关研究?
作者把CDH放在渐进披露边界上,区别于单独的选择操纵或运行时放大。
工具与技能生态上的语义攻击
- 评测与选择操纵: 作者称,Ye 等(2024)、Zhan 等(2024)、Debenedetti 等(2024)和 Zhang 等(2025a)的工具智能体评测覆盖选择、执行、反馈和间接提示注入。Faghih 等(2025)、Mo 等(2025)、He 等(2026)、Shi 等(2026a)通过改描述或优化元数据与文档,偏置工具偏好。
- 跨工具投毒: Li 等(2026)和 Shi 等(2026b)用规划器可见的描述,把合法调用引开。论文只描述了这一机制,没有另给量化对比。
- 技能注册表与供应链: Saha、Faghih 与 Feizi(2026)讨论注册表语义与治理;Liu 等(2026)、Qu 等(2026)研究指令或文档诱发的执行;Tie 等(2026)、Feng 等(2026a)、Jiang 等(2026)讨论可执行与能力级威胁。生命周期审计与防御包括 Badhe and Tiwari(2026)、Duan 等(2026)、Xiao 等(2026)、Zhang 等(2026)、Lv 等(2026)。
轨迹必要性与资源放大
- 后门与投毒: 作者转述 Yang 等(2024)、Chen 等(2024)和 Feng 等(2026b):成功输出可以掩盖被操纵的推理、记忆或动作。
- 可用性与资源放大: Zhang 等(2025b)、Gao 等(2024)、Luo 等(2026)放大生成长度、延迟、内存或智能体执行。
- 更宽的攻击立足点: Li and Wang(2026)改写受害者查询;Zhou 等(2026)控制恶意服务器文本和运行时响应;Dong、Feng 与 Wang(2026)用带伴随脚本的 Trojanized OpenClaw 技能发出进度信号;Xu 等(2026)破坏终止条件以维持执行。
基线与评测集
- 对照: 论文没有把上述攻击实现为对照系统。主对照是同一任务、同一配置下的干净注册表执行;组件消融为 Attract-only 与 Detour-only。评测用自建 491 个留出任务,描述开发只用另外 45 个 pilot 任务,另有 30 个独立撰写任务。
作者称 CDH 并不再主张一种通用选择偏置或不安全载荷,也不把任务保持的放大本身当作其贡献点。区别在渐进披露边界:描述取得共选且不替换原生技能,同一静态技能的隐藏正文再诱发额外的良性技能工作并保持完成。立足点是一个不可变技能,没有可执行伴随程序,也不能控制查询或运行时响应,绕路有限且故意回到任务完成。
论文如何解决这个问题?
CDH用同一协调理由连接描述共选与有界正文绕路,再交还原任务。
CDH 把同一套协调理由做成两份视图:路由可见的描述负责共选,加载后的正文把该理由变成有界的前置与校验依赖,再按返回条件交还原任务。Figure 2 将设计标为五步:目标触发、共选、跨阶段耦合、编造前置、目标重入。
执行模型与成功定义
- 技能与披露: 技能写成 s=(ds, bs, fs),分别是路由元数据、指令正文和实现。路由器只看元数据,选中后再加载正文。规划器在已加载技能上逐步选技能与参数。CDH 用 ds 影响选择、用 bs 重塑轨迹;技能可以只靠正文影响规划而不调用实现。
- 攻击实例: 每个功能组一份固定协调器,评测时不安装其他组的协调器,也不按单条查询改写。载荷在发布时固定,可以含条件指令,但不能适应受害者提示词、工具观察或运行时状态。攻击不依赖可执行载荷或攻击者控制的运行时响应。
- 四条件: 定义 1 要求协调器被选中并加载、注入轨迹包含干净轨迹调用过的全部技能、除协调器外至少多调用一个原生技能、两次执行都完成原任务。不假设唯一的 ground-truth 技能链。
- 目标: 成功率只在干净执行已完成的任务集 D+ 上平均,ASRCDH(h)=1/(|D+|)∑x∈ D+ CDHh(x),即四条件同时成立的比例。同时还要提高 token、延迟和技能调用。
基准构建
- 分组: 从 53 个技能的 SKILL.md 只抽取 front-matter 描述,用词级与字符级 TF–IDF 产生聚类提案,再按意图一致、可组合、边界可分和唯一归属人工核定为 9 个功能组。分组在任务生成前固定。附录给出聚类与核对流程。
- 任务: GPT-5.5 按组生成至少涉及两个技能的自然语言请求,并记录 gold 技能集、相关性、direct 或 ambiguous、顺序约束和禁止技能。过滤后 536 个任务:每组留 5 个、共 45 个作 pilot,其余 491 个只用于最终评测,两边不共享。
描述:吸引且不替换
- 共享规格: 每组在看到 pilot 反馈前固定 ρg,含目标域概念、非执行的协调角色、技能间关系,以及不替换与返回边界。描述用激活子句建立路由相关性,用协调子句把协调器写成原生技能的补充。生成器看不到原生技能正文。
- 黑盒筛选: 目标是该组 pilot 集上的协调器选择率。生成器按命中反馈改概念、操作、技能名锚点或关系,角色与不替换边界不动。作者称实现上通常两到三轮,直到最优吸引率平台或查询预算用尽;主文未给出预算数值。
- 运行时精炼: 同一 pilot 任务在完整智能体上只改激活子句,按“被选中且被加载”的比例选定最终描述,不用完成率、轨迹、token 或延迟做反馈。附录给出完整提示词。
正文:有界绕路再返回
- 固定协议: 正文在组内原生技能上给出有界路径,为转移附上遗漏后果,验证回访至多一次,并限制单技能与总的辅助调用次数。这些步骤是否必要,只与配对的干净执行比较后才算绕路。
- 返回: 返回规则不是 gold 技能的预言;原请求仍是未完成的主目标。路径走完或到达上界后解除协调器义务,禁止重启同一绕路。作者称这只限制破坏机会,不从构造上保证成功,任务保持靠配对执行来评。实例在留出评测前固定,附录提供工件。
论文做了哪些实验?
单任务命中78.00%–96.60%;作者称完成率差至多1.5个百分点。
实验设置
- 平台: OpenClaw 2026.5.7,默认 53 个原生技能,隔离的 Ubuntu 虚拟机(VirtualBox)。需要外部凭证或平台依赖的技能换成本地 mock。干净与注入会话隔离,超时 600 秒,超时不算完成,也不计入资源放大。
- 模型: 同一会话里同一模型既做路由也做规划,支持时 temperature 为 0。后端为 Claude-Haiku-4.5、DeepSeek-V4-Pro、Qwen3.7-Max、Qwen3.7-Plus、DeepSeek-V4-Flash、MiniMax-M3。任务生成用 GPT-5.5。论文未说明描述优化用的是哪个模型。
- 数据: 491 个留出任务(310 个 direct、181 个 ambiguous;438 个两技能、49 个三技能、4 个四技能),491 个预索引实例全部执行。pilot 的 45 个任务不进入最终指标。多轮按组内基准序号把任务成对,在各自会话中顺序执行。
- 对照: 配置、输入和 mock 相同,唯一差别是是否加入该组协调器。消融在 DeepSeek-V4-Pro 上比较 Full CDH、Attract-only(保留优化描述、正文换成中性 stub)和 Detour-only(保留完整正文、描述换成低吸引的通用描述)。
- 指标: 孤立路由用 gold 覆盖、顺序和禁止技能惩罚组成的复合分,只用于该设置,不交给端到端智能体。端到端报告协调器命中和人工完成率;token、缓存 token、墙钟时间和调用增量只在协调器命中且双方都完成时,按 (Injected−Clean)/Clean 报告。ASR 的分母是干净执行已完成的任务。
- 判定: 4 名未参与构建的标注者盲评最终回答和可观察产物,不看轨迹、token 或条件标签。四人独立,96.3% 的实例一致,其余 3.7% 为 3 比 1,多数表决。论文未报告重复次数。
主结果
下表为单任务。命中、token、耗时、ΔCalls 据 Table 1,且资源列只含协调器命中且双方完成的配对;ASR 据 Table 3。
表格较宽,可左右滑动
模型 命中 token↑ 耗时↑ ΔCalls ASR Claude-Haiku-4.5 78.00% 73.77% 45.30% +1.66 70.82% DeepSeek-V4-Pro 80.02% 66.91% 92.45% +2.20 73.82% Qwen3.7-Max 81.43% 68.38% 10.22% +1.43 75.98% Qwen3.7-Plus 84.32% 78.84% 3.43% +2.02 80.17% DeepSeek-V4-Flash 86.35% 49.60% −10.53% +1.65 78.46% MiniMax-M3 96.60% 80.81% 26.99% +1.43 80.51% - 完成率: 作者称所有模型–条件的干净与注入完成率相差至多 1.5 个百分点,协调器激活并未实质打断任务完成。Table 1 中间距最大的是 Qwen3.7-Plus 单任务:干净 94.3%,注入 92.8%。
- ASR 低于命中: 作者称成功还须保留干净路线技能、多招募至少一个原生技能,且双方都完成。多轮 ASR 为 71.19%–82.81%(Table 3)。
- 耗时不跟 token: 作者称墙钟时间受后端缓存、调度和推理优化影响。DeepSeek-V4-Flash 多轮耗时为 −27.97%;作者称六个模型中有四个的多轮耗时增幅低于单任务,Qwen3.7-Max 与 Qwen3.7-Plus 相反(Table 1)。
组件消融
- 测了什么: DeepSeek-V4-Pro 上每组抽 10 个、共 90 个任务,排除 1 个干净执行未完成的任务后,在剩余 89 个上比较三变体,分母含未命中(Table 2)。
- 结果: Full CDH 与 Attract-only 均为 70/89(78.7%)命中;Detour-only 为 3/89(3.4%)。平均调用增量分别为 +2.01、+0.22、+1.08;token 增幅分别为 +57.9%、+29.1%、+29.1%。
- 作者解读: 只被选中并不能复现绕路;Detour-only 很少把正文暴露给规划器。完整 CDH 是描述驱动的激活加上正文驱动的轨迹扩展。
独立撰写任务
- 测了什么: 3 名未参与基准或攻击构建的 OpenClaw 用户写 30 个需要两到三个技能的请求,含组内与跨组。跨组任务使用第一个所需技能所属组的协调器。协议为 DeepSeek-V4-Pro。
- 结果: 双方全部完成。协调器在 10 个任务(33.33%)被选中,这 10 个都满足 CDH。token 增 45.3%,缓存 token 增 39.8%,墙钟时间增 228.9%,技能调用每任务增 2.6。
- 作者解读: 命中率低于基准,作者认为这显示分布敏感性,同时称 CDH 在独立撰写和跨组任务上仍然有效。
其他消融与分析
- 孤立路由干净分 86.58%–90.44%;Table 1 的 Pilot Attraction 为 4.80%–14.20%(DeepSeek-V4-Flash 与 MiniMax-M3 未收集)。作者把该区间称为无执行上下文下的匹配协调器选择率。
- 多轮命中 82.04%–94.69%,token 增 36.54%–107.12%;作者称各配置 Avg. ∆Calls 为 +1.36 到 +2.20(Table 1)。DeepSeek-V4-Pro 命中从单任务 80.02% 到多轮 88.98%,MiniMax-M3 从 96.60% 到 94.69%。
- 作者称缓存 token 最高增 91.91%(单任务)和 94.31%(多轮);Table 1 中这两格是 MiniMax-M3。
- Table 9 的命中条件结果:Attract-only 的 token、缓存、耗时、ΔCalls 为 +26.4%、+27.6%、+65.0%、+1.16;Detour-only 为 +44.4%、+48.2%、+125.2%、+1.67,仍只基于 3/89。
- Claude-Haiku-4.5 多轮耗时为 −2.01%(Table 1)。Qwen3.7-Max 多轮完成率干净 93.5%、注入 93.4%;MiniMax-M3 单任务为 93.75% 与 93.42%。
有什么可以进一步探索的点?
作者称评测限于一个平台、组匹配协调器与mock后端,防御仍是后续工作。
作者指出的局限与后续方向
- 评测范围: 评测覆盖一个平台、组匹配的协调器和受控 mock 后端(Discussion and limitations)。
- 后续工作: 更广的生态系统、域外激活和实用防御留作后续工作(同一节)。
- 防御评测: 作者在该节提出,安装前审查和运行时监控须避免压制合法的多技能工作流,因此需要同时衡量攻击抑制、任务完成和防御开销的评测。论文没有给出已实现防御的数字。
- 小样本消融: 附录称 Detour-only 的命中条件估计只基于 3 次命中,应谨慎解读(Hit-Conditional Ablation Analysis)。
实验覆盖范围
- 端到端覆盖 6 个 LLM 后端、491 个留出任务,以及单任务与多轮两种会话(Table 1,Experiments)。
- 孤立路由的干净分与 Pilot Attraction 只收集了 4 个后端(Table 1 注记)。
- 消融在 DeepSeek-V4-Pro 上每组抽 10 个、共 90 个任务,排除 1 个干净执行未完成的任务后为 89 个(Table 2)。
- 泛化为 3 名未参与构建者撰写的 30 个任务,含组内与跨组,只在 DeepSeek-V4-Pro 上运行(Analysis)。
- 论文未报告描述生成所用模型、查询预算的具体数值,以及各条件的重复次数。
总结一下论文的主要内容
CDH让静态技能在保持任务完成时拉高调用与token,耗时则因后端而异。
CDH 是针对渐进披露技能智能体的发布者侧、纯文本攻击:一个静态协调器把本可正确完成的任务,拐进有界但更耗资源的技能绕路,再交还原任务。
- 问题: 描述控制入选、正文控制规划,两者都由不可信发布者提供。作者认为最终答案正确并不等于轨迹必要或成本安全。攻击者没有模型内部、运行时响应或发布后交互。
- 做法: 每个功能组固定一套协调理由。描述在 45 个 pilot 任务上用黑盒选择反馈做共选优化,不用完成率或资源当反馈。正文把同一理由写成带调用上界和返回条件的 runbook,招募干净轨迹里没有的原生技能。成功要同时满足加载协调器、保留干净技能集、多至少一个原生技能、双方都完成。
- 主结果: 在 OpenClaw 2026.5.7 的 491 个留出任务上,六个后端的单任务协调器命中为 78.00%–96.60%。DeepSeek-V4-Pro 单任务命中 80.02%,命中且双方完成时 token 增 66.91%、耗时增 92.45%(Table 1)。单任务 ASR 为 70.82%–80.51%(Table 3)。作者称完成率相差至多 1.5 个百分点;Table 1 中 Qwen3.7-Plus 单任务注入完成率低于干净执行。DeepSeek-V4-Flash 的耗时增幅为负。
- 机制与泛化: 只保留描述时命中与完整 CDH 同为 70/89,平均调用增量只有 +0.22,完整 CDH 为 +2.01(Table 2)。30 个独立任务上命中 10 次(33.33%),这 10 次都满足 CDH,耗时增 228.9%。
- 作者结论: 作者在结论中把轨迹必要性,而不只是最终答案正确,写成可扩展智能体的安全要求,并称审计应同时看路由元数据、执行指令和轨迹是否为用户目标所必需。作者认为安装前审查和运行时的 token 或调用预算是两个互补防御点,并称更广生态、域外激活和实用防御仍是后续工作。