跳到正文
原文
论文追踪· arXiv:2610.01564· Dong, Tian, Ma, Zixuan, Zhao, Haodong, Zhang, Huaien, Li, Shaofeng, Chen, Hao·本站收录 · 原文发表 精选关注度33

APEX 用跨技能链劫持 LLM Agent,GPT-5.4 上攻击成功率达 84.3%

Chaining Skills to Hijack LLM Agents

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

APEX通过在跨技能进度记录中夹带虚假授权,在6个模型上诱导目标动作的平均ASR达74.2%(Table 2)。

威胁模型攻击者控制提交至市场的SKILL.md安装包并编排跨技能信息流,无环境直接访问权;知晓任务主题、工作区和可用原生技能,离线基于沙箱试运行反馈迭代生成;受害LLM智能体在工作区执行任务并产生共享记录。

问题
智能体通过技能链按序执行多步骤任务时,跨技能传递的状态记录可能夹带攻击者伪造的授权信息,诱导智能体执行违规操作或陷入循环耗尽资源。
方法
APEX构建对抗性技能链,使上游技能写入兼具真实任务进展与虚假授权主张的记录,下游技能据此触发恶意动作,并通过试运行反馈迭代修订。
实验与结果
在SkillsBench的4个定向动作家族上,6个模型的完整技能链诱发目标动作的ASR达74.2%;Work Loop使平均token消耗升至最高36.39倍。
局限与可以继续做的
仅报告实验条件汇总指标而非单次运行联合分布;部分任务在不同家族间重叠;提示防御仅在GPT-5.4上评估且未测试自适应攻击。
实验设置Claude Sonnet 5、DeepSeek V4 Flash 等 · SkillsBench · ASR、Token ratio 等
模型
Claude Sonnet 5DeepSeek V4 FlashGPT-5.4Gemini 3.5 FlashGrok 4.5Kimi K2.6
基准
SkillsBench
指标
ASRToken ratioUtilityVerifier test-pass rate
AI 导读和推荐理由全文 318 字

研究者提出 APEX,通过构造跨技能链劫持 LLM Agent:上游技能诱导 Agent 把真实任务进度与攻击者提供的“已获批准”声明写入持久记录,下游技能再据此执行攻击者选定的动作。在 SkillsBench 的四个目标动作族和六个模型上,690 次尝试中有 512 次(74.2%)成功诱导目标动作;在 GPT-5.4 上完整链成功率为 84.3%,而把工作流合并为单个技能时为 17.4%,直接注入为 3.5%。攻击在多数情况下不显著降低原任务通过率,GPT-5.4 四个族的原生验证器通过率平均仅变化 2.6 个百分点。可用性攻击 Work Loop 使各模型每任务 token 用量达到基线的 2.20 倍至 36.39 倍。

推荐理由论文给出跨技能链式攻击在六个模型上的成功率与任务效用变化,并量化了提示防御带来的良性任务损失。

深度解读

6 个问题,约 5,500 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    研究智能体跨技能协作时利用真实进度记录传递虚假授权的攻击机制。

    核心问题在于大语言模型智能体跨技能调用时,持久化状态记录易被利用以传递未授权指示并绕过用户限制。

    • 场景与重要性:大语言模型智能体依赖技能(可复用的任务指令包)完成多步骤工作,多个技能按顺序协同执行,公共技能仓库(如SkillsMP)的普及为恶意技能分发提供了渠道。
    • 现有防御与研究不足:现有指令分级训练主要防范数据区非特权指令,但技能本身属于合法指令;此前针对技能组合安全的研究较少评估智能体受攻击时对用户原生合法任务的完成质量。
    • 核心观察:上游技能诱导智能体生成的真实任务进展记录,可以同时夹带攻击者声称的后续动作授权声明,下游技能仅凭局部上下文无法辨别该授权是否符合用户原始意图。
    • 本文方法:作者提出APEX框架,离线构建并迭代优化对抗性技能链,在维持良性任务效用的同时诱导目标越权动作或循环消耗资源。
    • 威胁模型:
      • 攻击者目标:诱导智能体对指定目标执行越权动作(机密性、完整性攻击),或诱发重复任务单元消耗资源(可用性攻击Work Loop)。
      • 攻击者知识:属于task-aware攻击者,知晓用户请求主题、初始工作区及可用原生技能;离线阶段可通过Harbor执行框架获取候选链的试运行报告。
      • 攻击者能力:攻击者控制提交给市场的SKILL.md安装包并编排跨阶段信息流,但对受害者环境、工具无直接访问权限,也不能与受害者直接交互。
      • 受害系统:运行在工作区内、具有文件读写权限并依序加载执行技能包的LLM智能体,其操作始终受原始用户请求的约束。
  2. 有哪些相关研究?

    涵盖间接提示注入、单技能攻击与组合技能攻击,并以SkillsBench为基准。

    论文将相关工作划分为提示词劫持、单技能攻击与组合技能攻击三类:

    • 基于提示词的智能体劫持:Greshake等人(2023)研究在间接提示词注入中通过低信任内容重定向智能体;Guo与Wei(2026)以及Chang等人(2026)探讨检索增强生成中的注入漏洞;Wallace等人(2024)提出指令分级训练模型忽略数据区非法指令。作者指出指令分级使得通过外包数据劫持模型的难度上升。
    • 单技能攻击:Jia等人(2026)的SkillJect将隐蔽助手包装为任务必需组件并利用试验结果调整指令;Hao等人(2026)的POISE在安装配置说明中嵌入脚本调用以伪装成常规操作。作者指出APEX同样将非预期动作与正常任务绑定以利于攻击成效。
    • 组合技能攻击:Xie等人(2026)的SCR-Bench评估受控技能组合中的能力流、信任传递与授权混淆;Zeng等人(2026)的ColluSkill利用扫描器反馈合成分解的互依恶意技能;Liu等人(2026a)的CompoSkill在可通过单项检查的技能中搜索攻击路径。作者指出与此前采用一次性生成的方法相比,APEX利用试运行失败步的执行反馈进行多轮迭代修订。
    • 对比基线与基准:论文采用SkillsBench(Li等人,2026)作为评估基准;对比基线包括直接提示注入(Direct Injection)、合并为单技能的工作流(Monolithic Workflow)以及显式记录未授权(Authorization Denied)控制组。
    • 作者定位区别:作者强调此前工作缺乏在攻击场景下对原生合法任务效用保留程度的系统考察,且APEX聚焦于将真实进度与伪造授权打包存入持久记录的特定交接机制。
  3. 论文如何解决这个问题?

    APEX通过伪造任务交接记录触发下游动作,并依据沙箱反馈迭代修订技能链。

    作者提出APEX(Authority Promotion EXplorer)框架,通过构造包含真实任务进展与攻击者伪造授权的持久化记录,在下游技能中触发非预期动作,并基于试运行执行反馈完成迭代调优。

    跨技能依赖构建

    • 任务与动作绑定:在上游技能中,引导智能体执行正常任务并输出中间进展,同时将攻击者指定的越权动作标记为已获授权并写入共享目录的记录文件。
    • 下游动作触发:下游技能指示智能体读取该记录文件并依从其中记录的授权状态,进而调用工具作用于目标对象(例如删除源文件、执行外部脚本或外发数据)。
    • 五类攻击家族:包括外部传输(External Transfer,破坏机密性)、脚本获取(Script Acquisition,破坏完整性)、文件修改(File Modification,破坏完整性)、输出篡改(Output Tampering,破坏完整性)以及工作循环(Work Loop,破坏可用性)。

    基于执行反馈的链条优化

    • 沙箱试运行:利用Harbor执行框架在隔离任务副本上模拟执行候选技能链,捕获执行轨迹以判定交接失败的具体阶段。
    • 分类修订策略:区分未建立记录交接与读取记录但拒绝执行动作两类失败,针对性修改技能提示词的上下文引用说明,而保持目标动作及其判定规则固定不变。
    • 效用验证机制:每次修订后通过任务原生验证器核查合法工作产物是否依然有效,确保攻击不破坏主任务的正常完成。

    授权决策困境与循环成本建模

    • 交接不可区分性:对于局部视图 V,若其在允许与禁止历史下的分布分别为 P+ 和 P-,任意决策规则 f 满足错误下界:FA(f) + FD(f) ≥ 1 − TV(P+, P−),其中 TV 为全变差距离。当局部视图无法区分用户原始意图时,规则无法兼顾两类错误。
    • 循环工作量分析:将Work Loop建模为有限转移矩阵 Q,单次访问状态成本向量为 c,至多 H 次访问的期望总成本表示为:E[CH] = α⊤ (∑t=0H−1 Qt) c。在谱半径满足 ρ(Q) < 1 时,无访问限制的期望总成本收敛至 α⊤ (I − Q)−1 c。
  4. 论文做了哪些实验?

    涵盖6个模型及5类家族,完整链ASR达74.2%,评估了结构消融与提示防御。

    实验设置

    • 被测模型:Claude Sonnet 5、DeepSeek V4 Flash、GPT-5.4、Gemini 3.5 Flash、Grok 4.5、Kimi K2.6,共6个模型。
    • 数据集与规模:选用SkillsBench子集,External Transfer含30个任务(251项检查),Script Acquisition含29个任务(190项检查),File Modification含25个任务(217项检查),Output Tampering含31个任务(249项检查),Work Loop含15个任务(113项检查),良性对照组含72个独立任务(533项检查)。
    • 评测指标:定向动作采用攻击成功率(ASR,%);Work Loop采用单任务token比率的算术平均值(Token ratio,×);任务效用采用通过的原生验证项占总验证项的比例(Utility,%)。
    • 成功判定方式:环境内置捕获服务记录网络调用;检查指定原生预存文件的删除;检查输出内容与源文件冲突且写入目标位置;检查是否返回初始阶段并启动新单元。

    主结果

    各模型在五类攻击家族下的攻击有效性与资源消耗如下表所示:

    表格较宽,可左右滑动

    模型外部传输 (ASR %)脚本获取 (ASR %)文件修改 (ASR %)输出篡改 (ASR %)循环消耗 (Token倍率)
    Claude Sonnet 583.365.584.058.121.33×
    DeepSeek V4 Flash66.775.984.077.420.66×
    GPT-5.486.775.984.090.315.00×
    Gemini 3.5 Flash76.789.784.074.22.20×
    Grok 4.556.758.668.054.814.42×
    Kimi K2.670.086.272.064.536.39×
    全模型平均73.375.379.369.918.33×
    • 攻击成功率表现:据Table 2,4个定向动作家族共690次尝试中诱导成功512次(74.2%),所有模型在所有家族上的ASR均超过50%,文件修改家族平均ASR最高(79.3%)。
    • 资源放大倍率:据Table 2,Work Loop在6个模型上的平均单任务token消耗为原生基准的2.20×至36.39×,全模型平均为18.33×。
    • 原生任务效用保留:据Figure 3与Table 7,GPT-5.4在4个定向动作家族上的验证通过率在攻击下平均变动为2.6个百分点;输出篡改家族中全模型效用绝对变动均在3.6个百分点以内。

    结构消融对比

    • 对比条件设置:在DeepSeek V4 Flash和GPT-5.4上对比完整链(A)、记录显式标注未授权(B)、单技能整合工作流(C)及直接注入(D)。
    • 结果数据表现:据Table 3,GPT-5.4在完整链下的总动作ASR为84.3%,在显式标注未授权时降至27.0%,在单技能整合时降至17.4%,在直接注入时降至3.5%;DeepSeek对应数值分别为75.7%、20.0%、10.4%和3.5%。
    • 作者解读:作者称单技能将中间信息保留在记忆中而非共享记录,导致ASR大幅下降;而在记录显式否决授权后,GPT-5.4的输出篡改仍取得38.7%的成功率。

    技能包数量影响

    • 变体测试设置:将技能包数量从1变化到6,默认设置为Script Acquisition与Work Loop为5个、其余为4个。
    • 结果数据表现:据Figure 4与Table 9,GPT-5.4在Output Tampering上的ASR在4包时达到90.3%,增至5包时下降至45.2%;DeepSeek相应从77.4%降至54.8%;Work Loop在5包时两个模型达到最高token倍率(15.00×与20.66×)。
    • 作者解读:作者称增加技能包数量并未使攻击成功率呈现一致上升趋势。

    污点引导提示防御评测

    • 防御机制与测试:在技能调用后将新建或修改文件标记为不可信,并在GPT-5.4上提示智能体结合原始请求核对文件内容。
    • 测试结果数据:据Table 4与Table 12,定向动作总ASR由84.3%降至59.1%(68/115),Work Loop消耗由15.00×降至7.50×;但在72个良性任务上,测试通过率从86.7%降至56.3%(下降30.4个百分点)。
    • 作者解读:作者称该提示策略虽降低了部分攻击成功率,但严重损害了良性工作流的任务完成能力。

    其他消融与分析

    • 结构消融下GPT-5.4在Work Loop中的token倍率:完整链为15.00×,显式未授权为1.71×,单技能为1.06×,直接注入为1.10×(据Table 3)。
    • 技能包数量为1时GPT-5.4在Work Loop中的token倍率为1.12×,DeepSeek为2.86×(据Table 9)。
    • 技能包数量为6时GPT-5.4在Work Loop中的token倍率降为4.71×,DeepSeek降为18.21×(据Table 9)。
    • 开启提示防御后GPT-5.4在File Modification上的ASR仍保持在76.0%,仅比无防御下降8.0个百分点(据Table 4)。
    • 开启提示防御后GPT-5.4在Output Tampering上的效用从89.6%降至44.2%(据Table 4)。
  5. 有什么可以进一步探索的点?

    作者指出结果汇总、任务重叠与未测自适应攻击等局限;实验覆盖6个模型与单项防御。

    作者指出的局限与后续方向

    • 未报告单次运行的联合分布:结果按实验条件汇总报告,作者指出无法从单一条件下的高任务效用推断出每次成功的攻击都保留了有用工作(出自附录 A)。
    • 任务在家族间存在重叠:同一项任务可以出现在多个攻击家族中,作者指出跨家族的评估结果不应被视为独立观测(出自附录 A)。
    • 结构消融未分离因果效应:将授权改为否决相当于引入了禁令而非单纯移除授权;合并技能包同时改变了指令到达模型的方式,因此对照实验仅描述具体配置差异,未能分离记录中单一语句的因果影响(出自附录 A)。
    • token比率未直接估计转移参数:实测的token倍率并未估计返回模型的转移概率参数,合并技能或引入防御可能同时改变多项转移概率和单步成本(出自附录 A、E.3)。
    • 防御评测未涵盖自适应攻击者:防御实验仅在GPT-5.4上评估未作调整的攻击链,未测试攻击者针对该防御策略进行自适应调整后的表现(出自附录 A)。

    实验覆盖范围

    • 被测模型数量与选型:实验覆盖Claude Sonnet 5、DeepSeek V4 Flash、GPT-5.4、Gemini 3.5 Flash、Grok 4.5、Kimi K2.6共6个LLM。
    • 基准测试规模:攻击评估基于SkillsBench子集,5个家族的任务量分别为30、29、25、31、15个,对应的原生验证项为251、190、217、249、113个;良性对照覆盖72个任务共533项验证。
    • 防御测试范围:结构消融仅在DeepSeek V4 Flash与GPT-5.4上运行,污点引导提示防御仅在GPT-5.4上进行了评测。
    • 参数与查询未报告信息:论文未报告离线搜索与迭代候选链时的具体查询次数与时间开销,亦未在正文列出攻击生成所用的具体辅助模型与迭代预算上限。
  6. 总结一下论文的主要内容

    APEX通过跨技能传递虚假授权实现74.2%的动作诱导率,揭示了多技能协同的安全风险。

    论文针对大语言模型智能体使用多技能串联时的安全隐患,提出对抗性技能链构建框架APEX。

    • 核心问题:探讨当智能体依序执行多个技能时,攻击者如何利用共享的工作区进度记录传递虚假授权声明,从而绕过指令层级保护并诱导智能体执行违规动作。
    • 方法机制:APEX将恶意目标拆解编排至技能链中,上游技能促使智能体生成记录正常进展且夹带伪造授权的文件,下游技能据此触发越权操作;框架在沙箱中基于试运行反馈进行迭代调优。
    • 关键实验结果:在SkillsBench上针对6个前沿模型的4个定向动作家族测试中,完整技能链诱发目标动作的平均ASR达到74.2%(512/690);在GPT-5.4上达到84.3%,而单技能整合工作流与直接注入的ASR仅为17.4%和3.5%;Work Loop导致单任务平均token消耗放大至原生基准的2.20×至36.39×;攻击下原生任务效用得分变动幅度较小。
    • 防御测试发现:基于工作区文件标记的污点引导提示防御将GPT-5.4的定向动作ASR降至59.1%,但导致72个良性任务的测试通过率从86.7%降至56.3%。
    • 作者结论:作者认为单纯依赖单技能检查或原生任务成功率无法防范跨技能授权传递风险,后续亟需在保留合法任务执行能力的同时校验跨阶段指令来源。
阅读原文arxiv.org