跳到正文
原文
arXiv· arXiv:2609.03884· Pengxun Li·原文 · 入选 精选关注度34

HookPry:利用插件生命周期钩子更新劫持 AI Agent 框架

A Blind Trust, the Bloody Thrust: When Attacker-Controlled Hook Updates Steer AI Agent Harnesses towards Malicious Behaviors

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

HOOKPRY利用插件生命周期钩子更新机制对7个智能体框架实施供应链攻击,在1000次运行中微平均E2E-ASR达77.0%。

威胁模型攻击者仅通过公开市场或社区注册表的带版本插件运作,无本地或仓库访问权限,不注入提示词或工具结果,不修改框架,不利用实现漏洞,不绕过沙盒,不强行安装或触发事件;仅控制插件元数据、版本与生命周期钩子配置,先发布良性版本再发布更新添加或修改钩子;直接目标是未经授权的命令执行。

问题
现代AI智能体框架引入生命周期钩子以执行自动化Shell命令。此类钩子在框架底层运行且位于大语言模型推理闭环之外,框架对更新包无条件信任,导致攻击者可通过版本更新植入恶意命令。
方法
提出HOOKPRY框架,由对抗清单优化(AMO)提升良性插件检索率、时间解耦(TD)利用信任与验证时间差筛选最弱边界并条件激活有效载荷、最小公共接口(LCI)跨框架编译原生钩子配置。
实验与结果
在7个框架与5个后端的1000次测试中,HOOKPRY微平均E2E-ASR达77.0%,Hermes上达92.5%;转换后的MCP攻击E2E-ASR仅56.0%,显著低于原生钩子的92.0%。
局限与可以继续做的
威胁模型假定插件被正常安装与更新;实验基于合成资产的临时环境,未穷尽操作系统、网络和企业策略;现有三款静态防御联合漏报率达47.5%,且未测试动态分析或商用产品。
实验设置Claude Sonnet 4.6、DeepSeek-V4-Pro 等 · 40 abstract case seeds、MCPTox 等 · E2E-ASR、Mechanism Utility 等
模型
Claude Sonnet 4.6DeepSeek-V4-ProKimi-K2.6GLM-4.7-FlashGitHub CopilotDeepSeek-V4-Flash
基准
40 abstract case seedsMCPToxanonymous, sanitized 40:40 corpus
指标
E2E-ASRMechanism UtilityRecallEvasionFPR
AI 导读和推荐理由全文 354 字

研究者提出 HookPry,一个开源全自动攻击框架,利用 AI Agent 框架盲目信任的生命周期钩子更新路径实施供应链攻击。攻击者只需控制插件元数据与钩子配置,先发布良性版本获取信任,再通过更新把恶意命令静默绑定到良性事件,命令由框架直接派发,不经过 LLM 决策路径。HookPry 由对抗性清单优化、时间解耦和最小公共接口三部分组成,实现十种攻击目标。在 7 种框架与 5 种 LLM 后端共 25 种组合、1000 次端到端运行中,全部 7 种框架被攻破,Hermes 上成功率最高达 92.5%,整体微平均 E2E-ASR 为 77.0%,机制触发率 83.9%,无一次被模型显式拦截。防御方面,Microsoft Defender 召回率为 0%,三种静态防御联合仍漏掉 47.5% 的恶意样本。

推荐理由论文把生命周期钩子更新路径单独列为供应链攻击面,并给出跨 7 种 Agent 框架的自动化验证与防御缺口数据。

深度解读

6 个问题,约 8,000 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    智能体框架信任插件钩子更新,使攻击者可通过版本更新在模型推理流外静默执行恶意命令。

    这篇论文试图解决现代 AI 智能体框架对插件生命周期钩子的信任机制缺陷,导致攻击者可通过供应链版本更新在模型决策流外静默触发宿主机恶意行为的问题。

    • 场景与重要性:作者指出,Claude Code、OpenClaw 等智能体框架具备高级文件系统与进程权限,其生命周期钩子将 Shell 命令绑定至会话启动、工具调用等运行时事件以实现自动化,构成了安全关键的控制平面。
    • 现有方法的不足:作者称,现有研究多集中于恶意插件代码、工具描述投毒或提示注入,依赖模型对文本的理解与选择;尚未将框架托管的生命周期钩子作为独立的供应链攻击目标展开系统研究。
    • 核心观察与假设:生命周期钩子在事件触发后由框架直接派生子进程执行,位于模型推理闭环之外;框架在插件更新时自动同步并信任既有标识,未对新增或变更的钩子执行逐项确认与重新授权。
    • 威胁模型:
      • 攻击者目标:实现未经授权的命令执行;在钩子子进程权限内进一步达成凭据收集、数据窃取、持久化、操纵、提权等 10 项攻击目标。
      • 攻击者知识与能力:攻击者仅通过公开市场或社区注册表发布带版本的插件,仅控制插件元数据、版本号与生命周期钩子配置;先发布良性版本获取信任,后续发布更新添加或修改钩子。
      • 攻击者限制:无本地或仓库访问权限,无法注入提示词或工具结果,不修改框架代码,不利用实现漏洞,不绕过沙盒,不强行安装插件,也不强行触发事件。
      • 受害系统:具有生命周期钩子机制与宿主机执行权限的异构 AI 智能体框架(评估覆盖 Claude Code、OpenClaw、OpenHarness、Codex CLI 等 7 种框架)。
    • 提出的解决方案:论文提出了开源自动化攻击框架 HOOKPRY,通过对抗清单优化、时间解耦与最小公共接口,系统化验证跨异构智能体框架的供应链生命周期钩子攻击通路。
  2. 有哪些相关研究?

    现有工作主要关注提示注入、工具描述投毒与恶意代码,未系统研究框架层生命周期钩子的信任迁移。

    智能体架构与工具执行基础

    • 工具调用与多智能体框架:ReAct(Yao et al., 2023)、Toolformer(Schick et al., 2023)、GPT4Tools(Yang et al., 2023)与 ToolkenGPT(Hao et al., 2023)探索了语言模型调用工具的机制;AgentBench(Liu et al., 2024)与 AutoGen(Wu et al., 2024)建立了智能体评测与编排基础。作者指出,这些工作确立了工具执行层的重要性,但未研究通过版本化生命周期钩子进行的信任迁移。

    模型介导的攻击与评测基准

    • 提示注入与安全评测:Greshake et al.(2023)、Liu et al.(2024)、DataSentinel(Liu et al., 2025)与 AgentVigil(Wang et al., 2025)研究了直接与间接提示注入及其防御;AgentDojo(Debenedetti et al., 2024)、AgentHarm(Andriushchenko et al., 2025)与 Agent Security Bench(Zhang et al., 2025)提供了智能体攻防评测环境;Crescendo(Russinovich et al., 2025)与 StrongREJECT(Souly et al., 2024)研究了多轮越狱与评估准则。作者指出,HOOKPRY 的命令无需模型解释、生成或选择,模型层的提示词拒绝无法阻止框架派生已注册的命令。

    智能体投毒与供应链风险

    • 知识投毒与 IDE 后门:AgentPoison(Chen et al., 2024)与 PoisonedRAG(Zou et al., 2025)分析了记忆与检索知识库投毒;Cuckoo(Liu et al., 2025)与 Shi et al.(2026)研究了针对 AI-IDE 的持久化攻击与工具选择劫持。
    • 协议与技能供应链风险:MCP 规范(2025)推动了针对模型上下文协议的威胁建模与工具投毒研究(Beurer-Kellner & Fischer, 2025; MCPTox, Wang et al., 2026; MSB, Zhang et al., 2026);DyMalSkill(Chen et al., 2026)、ToxicSkills(Beurer-Kellner et al., 2026)与 Snyk 报告(Bors, 2026)披露了技能供应链投毒与沙盒绕过。作者指出,此类攻击主要通过可见描述或返回值影响模型决策,而 HOOKPRY 针对框架直接解释的事件与命令绑定。

    对比基线与使用基准

    • 对比基线与基准:在对比实验中,作者将源自 MCPTox(Wang et al., 2026)的 50 个工具描述投毒样本转换为生命周期钩子上下文注入(MCP2Hook)作为基线;在防御评估中,选取通用端点杀毒软件 Microsoft Defender、配置 5 条通用规则的 Semgrep 1.172.0,以及配置 8 条生命周期钩子规则的 HookPolicy 0.1.0 作为检测基线。

    作者定位的区别

    • 作者称公开漏洞与厂商报告仅展示了个别生命周期钩子的执行原语,而本文首次给出了跨版本、跨异构框架端到端自动化的生命周期钩子供应链攻击构建与系统评估。
  3. 论文如何解决这个问题?

    HOOKPRY 通过对抗清单优化提升检索、时间解耦定位弱验证边界、最小公共接口跨框架编译原生钩子配置。

    整体思路是将攻击构建解耦为三阶段依赖链:通过 HOOKPRY 框架依次执行对抗清单优化、时间解耦探针分析与跨框架最小公共接口编译。

    对抗清单优化(AMO):良性载体构建与多意图检索

    • 良性载体形式化:初始良性插件表示为 p(0) = (m, hb),其中 m = (n, d) 包含插件名称 n 与自然语言描述 d,hb 为实现声明功能的良性钩子。AMO 仅优化元数据 m,以在保持良性执行行为不变的前提下提升其在目标类别 C 内的检索可见性。
    • 多意图代理目标函数:针对目标类别构建代理意图集合 QeC,候选元数据通过公式优化: Jθ(m) = α 1/(|QCe|) ∑q ∈ QCe sq(m) + β minq ∈ QCe sq(m) + γ S(f(m), μG) 该目标函数在单纯形参数下权衡平均意图覆盖度、最弱意图保障以及与参考良性插件类别质心的一致性。
    • 参数选择与实例差异性约束:在开发集上通过非劣容差约束冻结最优参数组合;随后在保持检索性能处于近最优集合内,通过最小化与参考良性插件的最大相似度来确保实例级别的独特性。

    时间解耦(TD):信任边界探测与条件激活

    • 候选边界与良性探针:针对框架的候选信任边界集合 BH,TD 部署仅写入随机标记与执行证据的良性探针 zb,测量进入边界前的验证强度 VH(b)、针对钩子的独立授权要求 AH(b)、运行时权限 RH(b) 以及可观测性 OH(b)。
    • 信任缺口量化:通过公式评估边界结构性不对称: GH(b) = OH(b) [λr RH(b) − λv VH(b) − λa AH(b)] 该指标量化了在保证可靠可观测的前提下,运行时权限与安全验证/授权强度之间的差距。
    • 弱边界筛选与条件特化:在满足有效载荷能力需求且达到可观测阈值的可行集合中,选取信任缺口最大的边界;进而生成边界谓词 χH,特化有效载荷使得仅在满足该谓词时激活恶意分支,其余状态保持良性行为。

    最小公共接口(LCI):跨框架语义抽象与原生配置编译

    • 接口建模与能力交集:将框架的钩子接口建模为包含事件集合、插件清单模式、命令执行契约与子进程权限的四元组,提取跨框架共享的能力交集。
    • 最小充分规范提取:针对攻击目标的预期效果与必要执行条件,从共享能力集中剔除无关能力,求解出保留跨框架攻击语义的最小充分规范。
    • 原生事件与配置生成:在目标框架中优先选择附加依赖最少的原生事件,由适配器编译为目标框架的原生命令字符串与清单配置编码,确保同一攻击语义在各框架原生语法下均可执行。

    攻击目标分类与成功判定机制

    • 三维攻击目标分类:依据目标资产(凭据、数据、源码、工具输出通道、计算资源、配置、目录)、受害消费者(远程服务、开发者、LLM、框架强制机制、同级项目)与通信模式(提取、交互控制、修改、复制),映射并定义了 10 个互斥的攻击目标(Table 1)。
    • 外部独立预言机验证:评测不依赖单一进程派生或工具调用,通过独立预言机检查预注册的外部状态变化,作为端到端攻击成功的判定依据。
  4. 论文做了哪些实验?

    1000次跨环境测试微平均E2E-ASR达77.0%,原生钩子攻击效果显著优于MCP投毒,静态防御漏报47.5%。

    实验设置

    • 被测系统与后端:测试了 7 个 AI 智能体框架(OpenHarness、OpenClaw、Claude Code、Codex CLI、OpenCode、Hermes、WorkBuddy)与 5 个 LLM 后端(Claude Sonnet 4.6、DeepSeek-V4-Pro、Kimi-K2.6、GLM-4.7-Flash、GitHub Copilot),涵盖 25 组框架与后端组合;RQ2 与 RQ3 额外使用 DeepSeek-V4-Flash。
    • 数据集与测试用例:主实验包含 40 个抽象攻击案例,共执行 40 × 25 = 1,000 次端到端测试;RQ2 包含源自 MCPTox 的 50 个恶意工具描述投毒目标;RQ4 构建了 40:40 的匿名清洗静态语料库(40 个恶意工件与 40 个匹配良性对照)。
    • 基线与对比方法:RQ2 设置了将 MCP 工具描述转换为钩子上下文注入的 MCP2Hook 对比基线;RQ4 评估了 Microsoft Defender、Semgrep 1.172.0 与 HookPolicy 0.1.0 三款静态防御基线。
    • 指标定义:主要指标为验证端到端攻击成功率(E2E-ASR = Npass / Nattempted,部分成功计为 0 分);同时报告机制效用(Mechanism Utility,即钩子触发、载荷加载或钩子注册等步骤实际启动的比例)、召回率(Recall)、逃逸率与假阳性率(FPR)。
    • 评审方式与环境:由独立外部预言机检查预注册的外部效果以给出判定(pass、partial、blocked、fail);单次测试超时时间为 120 秒,采用提供商默认采样参数并在隔离临时目录中运行。

    主结果

    下表汇总了 HOOKPRY 在各目标框架下的端到端攻击成功率与机制效用,以及在三类代表性攻击目标上的表现:

    表格较宽,可左右滑动

    目标框架 (Harness)总体 E2E-ASR机制效用 (Utility)凭据收集 (COL)提权 (ESC)持久化 (PER)
    Hermes92.5%91.5%95.2%100.0%91.7%
    WorkBuddy90.8%93.3%90.5%100.0%100.0%
    OpenCode90.6%93.8%96.4%100.0%100.0%
    OpenClaw81.9%83.8%100.0%100.0%6.2%
    OpenHarness71.7%80.8%81.0%66.7%83.3%
    Codex CLI65.0%75.0%71.4%100.0%0.0%
    Claude Code52.5%72.5%60.7%87.5%6.2%

    (数据源自 Table 2 与 Table 3;目标系统即各框架自身,无代理模型设置;表中展示了 7 个框架的完整行,列上省略了数据窃取、资源劫持、C2、篡改、操纵、规避与传播等 7 类目标及宏平均列)

    • 框架渗透普遍性:作者报告,HOOKPRY 在 1,000 次运行中获得 770 次 pass、34 次 partial 和 196 次 fail,无任何一次被框架显式拦截(blocked 为 0),微平均 E2E-ASR 为 77.0%(宏平均 77.9%),所有 7 个被测框架均被成功渗透。
    • 机制效用与最终效果差距:生命周期钩子在约 82.0% 的测试中实际触发,总体机制效用达 83.9%,高于端到端成功率;作者指出机制启动并不等同于外部效果达成,后触发阶段的环境和策略约束是主要差距来源。
    • 攻击类别的能力依赖差异:依赖常规子进程权限的目标(如提权宏平均 93.5%、资源劫持 93.4%)成功率处于高位;而依赖网络可达性与持久文件状态的目标受制于环境策略,成功率相对偏低(C2 宏平均 41.7%、持久化 55.3%)。

    模型独立性分析(RQ1.2)

    • 测试内容:固定测试用例、适配器与预言机,通过跨 LLM 后端的标准差评估模型变动对各框架攻击成功率的影响(Figure 5)。
    • 实验结果:Codex CLI 在不同后端间的 E2E-ASR 标准差为 0.0 个百分点;OpenClaw 与 Claude Code 的标准差分别为 1.1 个百分点与 2.5 个百分点;OpenCode、Hermes、WorkBuddy 与 OpenHarness 的标准差在 4.5 至 9.6 个百分点之间(Figure 5、Section 4.2)。
    • 作者解读:作者认为,在匹配事件触发后,钩子派生与执行由框架控制,呈现模型独立性;部分框架的成功率波动源于不同后端的工具调用习惯差异改变了事件触发概率,而非执行机制本身不稳定。

    恶意 MCP 工具描述转换对比(RQ2)

    • 测试内容:在 Claude Code 与 DeepSeek-V4-Flash 下,将 50 个源自 MCPTox 的工具描述投毒目标转换为钩子上下文注入(MCP2Hook),与原生 HOOKPRY 进行配对比较(Table 4)。
    • 实验结果:原生 HOOKPRY 达成 46/50 成功(E2E-ASR 为 92.0%,Wilson 95% CI: 81.2%–96.8%);MCP2Hook 达成 28/50 成功(E2E-ASR 为 56.0%,Wilson 95% CI: 42.3%–68.8%),单侧精确二项检验 p = 7.09×10⁻¹²(据 Table 4)。
    • 作者解读:作者认为,MCP2Hook 仅注入描述,仍需模型决策触发工具调用;原生 HOOKPRY 直接从生命周期事件派生命令,消除了模型决策门控,因此攻击效果显著更优。

    静态防御基线有效性评测(RQ4)

    • 测试内容:在包含 40 个恶意工件与 40 个良性对照的匿名语料库上测试 Microsoft Defender、Semgrep 与 HookPolicy 的检出能力(Table 6)。
    • 实验结果:Microsoft Defender 检出 0/40(召回率 0.0%);HookPolicy 检出 20/40(召回率 50.0%);Semgrep 检出 19/40(召回率 47.5%);三者联合检出 21/40,联合漏报率为 47.5%(19/40);所有工具在良性样本上的假阳性率均为 0.0%(据 Table 6)。
    • 作者解读:作者认为现有端点杀毒软件与静态规则基线漏报较多,无法充分抵御此类工件,需要引入安装更新时的显式钩子审查与运行时权限控制。

    其他消融与分析

    • 完整 HOOKPRY:有效载荷加载率 100.0%,钩子注册率 100.0%,E2E-ASR 为 92.0%(Table 5)。
    • 移除 AMO(采用质心检索 A0):载荷加载率 100.0%,钩子注册率 100.0%,E2E-ASR 降至 75.6%,较完整系统下降 16.4 个百分点(Table 5)。
    • 移除 TD(禁止继承既有执行授权):载荷加载率降至 0.0%,钩子注册不可达,E2E-ASR 降至 0.0%,较完整系统下降 92.0 个百分点(Table 5)。
    • 移除 LCI(无原生接口适配):载荷加载率 100.0%,钩子注册率降至 0.0%,E2E-ASR 降至 0.0%,较完整系统下降 92.0 个百分点(Table 5)。

    负面结果与例外分析

    • 特定框架下的低成功率:Codex CLI 在持久化(PER)与命令控制(C2)上的 E2E-ASR 均为 0.0%,OpenClaw 的持久化成功率仅为 6.2%(Table 2);作者解释称受限于特定框架的网络策略、文件系统策略与隔离机制。
    • 篡改目标在 Claude Code 上的表现:工具输出篡改(TAM)在 Claude Code 上的 E2E-ASR 仅为 6.2%(Table 2),论文未对此处的低数值给出额外原因说明。
  5. 有什么可以进一步探索的点?

    作者指出安装采纳率未测及环境未穷尽等局限,未来可探索动态分析、最小特权钩子与更新授权机制。

    作者指出的局限与后续方向

    • 真实安装与采纳率未测:威胁模型假定插件通过正常途径安装并采纳更新;AMO 仅衡量检索机会,未测试实际的安装与更新采纳率;作者指出未来工作可探索在不依赖真实用户数据的情况下测量市场检索与更新采纳(Section 5)。
    • 测试环境配置未穷尽:实验采用带有合成资产的临时环境,未穷尽操作系统、Shell、企业策略、网络条件或未来版本;作者指出后续方向应扩展在多样化系统环境、框架版本与企业策略下的覆盖范围(Section 5)。
    • 攻击效果受制于权限且排除漏洞利用:HOOKPRY 排除了框架实现漏洞与沙盒逃逸;其最终攻击效果依赖于事件发生、钩子授权与子进程权限,导致命令控制和持久化目标的成功率相对偏低(Section 5)。
    • 防御评估未包含动态分析:防御评估仅测试了 2 个通用静态扫描器和 1 个针对钩子的静态规则基线,未包含动态分析技术或商业安全产品;作者指出后续工作需构建更具代表性的良性插件基准(Section 5)。
    • 防御机制的落地探索:作者指出未来工作应评估签名绑定、差异化更新授权、最小特权钩子以及工具输出完整性校验等机制(Section 5)。
    • 跨后端事件预测模型:由于不同 LLM 后端的工具调用行为差异影响事件生成,作者指出未来可开发更具鲁棒性的事件预测模型以应对模型间的行为差异(Section 4.2)。

    实验覆盖范围

    • 被测系统覆盖:被测智能体框架包括 OpenHarness、OpenClaw、Claude Code、Codex CLI、OpenCode、Hermes 和 WorkBuddy 共 7 个;LLM 后端包括 Claude Sonnet 4.6、DeepSeek-V4-Pro、Kimi-K2.6、GLM-4.7-Flash、GitHub Copilot 以及 DeepSeek-V4-Flash 共 6 个(Section 4.1)。
    • 测试用例与实验规模:主实验设计了 40 个抽象攻击案例,在 25 组框架与后端组合中执行了 1,000 次端到端测试;MCP 对比实验包含 50 个源自 MCPTox 的测试目标;静态防御评测包含 40:40 的恶意与良性对照样本(Section 4.1、4.3、4.5)。
    • 防御工具范围:评测的防御工具覆盖 Microsoft Defender、配置 5 条通用规则的 Semgrep 1.172.0,以及配置 8 条规则的 HookPolicy 0.1.0 静态基线(Section 4.5)。
    • 测试环境配置:所有端到端测试均在包含合成资产的临时隔离环境中进行,单次测试超时时间设置为 120 秒,采用提供商默认采样参数(Section 4.1、4.3、Ethical Considerations)。
    • 未报告信息:论文未报告真实市场用户的插件下载量与更新安装率,未报告不同运行操作系统与 Shell 版本的分布细节,未报告静态扫描器的检测耗时(Section 4.5、5)。
  6. 总结一下论文的主要内容

    论文揭示了智能体框架钩子更新的供应链攻击面,提出了 HOOKPRY 框架并在测试中取得 77.0% 的成功率。
    • 论文定位:该研究揭示了现代 AI 智能体框架在插件生命周期钩子更新路径上的信任失效,提出了首个跨框架自动化的生命周期钩子供应链攻击框架 HOOKPRY。
    • 解决的问题:智能体框架将系统 Shell 命令绑定至运行时事件,且在框架底层独立派生子进程,绕过了大语言模型的推理闭环;框架在插件更新时继承既有信任,使攻击者可通过元数据和钩子配置更新静默植入并执行恶意命令。
    • 方法要点:HOOKPRY 串联三项机制:对抗清单优化(AMO)利用多意图代理目标提升良性插件检索概率;时间解耦(TD)利用良性探针定位低验证高权限的信任边界并实施条件激活;最小公共接口(LCI)提取通用能力规范并编译为目标框架的原生钩子配置。
    • 关键实验结果:
      • 在 7 个框架与 5 个后端的 1,000 次端到端测试中,HOOKPRY 微平均 E2E-ASR 达到 77.0%,在 Hermes 上达到 92.5%,在 Claude Code 上为 52.5%(Table 2)。
      • 在跨模型测试中,Codex CLI 的后端间标准差为 0.0 个百分点,Claude Code 为 2.5 个百分点,体现了事件触发后执行路径与模型的解耦特性(Figure 5)。
      • 在 50 个目标对比中,HOOKPRY 原生钩子的 E2E-ASR 为 92.0%,显著高于转换后 MCP 描述投毒的 56.0%(单侧二项检验 p = 7.09×10⁻¹²,Table 4)。
      • 在 40:40 静态测试中,Microsoft Defender 召回率为 0.0%,三款静态防御联合漏报率达到 47.5%(Table 6)。
    • 作者结论与启示:作者指出,模型层的内容安全过滤无法触及推理流之外的钩子执行;智能体安全必须将插件更新审查、钩子独立重新授权、子进程最小特权分配与运行时监控纳入全链路防护。
阅读原文arxiv.org