SigLeak 可从执行轨迹推断专有 Agent 技能,平均提升成功率 6.88 个百分点
Agent Skills Matter: Inferring Proprietary Skills from Execution Trajectories
作者针对黑盒智能体提出 SigLeak 框架,仅凭良性查询配对轨迹比对推断专有技能,全场景平均提升成功率 6.88 个百分点。
黑盒威胁模型。攻击者仅知公开任务描述,无权访问技能文件与内部状态;通过向搭载专有技能的目标智能体发送良性任务查询并观测执行轨迹,推断其程序性技能。
- 服务商将高价值智能体技能部署在私有后端,但为便于人工监督而暴露的执行轨迹构成了行为侧信道,面临专有程序性知识被逆向推断的风险。
- 构建两阶段黑盒推断框架 SigLeak,由生成器构造高决策密度良性探针,由合成器对照比对技能启用与禁用的配对轨迹以提取签名并迭代重构。
- 在 5 个场景和 6 种智能体配置下,SigLeak 重构技能相比无技能基线平均提升成功率 6.88 个百分点,并在细粒度语义匹配指标上优于基线。
- 推断采用固定的提示模板与探针预算,主实验依据消融将细化截断为 2 轮;实验在本地受控环境中进行,未在商业部署环境中测试动态自适应策略。
- 模型
- GPT-5.4-miniGPT-5.5GLM-5.2MiniMax-M3
- 基准
- SpreadsheetBenchOfficeQASealQALiveMathematicianBenchALFWorld
- 指标
- SRCoarse SkillSimFine SkillSim F1Fine SkillSim RecallFine SkillSim Precision
研究者提出 SigLeak,一个仅凭公开任务描述和黑盒交互就能从执行轨迹中推断专有 Agent 技能内容的框架,并将这一威胁形式化为 Skill Leakage。方法分两阶段:先用诊断任务构造生成多样且决策密集的探针,再对比同一探针在启用与禁用目标技能下的配对轨迹,提取可复现的技能签名并迭代精炼重建结果,全程不需要参考答案或轨迹级正确性标注。在五个场景、三个模型家族和三个 Agent 框架上,SigLeak 在几乎所有设置中取得最佳或并列最佳的下游成功率,平均比禁用技能的基线高 6.88 个百分点,细粒度 SkillSim 的 F1 与召回率也最高。在 SkillGuard5 提示防御下,提示窃取基线 BBS 的细粒度召回与 F1 为零,而 SigLeak 仍能恢复目标技能内容。作者指出,隐藏技能文件并不能隐藏其行为影响,需要在不牺牲执行可见性的前提下设计针对行为推断的防御。
推荐理由论文把专有 Agent 技能被行为轨迹反推的风险形式化,并给出可复现的黑盒推断流程与跨模型评测结果。
深度解读
这篇论文试图解决什么问题?
探究黑盒智能体专有技能如何通过良性查询激发的执行轨迹产生行为侧信道泄露,并提出非侵入式推断框架。
这篇论文试图解决黑盒部署下的智能体专有技能内容通过执行轨迹产生行为侧信道泄露的问题。
- 背景与重要性:智能体技能将领域知识、工具使用规范与可复用流程封装为轻量模块,促成了技能市场与智能体即服务(AaaS)模式;服务商常将高价值技能保留在私有后端以保护商业利益。
- 执行可见性带来的旁路暴露:由于智能体界面通常向用户展示工具调用与执行进展以支持人工监督与干预,后端隐藏并未消除技能对行为的影响,形成了行为侧信道。
- 现有提取与构建方法的不足:提示词窃取攻击依赖显式提取指令,容易被防御拦截;而传统技能生成与演化方法依赖高质量示范或明确的成败监督标签。
- 核心观察与推断思路:技能会在轨迹中留下反复出现的行为线索(技能签名);作者提出了专有技能泄露推断框架 SigLeak,仅用良性任务查询即可推断隐藏技能。
- 威胁模型:
- 攻击目标:推断受害智能体搭载的专有技能程序性内容,构建功能近似技能。
- 攻击者知识:黑盒访问目标智能体,仅知晓公开任务描述,无权访问技能文件、内部状态、参考答案或轨迹正确性标签。
- 攻击者能力:只能提交不含索取技能意图的良性任务查询,并观测用户可见的执行轨迹。
- 受害系统:运行在私有后端、配备专有技能的工具增强型大语言模型智能体。
有哪些相关研究?
梳理了智能体技能构建、基于轨迹反馈的技能演化,以及指令与轨迹泄露相关研究,并指明与本文黑盒良性推断的区别。
- 智能体技能的构建与管理:
- Anthropic(2025)与 Xu 和 Yan(2026)将技能形式化为封装流程与工具规范的轻量构件;Anthropic(2026)、Ma 等人(2026)及 Wang 等人(2026b)研究了面向智能体的技能创建与合成方法。
- Liang 等人(2026)与 Shen 等人(2026)从代码仓库与文档中大规模收集技能;Li 等人(2026a)与 Zhou 等人(2026c)构建了多任务技能评测基准。
- 基于执行反馈的技能演化:
- Ni 等人(2026)的 Trace2Skill 与 Yu 等人(2026)分析执行轨迹以提炼新技能或编辑已有技能。
- Yang 等人(2026a)的 SkillOpt 与 Zhang 等人(2026)利用部署中的任务执行反馈,在文本空间持续优化可编辑的技能文本。
- Wang 等人(2026c)与 Xia 等人(2026)结合强化学习实现智能体技能的自我演化。
- 指令与轨迹泄露安全:
- Zhang 等人(2024)与 Hui 等人(2024)研究大模型系统提示词的提取;Wang 等人(2025)分析了智能体记忆中的隐私泄露。
- Wang 等人(2026d)提出黑盒技能窃取攻击 BBS,通过对抗性提取提示词直接索取专有技能内容;作者指出该方法依赖显式窃取意图,易被防护规则防御。
- Xu 等人(2026)的 RedAct 研究针对防御方公开发布的成功轨迹语料的离线程序性技能提取;作者指出该方法仅处理预先收集的制品,而非交互式黑盒推断。
- 基线方法与基准选择:
- 实验对比的基线包括 Direct Generation(仅凭任务描述单次生成技能)、Naive Trace Summarization(仅凭单向技能开启轨迹进行无对照总结),以及对抗性提示提取基线 BBS(搭配 SkillGuard5 防御)。
- 评测在 SpreadsheetBench、OfficeQA、SealQA、LiveMathematicianBench 和 ALFWorld 五个基准上展开。
作者称,SigLeak 是首个在无参考答案和正确性标注的黑盒交互下,利用良性诊断探测与对照轨迹比较来实现主动技能泄露推断的框架。
- 智能体技能的构建与管理:
论文如何解决这个问题?
提出 SigLeak 框架,通过两阶段工作流生成高决策密度探针,并比对配对轨迹差异提取签名以迭代重构专有技能。
通过两阶段工作流生成良性诊断探针,并对比技能启用与禁用条件下的配对执行轨迹以提取签名,迭代重构专有技能 SigLeak。
问题形式化与核心概念
- 推断目标:形式化为 ŝ = 𝒢(d; 𝒜s∗),表示推断方法依据公开任务描述与黑盒智能体交互,重构专有技能的程序性内容。
- 技能签名:定义为技能在执行轨迹中引起的反复出现的行为模式,包括需求理解、资源检查、工具选择、错误恢复与输出构建等可观测差异。
- 配对执行协议:保持测试提示词固定,一组作为技能启用条件,另一组前置显式不调用指令作为对照,从而过滤与技能无关的任务固有行为和基座模型偏置。
诊断任务生成器(Generator)
- 双重设计准则:遵循任务多样性与决策密度原则;前者变换输入格式、约束与输出契约以防过拟合,后者侧重包含多步关键决策点的场景。
- 阶段一广泛探索:仅基于任务描述构建 6 个互补的诊断探针,覆盖推理、工具选择、中间验证、错误恢复、输出格式化及复杂边界操作。
- 阶段二差异引导细化:探针生成形式化为 Q(r) = Generate(C(r); Π),依据任务描述、当前技能、前期探针摘要及未决分歧,针对性补充 3 个未充分探索行为的探针。
技能合成器(Skill Synthesizer)
- 对照轨迹比对:将配对轨迹映射为差异,把可观测步骤划分为共享行为、技能专有可复用行为、偶然行为及不可观测行为,提取候选签名。
- 技能初始化与更新:首轮汇总跨任务反复出现的规则生成初始技能;后续轮次执行保守更新,增补缺失规则、细化欠具体指令、纠正存在矛盾的内容,保留未冲突规则。
- 终止准则:当新提取的签名不再引发技能规则更新,或探针预算耗尽时终止迭代并输出最终重构技能。
关键参数与实现细节
- 模型配置:生成器与技能合成器均使用 DeepSeek-V4-Flash 模型。
- 轮次与预算:阶段一生成 6 个探针;阶段二每轮生成 3 个探针,主实验中最多运行 2 轮(总计 12 个配对探针)。
- 提示模板:附录 B 报告了探针生成、轨迹对比、技能初始化、技能细化以及技能禁用对照提示词的详细设计。
论文做了哪些实验?
跨 5 个场景、3 个模型家族与 3 种框架评估,SigLeak 平均提升成功率 6.88 个百分点且在细粒度语义匹配上保持领先。
实验设置
- 被测模型与智能体框架:被测模型涵盖 GPT-5.4-mini、GPT-5.5、GLM-5.2、MiniMax-M3;智能体框架包括 Codex(运行 GPT 系列)、OpenCode(运行 GLM-5.2 和 MiniMax-M3)、Hermes(运行 GLM-5.2 和 MiniMax-M3),共 6 种组合。
- 数据集与基准:SpreadsheetBench(电子表格操作与推理,评测 200 个实例子集)、OfficeQA(文档定位与问答,评测 133 个实例)、SealQA(网络检索事实核查,评测 111 个实例)、LiveMathematicianBench(定理多项选择推理,评测 118 个实例)、ALFWorld(家庭具身文本决策,评测 140 个实例)。
- 基线方法:Direct Generation、Naive Trace Summarization、以及带有 SkillGuard5 防御的对抗性提示提取基线 BBS。
- 推断模型与预算:SigLeak 与前两项基线均采用 DeepSeek-V4-Flash 作为推断模型;SigLeak 采用 12 个配对探针(阶段一 6 个,阶段二 2 轮各 3 个),Naive 采用 6 个开启轨迹,BBS 采用 12 个对抗查询。
- 评测指标:下游任务成功率(SR,3 次独立运行求均值);技能相似度 SkillSim,包含 LLM 裁判的整体行为打分 Coarse SkillSim(1–5 分),以及基于技能行为约束(SBC)软对齐计算的细粒度精确率 P、召回率 R 和 F1。
- 重复次数:每个配置均基于 3 次独立运行评估并报告平均值。
主结果
下表呈现 5 个场景下各方法在 6 种模型与框架配置上的平均下游成功率(SR %):
表格较宽,可左右滑动
评测场景 Skill Bounds (w/o / w/) Direct Gen Naive Trace BBS SigLeak Spreadsheet 71.50 / 86.84 78.56 80.75 71.50 84.59 OfficeQA 62.82 / 71.93 66.96 66.29 62.82 69.30 SealQA 43.39 / 53.15 46.29 45.54 43.39 50.85 LiveMath 29.31 / 36.47 31.23 31.23 29.31 35.06 ALFWorld 91.87 / 95.48 92.10 93.77 91.87 93.49 (据 Table 1,表中 Avg 列汇总数据)
- 跨场景推断收益:作者指出,SigLeak 在所有 5 个场景中均改善了相对无技能基准的平均成功率,全配置综合平均提高 6.88 个百分点,且在多类模型与框架组合中取得最高或并列最高成绩。
- 基线对比与防御表现:作者指出,在 SkillGuard5 提示防御下,BBS 恢复的可用技能内容为零,成功率与技能禁用基线完全持平;无对照的 Direct Generation 与 Naive Trace Summarization 虽有改善但幅度较低。
- ALFWorld 场景表现:作者指出,ALFWorld 中 Naive Trace Summarization 的平均成功率略高于 SigLeak,原因在于该任务的顺序控制签名在开启轨迹中直接暴露,使得单向总结更易捕捉规则。
语义保真度评估(SkillSim)
- 测试内容与设置:在 GPT-5.4-mini 上评测推断技能与目标技能的语义相似度,包括粗粒度打分 Coarse SkillSim 和细粒度约束对齐指标。
- 量化结果:Figure 4(a) 显示,SigLeak 在 4 个场景中获得粗粒度最高分;细粒度平均召回率达 20.1%、平均 F1 达 22.8%,高于 Naive Trace(16.4% 和 20.1%)与 Direct Generation(13.5% 和 18.3%);BBS 召回与 F1 均为 0.0%。
- 作者解读:作者认为,对照比较能够捕获更多目标技能的专属程序性约束;尽管 Direct Generation 和 Naive Trace 的精确率略高,但召回率更低。
同领域内相似技能的区分度分析
- 测试内容与设置:在任务上下文相同的设置下,评估 SigLeak 对 3 个不同流程的 arXiv 技能(arxiv-search、arxiv、read-arxiv-paper)的推断区分能力。
- 量化结果:Figure 4(b) 结果呈现对角线占优特征;例如推断的 read-arxiv-paper 技能与目标技能的软 F1 达到 19.64%,而与另外两个技能的匹配软 F1 最高仅为 4.17%。
- 作者解读:作者指出,这表明 SigLeak 提取的是目标技能特有的程序性流程,而非仅生成领域通用的提示词模板。
其他消融与分析
- 阶段一初始推断:在开展阶段二细化前(第 0 轮),初始技能的成功率为 70.83%,细粒度 F1 为 14.10%(Figure 4c)。
- 阶段二迭代轮次分析:随着细化轮次增加,成功率与 F1 均在第 2 轮达到峰值,分别升至 76.17% 与 19.57%,随后轮次出现回落(Figure 4c)。
- 运行稳定性分析:在 GPT-5.4-mini 搭配 Codex 的 3 次独立运行中,SigLeak 在 LiveMath、SealQA、OfficeQA 上的样本标准差分别为 0.65、1.04、1.51 个百分点,长交互的 ALFWorld 场景标准差为 3.93 个百分点(Table 2)。
有什么可以进一步探索的点?
作者指出了固定探针预算与提示模板等局限并提出自适应探索方向,实验覆盖了 5 个场景及 4 个代表性模型。
作者指出的局限与后续方向
- 固定模板与通用预算:生成器与技能合成器采用了固定的提示词模板,并且在不同场景间使用通用的探针预算(Limitations 节)。
- 细化轮次上限设定:阶段二依据消融实验统一将迭代上限截断为 2 轮,但单一全局配置可能无法充分挖掘特定场景独有的轨迹证据(Limitations 节)。
- 动态适配探针与策略:作者指出未来可以根据具体场景动态调整探针预算与技能合成策略(Limitations 节)。
- 受控实验与真实环境差异:所有实验均在基于基准任务与实验配置的本地受控环境下进行,未对商业化智能体服务或非公开技能开展实际探测(Ethical Statement 节)。
实验覆盖范围
- 被测模型与框架规模:被测模型涵盖 GPT-5.4-mini、GPT-5.5、GLM-5.2、MiniMax-M3 共 4 个模型,智能体框架涵盖 Codex、OpenCode、Hermes 共 3 种。
- 测试场景与目标技能数量:主评测覆盖 5 个任务场景,分别对应来自 SkillOpt 的 4 个技能与来自 EvoSkill 的 1 个技能;同领域分析覆盖 3 个公开 arXiv 技能。
- 推断模型与探针开销:推断组件固定采用 DeepSeek-V4-Flash;阶段一使用 6 个探针,阶段二设置两轮各 3 个探针,总计 12 个配对探针(24 次轨迹采样)。
- 未报告信息:论文未报告不同温度等采样超参数对推断稳定性的影响,未报告除 SkillGuard5 外其他防御机制下的推断表现。
总结一下论文的主要内容
提出了通过良性查询和对照轨迹推断黑盒专有技能的 SigLeak 框架,揭示了智能体执行可见性带来的行为侧信道泄露风险。
- 定位与核心问题:研究黑盒部署下智能体专有技能通过执行轨迹产生行为侧信道泄露的风险。
- 要解决的问题:AaaS 平台与开发者将高价值技能保留在私有后端,但人工干预与监督所需的轨迹可见性构成了行为侧信道;现有基于显式提示词的提取攻击容易被防御规则拦截,缺乏从良性交互中推断隐藏技能的方法。
- 方法要点:提出 SigLeak 框架,基于任务多样性与决策密度设计良性诊断探针,并通过对比技能启用与禁用两组配对执行轨迹分离技能签名,经过初始合成与差异引导细化两阶段重构专有技能。
- 关键实验结果:
- 在 5 个评测场景中,SigLeak 重构技能使智能体平均成功率相对技能禁用基准提高 6.88 个百分点(据 Table 1)。
- 在 SkillGuard5 提示防御下,对抗性基线 BBS 恢复内容为零,而 SigLeak 在细粒度 F1 和召回率上均取得最高综合表现(平均 F1 22.8%,召回率 20.1%,据 Figure 4a)。
- 在同领域 3 个 arXiv 技能区分测试中展现出对角线占优的特异性,read-arxiv-paper 技能匹配度达 19.64% F1,对无关技能匹配度低于 4.17%(据 Figure 4b)。
- 迭代细化在第 2 轮达到峰值,成功率升至 76.17%、细粒度 F1 升至 19.57%(据 Figure 4c)。
- 作者结论与启示:作者认为,即使隐藏技能文件并配置提示词防御,专有技能依然会通过执行行为产生侧信道泄露;未来防御需要在保障人工监督可见性与遏制行为推断之间寻求平衡。