跳到正文
原文
论文追踪· arXiv:2608.04192· Peichun Hua, Haoxuan Xu, Mengyuan Li·本站收录 · 原文发表 精选关注度53

研究者提出 SkillClone,仅凭正常提问即可克隆 LLM Agent 隐藏技能功能

Behavioral Skill Reconstruction: Reconstructing Hidden Functionality from LLM Agent Skills

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

SKILLCLONE仅通过良性任务交互重构闭源技能,在GPT-5.6-Luna部署下21个技能平均ASR达73.3%。

威胁模型黑盒威胁模型:攻击者是启用技能的智能体的正常用户,知晓公开描述(advertisement)与任务接口,仅能提交任务有效输入(task-valid inputs),仅能观察最终消息与生成工件;无法查看技能主体(skill body)、捆绑文件、隐藏工具活动、思维链或测试用例;禁止直接泄露文件或窃取指令的查询。

问题
智能体技能常包含专有指令、数据与代码。现有安全研究主要防范直接泄露文件内容的提示注入或偷窃,但防御文件泄露无法阻止功能泄露。使用者能否在底层文件保密的前提下,仅通过普通任务交互重构技能的隐藏功能,成为亟待研究的威胁。
方法
提出黑盒攻击 SKILLCLONE。攻击者根据公开技能描述生成类型化接口假设,使用算子库生成结构化良性探测,将响应解析为观测并合成可执行克隆程序,最后通过差分验证比对受害者与克隆输出,利用不一致输入迭代追加探测与修复。
实验与结果
在涵盖规则、表格、流程和算法的 30 个技能上评测,SKILLCLONE 在最强受害模型上使 18/21 个抓取技能重构 ASR 高于基线;在 DeepSeek Pro 实验中输入检测器仅拦截 6.7% 的探测,输出过滤器拦截率为 0。
局限与可以继续做的
评测范围仅涵盖确定性功能,未涉及交互或主观技能;模型仅测试了 DeepSeek、GLM、Kimi 与 GPT-5.6-Luna 等,未测试私有在线服务;缺乏跨会话身份控制、累计查询监控等针对性防御机制。
实验设置DeepSeek-Flash、DeepSeek-Pro 等 · SkillsBench、SkillRet 等 · ASR、ASR minus floor 等
威胁模型
黑盒威胁模型:攻击者是启用技能的智能体的正常用户,知晓公开描述(advertisement)与任务接口,仅能提交任务有效输入(task-valid inputs),仅能观察最终消息与生成工件;无法查看技能主体(skill body)、捆绑文件、隐藏工具活动、思维链或测试用例;禁止直接泄露文件或窃取指令的查询。目标是构建可执行克隆以恢复挂载技能贡献的边际功能。
模型
DeepSeek-FlashDeepSeek-ProGLM-5.1Kimi-K2.6GPT-5.6-LunaDeepSeek-V4-Flash Preview
基准
SkillsBenchSkillRetpublic registry crawl
指标
ASRASR minus floorTop-1 recallTok.precfid
AI 导读和推荐理由南加州大学研究者提出行为技能重建(BSR)威胁与黑盒攻击 SkillClone,仅通过公开技能描述和任务有效的正常提问,即可为隐藏的 Agent 技能合成可执行克隆。该方法先从公开广告生成类型化接口假设,再用隔离、剂量响应、边界搜索等探测算子构造良性探针,解析回复后用阈值分类器、查表、规则引擎等模式合成克隆,并通过克隆与受害者的差异反复修补。在来自 SkillsBench、SkillRet 和公开注册表爬取的 30 个技能(覆盖规则、表格、流程、算法)上,使用 DeepSeek-Flash、DeepSeek-Pro、GLM-5.1、Kimi-K2.6 和 GPT-5.6-Luna 作为受害者,最强受害者上 21 个挖掘技能中有 18 个超过基线;迭代重查询显著提升覆盖率。

南加州大学研究者提出行为技能重建(BSR)威胁与黑盒攻击 SkillClone,仅通过公开技能描述和任务有效的正常提问,即可为隐藏的 Agent 技能合成可执行克隆。该方法先从公开广告生成类型化接口假设,再用隔离、剂量响应、边界搜索等探测算子构造良性探针,解析回复后用阈值分类器、查表、规则引擎等模式合成克隆,并通过克隆与受害者的差异反复修补。在来自 SkillsBench、SkillRet 和公开注册表爬取的 30 个技能(覆盖规则、表格、流程、算法)上,使用 DeepSeek-Flash、DeepSeek-Pro、GLM-5.1、Kimi-K2.6 和 GPT-5.6-Luna 作为受害者,最强受害者上 21 个挖掘技能中有 18 个超过基线;迭代重查询显著提升覆盖率。

推荐理由论文给出黑盒重建 Agent 技能功能的完整方法与 30 个技能上的量化结果,并说明现有防泄露过滤对其覆盖有限。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    评估攻击者能否在技能文件不被泄露的前提下,仅通过合法任务交互重构闭源智能体技能的隐藏功能。

    核心问题是攻击者能否在不直接泄露底层文件的情况下,仅通过合法的普通任务交互重构闭源智能体技能的隐藏功能。

    • 技能服务化与资产保护背景:智能体技能(skills)通过封装指令、脚本和参考数据为模型提供外部专业能力;提供商倾向于将技能作为黑盒服务提供,同时保持底层包的私密性以保护专有规则与代码(§1)。
    • 现有防御视角的局限:既有研究主要聚焦直接提示注入、越狱或提示词窃取等直接泄露工件的攻击,相应防御侧重阻断提取意图或过滤敏感文本;作者认为这仅保护了工件保密(artifact secrecy),不能保证功能保密(functional secrecy)(§1)。
    • 核心观察与研究假设:技能对外提供服务时,其响应必然暴露决策阈值、表格项、组合规则和流程惯例;攻击者可通过多次良性交互收集行为线索,逆向推导其底层逻辑(§1)。
    • 威胁模型:
      • 攻击者目标:构建独立的可执行克隆程序,恢复挂载技能为智能体带来的模型相对边际功能(model-relative marginal functionality)(§3.1, §3.2)。
      • 攻击者知识:知晓公开的技能描述(advertisement a_s)与公共任务接口;无法查看技能主体(body b_s)、附加文件、隐藏工具调用、思维链或评测用例(§3.1)。
      • 攻击者能力:作为智能体的普通用户,在查询预算内提交任务有效输入(task-valid inputs);仅能观测最终消息和工件;禁止提交要求直接打印或外发指令的提取查询(§3.1)。
      • 受害系统:由基础大语言模型与挂载的私有技能组成的智能体服务(§3.1)。
    • 提出的方法与评估方案:论文提出了黑盒攻击框架 SKILLCLONE,并构建了涵盖 30 个技能的评测套件,通过模型相对边际功能隔离技能贡献进行定量评测(§1, §4)。
  2. 有哪些相关研究?

    梳理了模型与函数提取、提示词泄露攻击与防御、智能体技能安全及非泄露行为重构等方向的相关研究。

    模型与函数提取

    • 黑盒模型提取:Tramèr et al. (2016)、Papernot et al. (2017) 与 Jagielski et al. (2020) 通过黑盒预测查询恢复模型权重与超参数;Carlini et al. (2024) 恢复了大语言模型的结构组件。SKILLCLONE 继承了黑盒查询与主动学习探测思想,但针对的是单个挂载技能贡献的边际功能(§2)。
    • 训练数据与成员推断:Carlini et al. (2021) 提取逐字训练数据,Shokri et al. (2017) 推断训练集成员资格(§2)。

    提示词与指令泄露及防御

    • 提示词窃取与注入攻击:Zhang et al. (2024)、Sha and Zhang (2024)、Agarwal et al. (2024) 通过对抗查询重构系统提示词与上下文指令;Wang et al. (2026) 诱导智能体直接打印 SKILL.md。论文指出这些攻击均依赖直接输出隐藏文本字符串,而在不泄露文本时失效(§2)。
    • 文本泄露防御:Dai and Dong (2026) 使用知识蜜罐设伏提取攻击;Jiang et al. (2025) 提出 PromptKeeper,Cao et al. (2025) 提供系统级提示词保护;Wang et al. (2026) 使用输入意图分类器与输出词汇重叠过滤。论文指出这些防御假设攻击表现为异常查询或受保护文本外泄,无法抵御良性任务交互(§2)。

    智能体技能安全与行为推断

    • 技能安全性与架构攻击:Liu et al. (2026b) 大规模调查公开技能漏洞;Kim et al. (2026) 与 Hossain et al. (2026) 研究技能变异攻击与审查基准;Cui et al. (2026a) 蒸馏多智能体编排框架;Lyu et al. (2026) 提出 Agentleak 迁移执行轨迹行为。这些工作关注攻击工件、基础设施或交互协议(§2)。
    • 并发无泄露技能重构:Geng et al. (2026) 的 SIGLEAK 通过比对启用与未启用技能的执行轨迹推断技能;Tsai et al. (2026) 的 DAYDREAMING 保持技能启用并仅观察最终答案,利用自适应影子智能体与局部执行检查在 7 个技能上恢复 86.8% 的能力(§2)。

    基线方法与评测基准

    • 基线方法:论文对比了多数类预测器(majority-class predictor)或全零/恒等克隆构成的平凡底线(floor),零查询描述合成基线(no-query baseline),以及 Wang et al. (2026) 的输入意图检测与输出重叠过滤防御(§4.2, §6, §C.5)。
    • 评测数据集:采用来自 SkillsBench(Li et al., 2026)的 9 个代码执行/流程技能,以及来自 SkillRet(Cho et al., 2026)和公共代码仓库抓取的 21 个数据/规则技能,共 30 个技能(§4.1)。

    本文定位:作者称,相较于同时期的 DAYDREAMING 和 SIGLEAK,SKILLCLONE 评测了跨 5 个模型家族的 30 个跨类别技能,采用确定性 oracle 的精确 ASR 评估,并将重构受阻归因于六类具体瓶颈(§2)。

  3. 论文如何解决这个问题?

    提出 SKILLCLONE 框架,通过接口假设、结构化良性探测、程序合成与差分修复闭环重构技能。

    整体思路是将技能重构建模为黑盒系统辨识过程,提出 SKILLCLONE 闭环框架,仅利用技能公开描述与任务有效交互来合成独立可执行程序(§3)。

    问题设定与形式化目标

    攻击目标是恢复挂载技能带来的模型相对边际功能(model-relative marginal functionality),即区分挂载技能的智能体与纯基座模型的具体阈值、表格项、组合规则与流程惯例(§3.2)。攻击者在查询预算限制内,通过与受害者黑盒交互的历史数据映射出可执行克隆程序(§3.1)。

    接口假设与探测生成

    • 形成类型化接口假设:攻击者根据公开描述与公开任务模式建立初始接口假设:

    h0 = (X̂, Ŷ, Ẑ, Θ̂, Ĉ) 该公式表示包含候选输入类型 X̂、输出类型 Ŷ、潜在因子 Ẑ、参数常量 Θ̂ 及组合规则族 Ĉ 的初始假设空间(§3.3)。未在描述中体现且超出通用领域知识的因子无法纳入假设,形成假设质量瓶颈。

    • 通用探测算子库:攻击者使用固定的领域通用算子库生成具有区分性的探测输入。算子包括:控制单变量的隔离探测(isolation)、扫描取值范围的剂量响应(dose-response)、精确定位分界点的边界搜索(boundary search)、区分逻辑与运算规则的组合探测(composition)、分离重叠特征的反事实/混淆探测(counterfactual and confound),以及遍历查询键的枚举探测(enumeration)(§3.3)。

    观测解析与程序合成

    • 结构化观测解析:在提示词中要求受害者“只输出答案”,将自然语言或工件解析为类型化观测元组,作为后续合成与修复的数据标签(§3.3)。
    • 模式约束程序合成:合成器将观测历史映射为可执行代码,采用与推断接口对应的受限模式(包括阈值分类器、查找表、规则引擎、状态机或数值计算流程)(§3.3)。合成器在温度值 {0, 0.5, 0.9} 下分别生成 3 个候选程序,保留与受害者验证集一致性最高的一个(§4.3)。

    差分验证与迭代修复

    • 独立验证集比对:攻击者自主生成与测试集不相交的新任务输入集 V,并行执行当前合成克隆与受害者模型,收集两者输出不一致的样本(§3.3)。
    • 最优候选选择:利用不一致样本生成针对性探测输入以修复克隆,并在预算耗尽前选出在验证集上受害者一致性最高的一轮克隆程序:

    t∗ = argmaxt Agree(f̂t, Am,s; V) 该公式表示攻击者在无法访问评估真值的情况下,选取与受害者输出一致率最高的一轮克隆程序作为最终提交结果(§3.3)。

  4. 论文做了哪些实验?

    在30个技能上评测,规则与表格中位数ASR超80%,揭示六类瓶颈,且现有文本防御难以阻断。

    实验设置

    • 被测模型:受害者模型包含 DeepSeek-Flash、DeepSeek-Pro、GLM-5.1、Kimi-K2.6 和 GPT-5.6-Luna 共 5 个模型(§4.1);主要攻击者模型采用 DeepSeek-V4-Flash Preview,消融中测试 DeepSeek-Pro(§4.3)。
    • 数据集与基准规模:共 30 个技能,包括来自 SkillsBench 的 9 个代码执行/流程技能、来自 SkillRet 的 11 个数据/规则技能,以及来自公开仓库抓取的 10 个数据/规则技能(§4.1)。
    • 基线方法:多数类预测器或全零/恒等克隆构成的平凡底线(floor,§4.2);无查询合成基线(k0=0,§C.5);单轮探测基线(§5.2);以及输入意图分类器与输出词汇重叠过滤防御(§6)。
    • 指标定义:攻击成功率 ASR(克隆输出与确定性 ground-truth oracle 完全一致的比例,§4.2);ASR 减去底线(pp,Figure 2);良性路由 Top-1 recall(Table 3);词元精确率 Tok.prec(Table 21);受害者与 oracle 的一致性 fid(§4.1)。
    • 筛选与评估方式:采用两阶段筛选确定具备模型相对边际功能的 IP-positive 单元格,要求受害者挂载技能的一致性 fid(Am,s) ≥ 0.6 且相较未挂载提升 fid(Am,s) - fid(Am,∅) ≥ 0.25(§4.1);由独立的确定性真值适配器(self-oracle)在 held-out 评测集上机械评测,不使用大模型评审(§4.2)。
    • 样本量与查询预算:测试集样本量抓取技能为 n=150,SkillsBench 技能为 n=800(§4.2);抓取技能攻击预算为 52 次探测 + 30 次验证(共 82 次查询),SkillsBench 技能为 24 次探测 + 30 次验证(共 54 次查询)(§4.3)。

    主结果

    表格较宽,可左右滑动

    功能组件类型技能数 n代表性技能(中位数 ASR)中位数 ASR超过底线比例主要瓶颈
    Threshold / decision rules5security-env-standards (100%), dapt (50%), lead-scoring (31%)83%4/5probe specificity
    Lookup tables / data10klingai-pricing (100%), labunit (77%)82%7/10coverage
    Rule composition3delegation (100%), bellog (87%), civ6 (60%)87%3/3hypothesis quality
    Procedures / algorithms6drone (100%), working-day (100%), reflow (100%)77%4/6synthesis
    Numeric formulas6protein-qc (100%), labor-rate (100%), knowledge-worker-salaries (86%)43%3/6recall

    注:据 Table 1。各技能贡献在完整 OpenHands 受害者(抓取技能为 Flash、Pro、Luna;SkillsBench 为全部 5 个受害者)上的中位数 ASR。

    • 规则组合与阈值类技能重构率较高:规则组合类型中位数 ASR 达到 87%(全部 3/3 超出底线),阈值/决策规则类型为 83%(4/5 超出底线);作者分析指出粗粒度自主探测能区分分类约束,但容易漏掉精细边界(如 dapt 的熵与速率阈值),受制于探测特异性瓶颈(§5.1)。
    • 查找表与流程算法受覆盖率与合成能力约束:查找表中位数 ASR 为 82%(7/10 超出底线),小规模表格可完整遍历,但大型表格(如 230 条规则的 codebook)在预算内因覆盖率不足停留在 0%;流程算法中位数 ASR 为 77%(4/6 超出底线),顺序逻辑可直接恢复,而复杂状态机和模运算受限于合成能力(§5.1)。
    • 数值公式类型重构难度最大:数值公式中位数 ASR 仅为 43%(3/6 超出底线),主要瓶颈在于公式召回;例如在 powerlifting 技能中,攻击者在受害者标签准确且探测充分的情况下,因未召回 DOTS 公式而停留在接近 0% ASR(§5.1)。

    防御有效性评估(文本泄露过滤与描述最小化)

    • 测了什么:在 DeepSeek Pro 受害者上评估两类现有防御:基于大模型的输入意图检测器与基于词汇重叠的输出过滤器(阈值 0.5),测试集包含 252 个 SKILLCLONE 良性探测及 4 个直接泄露探测(Table 2);并在大模型改写的任务专用(task-only)与模糊(vague)两种最小化描述下测试 21 个抓取技能的路由召回与重构 ASR(Table 3)。
    • 结果:输入检测器拦截了 4/4 个泄露探测,但仅拦截了 17/252(6.7%)个 SKILLCLONE 探测;输出过滤器拦截了 3/4 个泄露探测,对 SKILLCLONE 的拦截率为 0(Table 2)。描述最小化下,两级改写均保持了 96.2% 的 Top-1 路由召回(原版 99.5%),重构 ASR 变化中位数均为 0.0 pp;其中受保护(ASR 降低 ≥20 pp)的技能仅 2–3 个,受损(ASR 提升 ≥20 pp)的技能有 3–4 个(Table 3)。
    • 作者的解读:作者认为,面向文本泄露的防御无法抵御跨多轮良性交互累积的功能提取;简化描述可能促使攻击者生成更宽泛的探测从而增强克隆泛化,无法提供一致的保护作用(§6)。

    闭环微调与自适应探测消融

    • 测了什么:在 4 个模型上评估闭环差分修复相较于单轮重构的增益(Table 9–13);并在相同 52 次观测预算下对比单轮与自适应闭环探测策略(Table 20),以及在 162 个候选输入共享池上对比固定与自适应探测策略(Table 24)。
    • 结果:在平均增益大于 5 pp 的 14 个技能上,闭环微调为 DeepSeek Pro、GLM、Kimi 和 Luna 分别带来 +33 pp、+31 pp、+25 pp 和 +25 pp 的平均 ASR 增幅(§5.2)。在相同 52 次总预算下,自适应闭环在 21 个技能中胜过单轮 10 项、持平 8 项、劣于 3 项,平均增益 +13.8 pp(Table 20)。在共享输入池对比中,自适应策略在合格单元格上相比固定策略带来 +5.37 至 +10.32 pp 的平均增益(Table 24)。
    • 作者的解读:作者认为,分轮次的结构化微调而非单纯堆叠探测数量驱动了闭环优势;自适应聚焦分歧样本能有效修复覆盖盲区(§5.2, §C.7)。

    部署智能体与跨模型实验

    • 测了什么:在 OpenHands 完整部署环境中运行包含技能检索、文件读取、工具调用与代码执行的完整智能体(Flash 攻击者),对 21 个抓取技能评估 DeepSeek Flash、DeepSeek Pro 和 GPT-5.6-Luna 三个受害模型(Figure 4, §D)。
    • 结果:在自适应策略下,DeepSeek Flash、Pro 和 Luna 分别有 18/21、16/21 和 17/21 个技能重构 ASR 超过底线,无条件平均 ASR 分别达到 81.5%、73.5% 和 73.3%,相较底线的中位数增幅分别为 +64.0 pp、+58.7 pp 和 +59.3 pp(Figure 4, §D)。
    • 作者的解读:作者认为,重构攻击在真实完整的智能体框架下依然可行;闭源前沿模型 Luna 展现出高提取率,表明功能泄露并非开源权重模型独有(§5.3, §D)。

    其他消融与分析

    • 攻击者模型能力(Table 8):DeepSeek-Pro 相较 DeepSeek-Flash 攻击者在 labunit 上 ASR 领先 45.6 pp,在 reflow 上领先 30.8 pp,而在 dapt 和 civ6 上差距小于 5 pp。
    • 配方提取辅助(Table 14):在 osm-topology 技能上,显示解题步骤的配方提取使 Pro 受害者的 ASR 从 32.5% 升至 100%,使 Luna 受害者的 ASR 从 0.0% 升至 100%。
    • 零查询合成基线(Table 15):在 21 个抓取技能中,15 个技能在零查询下的 ASR 处于或低于底线,其中 labor-rate 和 knowledge-worker-salaries 均为 0.0%。
    • 受害模型采样温度鲁棒性(Table 17):受害模型温度在 {0, 0.6, 1.0} 变化时,8 个技能的单次观测合并 ASR 分别为 67.0%、62.0% 和 65.0%,最大跌幅 5 pp 在标准差(±20–41)范围内。
    • 初始探测预算敏感度(Table 19):在单轮无闭环设置下将 k0 从 6 增至 96,仅 internal-reference(Pro 上从 0.093 升至 0.820)等受限于覆盖率的技能呈持续上升。
    • 克隆程序结构与词元重合(Table 21):6 个代表性技能成功克隆的 ASR 为 74%–100%,但词元精确率仅为 35%–59%,代码长度与真值比为 1.12×–15.8×。

    负面结果与例外分析

    • 模运算与状态机合成失败:osm-topology 在全部 4 个合格受害模型上的重构 ASR 均低于 38% 的底线(仅 28%–35%,Table 7),作者指出原因在于克隆无法表达模运算颜色分配逻辑(§5.3, §A.3)。
    • 公式未召回导致停滞:powerlifting 尽管拥有完全正确的探测和受害者保真度(24/24 正确),但因模型生成了 Wilks 而非 DOTS 公式,ASR 停留在接近 0%(§A.3)。
    • 受害者计算噪声破坏重构:r2r 技能在部署受害者上的回答准确率仅 12/24,错误标签导致克隆 ASR 为 0%;替换为 oracle 真值标签后 ASR 恢复至 100%(§5.1, §A.3)。
    • 大规模表格覆盖率受限:codebook 技能包含 230 条私有规则,在 24 次探测预算下仅能触及 3 条,测试集包含 127 条未见规则,导致 ASR 停留在 0%(§5.1, §A.3)。
  5. 有什么可以进一步探索的点?

    作者指出了评估范围局限于确定性功能、模型与服务覆盖有限、未充分探索有效防御等局限与未来方向。

    作者指出的局限与后续方向

    • 评估范围局限于确定性功能:目前采用 held-out 精确等价性评估,仅适用于确定性规则、阈值、表格、公式和流程;而对于创造性、交互式和重判断型技能,需要语义或分布模仿指标、下游任务效果、成对偏好测试或人工评估来分离技能行为与基模型并控制评估偏差(Limitations: Evaluation scope)。
    • 缺乏有效防御策略的深入探索:论文表明当前防御下技能部署易受攻击,但防御此类攻击十分棘手,作者称在本文中未充分探索有效的防御策略(Limitations: Relation to generic function extraction)。
    • 模型与服务覆盖范围受限:评测覆盖了 DeepSeek V4 Flash 与 Pro、GLM-5.1、Kimi-K2.6 和 GPT-5.6-Luna,不同模型版本与类型可能存在不同脆弱性,对主流 LLM 服务的覆盖仍然有限(Limitations: Model and service coverage)。
    • 未评估专有商业生态:所有评测的技能主体均为公开开源工件,专有服务、付费市场以及真实野外环境的评估仍处于本研究范围之外(Limitations: Model and service coverage)。
    • 防御评估维度有待拓展:当前防御评估仅涵盖针对技能偷窃的前人防御(泄露过滤与描述重写);更广泛的评估应加入跨会话身份控制、累积查询监控、输出粗粒度化以及私有路由表示等机制(Limitations: Threat and defense scope)。
    • 配方提取未纳入主方法:在配方提取消融中,作者指出由于其并非通用改进且可能为防御者提供对抗线索,未将其纳入主攻击流程(Appendix C.4)。

    实验覆盖范围

    • 测试技能集:共评估 30 个技能,包含 9 个来自 SkillsBench 的代码执行技能和 21 个来自 SkillRet 及公开代码库抓取的数据/规则技能,均具有确定性 ground-truth oracle(§4.1, Table 1)。
    • 测试受害模型:受害者包含 DeepSeek-Flash、DeepSeek-Pro、GLM-5.1、Kimi-K2.6 和 GPT-5.6-Luna 共 5 个模型;其中抓取技能在 OpenHands 部署环境下的全套重构评估覆盖了 Flash、Pro 和 Luna 3 个模型(§4.1, Appendix D)。
    • 样本量与测试集划分:抓取技能评测集为 n=150,SkillsBench 技能评测集为 n=800,且探测、验证与测试输入来自互不重叠的生成区间(§4.2)。
    • 防御对比范围:防御实验仅评估了输入意图分类器、输出词汇重叠阈值过滤(基于 DeepSeek Pro,252 个探测)以及两级描述重写(基于 21 个抓取技能)(§6, Table 2, Table 3)。
    • 查询预算与未报告信息:抓取技能预算设定为 52 次探测与 30 次验证,SkillsBench 设定为 24 次探测与 30 次验证;论文未报告针对多会话并发、速率限制或带状态动态更新技能的重构表现(§4.3, §6)。
  6. 总结一下论文的主要内容

    论文揭示了仅靠良性任务交互即可重构闭源智能体技能隐藏功能的风险,表明功能保密需要限制累积信息泄露。

    论文从功能保密视角系统研究了大语言模型智能体技能的行为重构威胁。

    • 问题定位:当前技能安全主要防范提示注入或文本偷窃等直接文件泄露,但作者指出即使文件保持隐藏,普通任务交互仍会泄露功能,攻击者可能重构出功能等价的可执行副本。
    • 重构方法:设计了黑盒攻击系统 SKILLCLONE。攻击者利用公开描述与任务模式建立类型化接口假设,运用包含隔离、边界搜索、枚举等算子的通用库生成良性探测,将模型输出解析为标签并合成可执行代码,再通过差分验证比对分歧样本进行多轮定向修复。
    • 主评测表现:在 30 个跨类别技能的评估中,SKILLCLONE 在规则组合、阈值规则和查找表上的全智能体中位数 ASR 分别达到 87%、83% 和 82%(Table 1);在 OpenHands 完整部署环境下,针对 GPT-5.6-Luna 和 DeepSeek Flash 受害者分别取得 73.3% 和 81.5% 的无条件平均 ASR(Figure 4, §D)。
    • 瓶颈诊断机制:实验归纳出制约重构的六类瓶颈。受害者保真度、探测特异性、覆盖率、假设质量、程序合成与公式召回分别主导了不同类型的失败;例如数值公式中位数 ASR 仅为 43%(Table 1),主要受制于公开公式的召回障碍。
    • 现有防御局限:针对文本泄露的输入检测器仅拦截了 6.7% 的良性探测,输出词汇过滤器拦截率为 0(Table 2);简化技能描述带来的 ASR 变化中位数仅为 0.0 pp(Table 3)。
    • 作者结论与启示:作者认为工件保密无法等同于功能保密;随着智能体技能逐渐作为商业服务提供,防御机制不能仅停留于阻断越狱或敏感词外发,必须限制跨多轮合法交互累积的边际信息泄露。
阅读原文arxiv.org