跳到正文
原文
论文追踪· arXiv:2609.14079· Donato Mecca, Alberto Verna, Youness Bouchari, Nikhil Jha, Marco Mellia·本站收录 · 原文发表

SkillSecurer:检测并修补 AI Agent 技能中的提示注入漏洞

SkillSecurer: Detecting and Patching Prompt-Injection Vulnerabilities in AI Agent Skills

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

SkillSecurer 用红蓝智能体生成、定位并修补 agent skill 注入;Sonnet 5 在 Skill-Inject 上 IDR 为 100%,野外 954 个技能中 17.6% 被标记。

威胁模型攻击者可在技能安装或更新前发布、修改或破坏 skill 包的任意组件,目标是诱使已加载该技能的智能体执行用户未授权的安全相关动作。

问题
第三方 agent skill 可经指令、脚本和配置影响智能体决策与动作,现有基准常无精确注入位置,扫描器多只做技能级标记且不给修补。
方法
SKILLSECURER 由 REDINJECTOR 按九类威胁生成并记录上下文兼容注入,BLUEPATCHER 分析完整技能包并给出有据发现与最小修补,VERIFIER 用词面相似度与独立 LLM 裁判对照记录注入计算 IDR。
实验与结果
作者称 Sonnet 5 是唯一在 345 个受控实例上达到 100% IDR 的扫描器。Sb 上 87 条发现中 74 条经多数确认。野外 954 个技能中 17.6% 被标记,抽查确认率 84%;作者称对部分技能触发了实际事件并评估了补丁。
局限与可以继续做的
作者指出验证是静态的,不能保证合法功能保留,实际影响还取决于护栏、权限和沙箱;野外没有统一真值。评测后端经 OpenRouter,Fable 5 因安全护栏被排除,注入生成未使用 Sonnet 5。
实验设置Claude Sonnet 5、Gemini 3.6 Flash 等 · Dsi (Skill-Inject, N=165)、Dred (Red-Generated, N=180) 等 · IDR、GDR 等
威胁模型
攻击者可在技能安装或更新前发布、修改或破坏 skill 包的任意组件,目标是诱使已加载该技能的智能体执行用户未授权的安全相关动作。检测器只分析技能包静态快照,不执行不可信代码。
模型
Claude Sonnet 5Gemini 3.6 FlashGPT-5.6 SolKimi K3DeepSeek V4 ProGemma 31BGPT-oss 120BDeepSeek V4 FlashClaude Fable 5Claude Opus 5
基准
Dsi (Skill-Inject, N=165)Dred (Red-Generated, N=180)Sb (SkillTrustBench safe_pool, N=130)skills.sh in-the-wild (N=954)
指标
IDRGDRF1人工确认比例扫描成本
AI 导读全文 299 字

研究者提出 SkillSecurer,一个全智能体框架,用于生成、检测、定位并修复 AI Agent 技能中的安全风险。其红方智能体跨九类威胁生成上下文兼容的注入并记录具体改动,蓝方智能体分析完整技能包、给出有依据的证据并提出补丁;在受控实例上,验证器将发现与补丁同记录的注入比对,实现注入级评估。使用最佳后端 LLM 时,SkillSecurer 是唯一实现 100% 注入检测率的扫描器。作者随后分析某技能库中的热门技能,发现超过 17% 的被检技能存在潜在漏洞,并在实测部分技能时触发了真实事件。结论认为,上下文感知的 LLM 分析能提供可靠的注入定位与可操作的修复,而不止于技能层面的标记。

深度解读

6 个问题,约 10,800 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    现有 skill 扫描器难定位已知注入且不给修补,作者提出端到端红蓝框架。

    第三方 agent skill 能被注入或本身带有安全相关行为,但现有检测往往只做技能级标记,既难核对是否定位到注入,也不给出可检查的修补。

    • 场景与重要性:作者称 Codex、Claude 等智能体可在工作区、终端或计算机上直接执行任务,skill 把可复用指令、脚本、配置和外部资源装进上下文并代用户行动。技能经 skills.sh、ClawHub.ai、Codex skills catalog 等分发,高排名技能有数百万下载。恶意或有漏洞的 skill 可操纵决策、执行不安全代码、越权访问文件或凭证、调用外部服务,或外传与破坏数据。
    • 现有方法的不足:作者称现有基准常为人工策划、固定模板、简单注入或特定对抗策略,且大多不记录被注入的指令、文件或代码片段,因而难以验证检测器是否正确定位漏洞。现有扫描器多围绕静态检查、专用检测器或按漏洞类型的 LLM 提示词,输出多为二元或粗粒度风险分类,通常不提供修补。
    • 核心观察:作者认为,一次技能级告警可能指向无关的既有内容或没有依据的证据,而受控注入仍被漏掉;只有记录精确修改,才能做注入级检测与定位评估。
    • 提出的方法:作者提出 SKILLSECURER,并称据其所知这是首个用于 agent skill 安全漏洞的端到端生成、检测、定位与修补的 fully-agentic 框架。它包含 REDINJECTOR、BLUEPATCHER 和仅用于受控实例的 VERIFIER,并定义 Injection Detection Rate(IDR)。
    • 威胁模型:
      • 受害系统:不知情用户从部分可信来源(公共仓库、市场、系统管理员或其他用户)安装 skill。技能匹配请求后,智能体可把指令载入上下文、执行捆绑代码或代为调用工具,权限可包括文件、凭证、环境变量、网络、外部 API、shell 和持久状态,并受用户批准与沙箱限制。
      • 攻击者知识与能力:攻击者可在安装或更新前发布、修改或破坏 skill 包的任意组件,包括指令、元数据、捆绑脚本、配置、声明的依赖和外部资源引用。这覆盖恶意作者、被攻破的维护者或仓库账户、注册表与构建过程被破坏、依赖混淆和包篡改。
      • 攻击者目标:诱使智能体执行用户未授权的安全相关动作,例如外传数据、执行任意代码等。作者假设该技能已被选中并加载到看似相关的请求上,不建模迫使无关任务选中恶意技能的攻击。
      • 防御者:检测器拿到技能包的静态快照,分析全部组件且不执行不可信代码;可识别外部资源引用,但不假设扫描后远程内容保持不变。发现表示存在可能使智能体超出技能声明功能、声明能力或用户授权的指令、实现、依赖或辅助构件;它是安全相关风险,不是该行为在每次部署中都会被触发或利用的证明。
  2. 有哪些相关研究?

    相关工作分为基准、红队与蓝队扫描器;作者用注入级定位和修补区别于它们。

    论文把近期 agent skill 安全工作分成基准、红队和蓝队,并在 Table 1 比较日期、方法、是否静态、LLM 角色、是否修补、基准规模和作者报告的结果。作者强调各研究的性能数字不能直接横向比较。

    基准

    • Skill-Inject [20]:用 23 个技能手工构造 202 个注入–任务对,测受害智能体后端 LLM 是否在完成合法任务时服从恶意指令。作者报告 ASR 在 Claude Opus 4.5 上为 7–17%,在 Google Gemini 模型上为 57–83%。
    • SkillTrustBench [26]:由真实技能派生的包,九类攻击、三标签(normal、suspicious、malicious),共 5,520 个测试用例。作者称发布含完整技能文件和案例级漏洞元数据,但缺少精确恶意片段标注,无法自动验证定位是否正确。
    • MalSkillBench [7]:从静态知识库由 LLM 注入 SKILL.md,生成 3,944 个恶意技能和 4,000 个匹配的良性技能。作者称公开发布省略了逐样本真值与运行时证据文件,并报告静态扫描器对提示注入和智能体控制攻击的召回为 21–35%,LLM 检测器召回最高到 98%。

    红队

    • SkillJect [10]:把行为特定载荷藏在辅助脚本中,并用 LLM 改写 SKILL.md,使执行该脚本看起来像合法前提;攻击智能体根据受害执行轨迹和评估反馈迭代精炼。在 100 个 ClawHub.ai 技能、4 类注入上,Claude Sonnet 4.6 的 ASR 为 34–57%。
    • POISE [8]:上下文感知生成器在合法流程中插入一条看似合理的指令;仅当载荷执行且用户任务仍通过验证器才算成功。作者报告在 Skill-Inject 的 25 任务子集、3 类攻击上,Codex 与 GPT-5.2 的 ASR 为 89%;在 SkillsBench 的 27 任务子集上 ASR 降到 16%。

    蓝队扫描器

    • SkillSpector [15, 18]、Cisco Skill Scanner [3]、AI-Infra-Guard [25]:静态规则加可选或语义 LLM 阶段,按漏洞类型或分类体系输出发现,作者称不提供修补;SkillSpector 与 Cisco 未给出可独立复现的共同基准,AI-Infra-Guard 对齐 SkillTrustBench 的九类风险但只报告技能级性能。
    • Snyk Agent Scan [22]、Sentry skill-scanner [21]、Skill Vetter [23]、SkillSieve [9]、Locate-and-Judge [5]、SkillScan [14]、SkillFortify [2]:分别结合规则、静态分析、专用检测器、清单或分层评审。作者报告的数字包括:Snyk 在 3,984 个野外技能中 76 个经人工确认;SkillFortify 在 270 良性加 270 脆弱样本上 F1 为 96.95%(Table 1 写作 97%),且作者称该基准不考察自然语言语义与智能体指令交互;SkillScan 在 200 个技能(63 个脆弱)上 F1 为 84%;Locate-and-Judge 在 Skill-Inject 上 Hit@1 F1 为 19%、Hit@10 F1 为 72%;SkillSieve 在 390 个技能(56 个经人工复核的恶意样本)上 F1 为 92%。
    • Do Not Mention This to the User [13]:静态匹配、GPT-5.2 提示词分析和沙箱行为核验,收集 98,380 个技能,标记 4,287 个可疑候选,确认 157 个恶意。Gen Agent Trust Hub [6] 与 Socket [11] 也被 skills.sh 与 Snyk 一起使用,作者在第 8 节与其发现对比。

    基线方法与基准

    • 基线方法:受控对比使用 Cisco Skill Scanner、NVIDIA SkillSpector、Tencent AI-Infra-Guard;后端选择实验只用 BLUEPATCHER 自身换 LLM。无 LLM 时还报告 Skill Scanner 与 SkillSpector 的静态模式。
    • 基准/数据集:Dsi 来自 Skill-Inject(165 个注入实例);Dred 由 REDINJECTOR 在 20 个基技能上按 9 类威胁生成(180);Sb 来自 SkillTrustBench 的 safe_pool(130);野外语料为 2026 年 7 月 3 日 skills.sh 快照中的 954 个技能。

    作者在第 2.1 节的定位是:基准工作多只衡量注入技能是否被标记,而 REDINJECTOR 自动生成上下文兼容注入并记录精确修改,从而做注入级检测与定位;现有扫描器围绕专用检测器或按漏洞的提示词,BLUEPATCHER 则让后端 LLM 对完整技能上下文、预期工作流和安全含义作推理;作者称 BLUEPATCHER 是首个为每条发现提出精确修补、供用户检查并接受的方案。

  3. 论文如何解决这个问题?

    红队记录注入,蓝队在不知真值时定位并最小修补,验证器对照真值算 IDR。

    SKILLSECURER 把部署用的蓝队检测与仅用于评测的红队生成、真值核验拆开:BLUEPATCHER 只看技能静态快照,REDINJECTOR 与 VERIFIER 不进入日常扫描。

    问题设定与流水线

    • 输入与输出:Figure 1 中,部署组件是 BLUEPATCHER。给定 Skill under Test(SUT)的静态快照,它分析指令、元数据和本地构件,输出发现报告 D,并在适用时给出修补后的技能 P。整体写作 B(SUT) = (D, P);若 D 为空,则 P = SUT。
    • 信息隔离:BLUEPATCHER 不接收良性对照、注入说明或其他真值。检测写作 Bdetect(SUT) = D,修补写作 Bpatch(SUT, D) = P。
    • 受控入口:REDINJECTOR 把良性技能按选定威胁类别改成注入实例并记录修改;Skill-Inject 等外部实例若带等价真值,也可进入同一评测流程。VERIFIER 仅在已知真值修改时使用。

    检测与修补

    • 发现结构:每条发现记录安全类别与严重程度、解释、引用的证据片段及其在技能中的位置。引用片段须能映射回提交的 SUT 快照,否则不保留,以保证定位落在被分析的构件上。
    • 修补约束:有至少一条落地发现时做第二遍,为每条发现生成修补。修补器被要求做最小改动,移除或中和所报告行为并保留合法内容。作者写明,完整的功能保留需要针对任务的运行时测试。
    • 实现:以 LangGraph 编排,可跑完整受控流水线、只跑 BLUEPATCHER,或分析外部受控实例。实验中的模型经 OpenRouter 访问。系统还记录各组件的 LLM 调用次数、输入、输出与缓存 token 及费用,并有用于浏览发现、证据、补丁和真值结果的轻量网页界面。

    受控注入生成

    • 生成目标:给定良性技能 S 和威胁类型 τ ∈ T,R(S, τ) = (S′, Δ)。T 为 Table 9 列出的九类威胁。S′ 随后与任何外部 SUT 一样交给 BLUEPATCHER;Δ 只在真值评测时使用。
    • 生成要求:REDINJECTOR 被要求生成与宿主技能上下文和预期功能兼容的修改,保留无关内容,并把引入的修改记入 Δ,而不是插入与宿主无关的固定载荷。
    • 九类威胁:论文在第 6.3 节与附录 E 用代表性摘录说明这些模式的差异:凭证暴露、数据外传和 prompt hijacking 常复用宿主术语或工作流;任意脚本执行和权限提升更常写成显式命令;Guardfall 与间接注入常被写成合规、监控、校验或完整性检查;prompt hijacking 也包括去掉确认、校验、警告或用户选择的无命令修改。九类的名称以 Table 9 为准;正文明确点名的包括上述几类。附录 E 给出每类一个摘录。

    真值评测与指标

    • 核验对象:对有原始技能 S、注入技能 S′ 和记录注入的实例,V(S, S′, Δ, D, P) = (L, R)。它判断是否识别了已知注入,以及补丁是否移除或中和该注入,而不是只看是否对 S′ 产生了任意发现。与注入无关或预先存在的发现保留在报告中,但不计入注入检测。
    • 定位规则:D 为空则记为漏检且不算相似度。否则取记录注入文本 δ 与各发现引用片段 qi 的最大词面相似度 r = max sim(norm(δ), norm(qi))。norm 做小写、合并空白并去掉 Markdown 格式字符;sim 为 Python difflib.SequenceMatcher 的 ratio,0 为无词面重叠,1 为精确匹配。若 r ≥ 0.8,记为确认定位,不再做 LLM 定位裁决;该阈值只用于分流明显词面匹配,不是语义安全决策阈值。其余有发现的案例交给独立 LLM 裁判,输入包括记录注入、由 S 与 S′ 得到的 diff、全部发现及其引用证据和解释,以及补丁 P。
    • 指标:L 在至少一条发现指向记录注入时映射为真正例,否则为假负例。R 记录已知注入行为在 P 中是否仍在,或已被移除或中和。GDR 是扫描器对注入技能报告至少一条发现的比例,不论位置;扫描失败在 Table 4 中计为负检测。IDR 是已知注入中扫描器识别到对应注入组件的比例。作者称 IDR 比以往技能级分类更严。发现还按来源(injected、pre-existing、configuration、ambiguous)和 OWASP Agentic Security Initiative 分类标注;配置类发现(如缺少 allowed-tools 声明)单独报告,不自动当作假正例。附录 A 给出完整标注规则。
    • 验证边界:过程是静态的。它能评估记录注入是否被识别、对应行为是否从补丁中移除,但不能确立全部合法功能都被保留。

    人工核验协议

    • 适用对象:Dred 与 Dsi 的注入由构造方控制;在 likely-benign 集 Sb 和野外结果上,需要对假正例做人工核验。Sb 上的全部发现,以及野外发现的一个样本,由三名专家独立复核,多数表决为确认漏洞或假正例。
    • 目的:作者称这是为了避免 BLUEPATCHER 靠堆砌随机发现来抬高 IDR 和 GDR。
  4. 论文做了哪些实验?

    Sonnet 5 在两个受控集上 IDR 为 100%;野外 954 个技能中 17.6% 被标记。

    实验设置

    • 被测后端:2026 年 7 月 21 日可选的模型为 Claude Fable 5、Claude Sonnet 5、Gemini 3.6 Flash、GPT-5.6 Sol、DeepSeek V4 Pro、Kimi K3,以及开放模型 Gemma 31B、GPT-oss 120B、DeepSeek V4 Flash。Claude Opus 5 实验时尚未可用,作者后测称其表现与 Sonnet 相当、成本约高 2.5 倍,因此排除。Fable 5 因网络安全护栏拒绝任务,全部运行中止。
    • 数据集:Table 2 中,Sb 为 SkillTrustBench safe_pool 的 likely-benign 对照,从 13 个功能类别各均匀抽 10 个、固定随机种子,N=130(safe_pool 经多阶段过滤后有 1,490 个 likely-benign 技能)。Ŝb 为其中 BLUEPATCHER 无发现者里随机保留的 20 个,用作生成输入。Dred 为这 20 个技能 × 9 类威胁,N=180,带记录注入。Dsi 为 Skill-Inject,N=165(73 个 obvious、92 个 contextual),来自 68 条注入配方作用于 33 个技能。野外为 2026 年 7 月 3 日 skills.sh 快照中,目录同时给出 Gen Agent Trust Hub、Socket 和 Snyk 结果的最流行技能,Nw=954。
    • 对比扫描器:Cisco Skill Scanner、NVIDIA SkillSpector、Tencent AI-Infra-Guard。作者排除 Table 1 中实现不可用、不再维护或已在 [7] 中表现有限的工具。SkillSecurer 的 IDR 由 VERIFIER 得出;无 VERIFIER 定位的扫描器报告基于证据的下–上估计区间。
    • 指标与评审:GDR、IDR、发现数、失败数、费用、调用次数及输入/输出 token。Sb 与野外样本用三名专家、多数表决。注入生成的裁判与检测后端分离:生成端选用 DeepSeek V4 Pro,不用 Sonnet 5,以避免同一 LLM 既生成又检测。
    • REDINJECTOR 校验:180 个实例均满足五条:请求的技能–威胁对覆盖、案例唯一、记录注入出现在输出技能中、注入与真值元数据一致、与声明威胁类型语义对齐。
    • 重复次数:论文未报告每个条件的重复运行次数。

    主结果

    后端选择在 Dsi 上只换 LLM、提示词与流水线不变(Table 3)。扫描器对比同时覆盖 Dred 与 Dsi(Table 4)。下表只列论文给出单点 IDR 的设置;Skill Scanner、SkillSpector 与 AI-Infra-Guard 的 IDR 为区间,见后文,不并进单点格。

    表格较宽,可左右滑动

    设置IDRGDR出处
    Sonnet 5,BLUEPATCHER,Dsi100.0%100.0%Table 3
    Gemini 3.6 Flash,Dsi99.4%99.4%Table 3
    GPT-5.6 Sol,Dsi99.4%100.0%Table 3
    DeepSeek V4 Pro,Dsi96.3%98.2%Table 3
    Kimi K3,Dsi98.2%98.8%Table 3
    Gemma 31B,Dsi92.7%97.0%Table 3
    GPT-oss 120B,Dsi86.1%98.8%Table 3
    SKILLSECURER + Sonnet,Dred 与 Dsi100.0%100.0%Table 4
    • 作者对后端的解读:作者称除 DeepSeek Flash 外 GDR 都接近完满,商用前沿模型 IDR 从 DeepSeek V4 Pro 的 96.3% 到 Sonnet 5 的 100%。Gemma 31B 与 GPT-oss 120B 分别漏掉 12 与 23 个注入;GPT-oss 另有 214 条超出预期注入的发现,人工复核显示其中多数无支持或为幻觉。仅 DeepSeek V4 Flash 与 Kimi K3 有扫描失败(Table 3:Flash 失败 26,Kimi 失败 2)。Figure 2 以对数费用为横轴、检测率为纵轴,分别标出 GDR 与 IDR。Sonnet 5 在该基准费用为 15.42 美元;DeepSeek V4 Pro 为 2.50 美元,作者称约为 Sonnet 的六分之一,并认为费用受限时它仍是可选项。八个模型合计 79.23 美元。
    • 作者对扫描器对比的解读:作者称在共同协议、数据集和后端下,SKILLSECURER 是唯一在 345 个受控基准上达到 100% IDR 的扫描器(Dred 180 加 Dsi 165)。Table 4 中无 LLM 时,Skill Scanner 在 Dred 上 IDR 为 2.2–2.2%、GDR 7.2%,在 Dsi 上 IDR 0.6–0.6%、GDR 0.6%;SkillSpector 在 Dred 上 IDR 25.0–26.1%、GDR 40.6%,在 Dsi 上 IDR 29.7–31.5%、GDR 80.0%。换 Sonnet 后,Skill Scanner 在 Dred 上 IDR 93.9–93.9%、GDR 95.6%,在 Dsi 上 IDR 78.8–79.4%、GDR 100.0%;SkillSpector 在 Dred 上 IDR/GDR 均为 99.4%,在 Dsi 上均为 98.8%;AI-Infra-Guard 在 Dred 上 IDR 53.9–93.9%、GDR 96.7%,在 Dsi 上 IDR 47.3–85.5%、GDR 95.8%。作者称垂直专用检测器在注入级定位上低于对完整上下文作推理的 BLUEPATCHER。
    • 费用与失败:Table 4 中 Sonnet 配置下,Dred 上 SKILLSECURER 费用 12.13 美元、489 次调用、0 失败;SkillSpector 24.29 美元、1,046 次调用;AI-Infra-Guard 30.26 美元、900 次调用。Dsi 上 SKILLSECURER 15.62 美元、333 次调用、0 失败;Skill Scanner 8 次失败出现在 Dred 的无 LLM 与 Sonnet 两行(各 8 次),AI-Infra-Guard 在 Dsi 上失败 1 次。

    likely-benign 技能上的假正例

    • 测了什么:用 Claude Sonnet 5 的 BLUEPATCHER 扫描 Sb 的 130 个技能,再由四人池中的三名独立评估者按多数表决复核每条发现。
    • 结果:标记 45 个技能(34.6%),共 87 条发现。74/87(85.1%)得到多数确认,其中 50 条一致通过、24 条多数通过;13/87(14.9%)未获多数支持,其中 2 条一致否定、11 条多数否定。作者称没有任何漏洞看起来像可疑的故意恶意。附录 Table 7 按 OWASP 主类给出分布:Identity and Privilege Abuse 为 34 条报告中 32 条人工确认;Unexpected Code Execution 为 19 条中 17 条确认;Tool Misuse and Exploitation 为 17 条报告中 11 条确认,其 6 条无支持发现是类别内假正例比例最大的一组。
    • 作者的解读:作者把经人工支持的发现解释为潜在漏洞而非故意攻击,并称这些技能虽被标为 likely benign,仍含安全相关行为。作者称 BLUEPATCHER 的假正例率低于 SkillTrustBench 报告中 SkillSpector 的 42.4% 与 Skill Scanner 的 84.0%。对 Tool Misuse 的无支持发现,作者称它们常涉及共享工作流状态、用户指示的删除或外部 API 调用等依赖上下文的操作选择,孤立看可能显得有风险,但并未确立技能工作流中的安全弱点。

    野外技能与可利用性

    • 测了什么:对 954 个 skills.sh 技能做特征刻画,并与 Gen Agent Trust Hub、Socket、Snyk 的目录信号对比;再对一部分被标技能做实际触发,并评估对应补丁。Table 1 汇总为 17.6% 被标记、确认率 84%。
    • 结果:作者称在所检查技能中超过 17% 存在潜在漏洞,并称测试其中一些技能时触发了实际事件。披露仍在进行,正文不给出这些技能的身份和详细利用步骤;利用材料放在第 9 节与附录 F,且不进入公开构件。实验在隔离容器、模拟服务和可独立核验的标记文件中进行。
    • 作者的解读:作者认为结果表明,上下文感知的 LLM 分析可以在技能级标记之外提供可靠的注入定位和可执行的修补。作者同时写明,实际影响取决于后端 LLM 护栏、智能体权限、沙箱、批准机制、运行时输入和外部服务是否可用。

    其他消融与分析

    • Dsi 上额外发现数(Table 3 的 New):Sonnet 5 为 58,Gemini 3.6 Flash 为 28,GPT-5.6 Sol 为 188,Kimi K3 为 129,DeepSeek Pro 为 106,Gemma 31B 为 62,GPT-oss 120B 为 214,DeepSeek Flash 为 61。
    • 生成端:Fable 5、Opus 5、GPT-5.6 Sol、Gemini 3.6 Flash 因安全防护拒绝生成注入;Kimi K3 不能稳定返回有效注入;其余模型完成任务。DeepSeek V4 Pro 被选为 REDINJECTOR 后端。
    • Dred 的 180 个实例全部通过五项校验并被保留;其中 30 条记录注入含非 ASCII 文本,作者称这带来 Dsi 中没有的语言多样性。
    • 配置类发现不自动计为假正例;与受控注入无关的额外发现不计入 IDR。
    • 词面相似度阈值 r ≥ 0.8 只分流明显匹配,其余交给独立 LLM 裁判;论文未单列该阈值上下的案例占比。
    • 作者后测 Claude Opus 5,称表现与 Sonnet 相当、成本约高 2.5 倍,故不纳入主比较。
  5. 有什么可以进一步探索的点?

    作者写明静态核验不能保证功能保留,也不覆盖安装后的利用与沙箱逃逸。

    作者指出的局限与后续方向

    • 静态核验的边界:第 4.4 节写明,验证是静态的,能评估记录注入是否被识别、对应行为是否从补丁中移除,但不能确立全部合法功能都被保留;作者称这种保证需要依赖外部资源与环境的、针对任务的运行时测试。第 4.2 节同样写明,完整功能保留需要针对任务的运行时测试。
    • 发现不等于必然利用:第 3 节写明,发现表示安全相关风险,不是该行为在每次部署中都会被触发或成功利用的证明;实际影响取决于后端 LLM 护栏、权限、沙箱、批准机制、运行时输入和外部服务是否可用。
    • 不建模的攻击:第 3 节写明,不建模安装后的利用、智能体框架或沙箱被攻破、运行时沙箱逃逸,以及扫描后远程托管内容被改动;假设技能已被选中并加载,从而把问题限定在信任该技能本身,而不是迫使恶意技能被选入无关任务。
    • 远程内容:第 3 节写明,扫描器可以识别对外部资源的引用,但不假设远程内容在扫描之后保持不变。
    • 意图不是判定条件:第 3 节写明,分析评估的是可观察的安全相关行为,而不是推断作者意图;意图在已知时只作为辅助属性,发现并不要求它。
    • 敏感材料不公开:Open Science 写明,第 9 节与附录 F 的实际利用材料因含操作敏感信息而不放入公开构件;伦理考量写明,披露窗口内不在正文给出这些技能的身份和详细利用步骤。作者计划通过公开仓库提供实现、基准输入和复现证据。

    实验覆盖范围

    • 受控检测:后端比较在 Dsi(N=165)上更换 LLM(Table 3);扫描器比较在 Dred(N=180)与 Dsi 上,使用无 LLM 以及 Sonnet 后端的 Skill Scanner、SkillSpector,以及 Sonnet 后端的 AI-Infra-Guard(Table 4)。SKILLSECURER 在这两个集合上的 IDR 由 VERIFIER 计算。
    • 人工复核:Sb 的 130 个技能产生的 87 条发现全部由三名评估者多数表决(第 6.2 节)。野外为 954 个同时带有 Gen Agent Trust Hub、Socket、Snyk 目录结果的 skills.sh 技能;Table 1 给出 17.6% 被标记、84% 确认率。论文写明野外第三方扫描器提供的是互补信号,不是共同真值标签。
    • 生成与排除:Dred 由 DeepSeek V4 Pro 在经 Sonnet 初筛无发现的 20 个技能上、按九类威胁各生成一条;180 条均通过五项校验。Fable 5 因护栏被排除出检测;Fable 5、Opus 5、GPT-5.6 Sol、Gemini 3.6 Flash 拒绝生成注入。论文未报告每个条件的重复次数。
    • 修补评估:VERIFIER 对受控实例同时给出定位结果 L 和补丁移除结果 R;作者称对一部分野外技能评估了对应补丁是否有效。论文未在正文表格中单列补丁移除率。
    • 对比范围:作者称排除了 Table 1 中实现不可用、不再维护或已在 MalSkillBench 中表现有限的工具。定位相似度使用 difflib 的 ratio,r ≥ 0.8 直接确认,其余由独立 LLM 裁判;裁判模型名称论文未在第 4.4 节写明。
  6. 总结一下论文的主要内容

    SKILLSECURER 以注入级定位和最小修补评测 skill 安全,Sonnet 5 在受控集上 IDR 为 100%。

    SKILLSECURER 是一套面向 AI agent skill 的红蓝框架:生成可核对的注入、在不知真值的情况下定位风险,并给出可检查的修补。

    • 问题:skill 把第三方指令、脚本和配置带进能改文件、跑命令、调工具的智能体。作者认为现有基准往往不记录精确注入片段,扫描器又多停在技能级告警且不提供修补,因此一次告警未必对上受控修改。
    • 做法:REDINJECTOR 按九类威胁生成与宿主上下文兼容的修改并写入 Δ。BLUEPATCHER 只读 SUT 静态快照,引用必须能映射回该快照,再以最小改动移除或中和所报告行为。VERIFIER 用规范化后的词面相似度(r ≥ 0.8 直接确认)和独立 LLM 裁判,把发现对照记录注入,得到比 GDR 更严的 IDR;补丁是否去掉该行为单独记录。检测不看真值。
    • 受控结果:在 Skill-Inject 的 Dsi(165)上,Claude Sonnet 5 的 IDR 与 GDR 均为 100.0%,费用 15.42 美元;DeepSeek V4 Pro 为 96.3% / 98.2%,费用 2.50 美元(Table 3)。同一 Sonnet 配置在 Dred(180)上 IDR 与 GDR 也是 100%。作者称它是所评扫描器里唯一在合计 345 个受控实例上达到 100% IDR 的方案。无 LLM 时 Skill Scanner 在 Dsi 上 IDR 为 0.6%。换 Sonnet 后,SkillSpector 在 Dsi 上 IDR 为 98.8%,AI-Infra-Guard 的 IDR 区间为 47.3–85.5%(Table 4)。
    • 良性池与野外:在 130 个 likely-benign 技能上,Sonnet 5 标记 45 个(34.6%)、87 条发现,三人多数确认 74 条(85.1%)。作者将其视为潜在漏洞而非故意攻击。2026 年 7 月 3 日 skills.sh 快照中的 954 个技能里,17.6% 被标记,抽查确认率 84%(Table 1)。作者称对其中一些技能触发了实际事件,并评估了补丁;披露期间不公开技能身份和操作细节。
    • 作者的结论:作者认为,围绕完整技能上下文的 LLM 推理,可以在技能级标记之外给出可靠的注入定位和可执行修补。他们同时写明,静态核验不能保证合法功能全部保留,发现也不是该行为在每次部署中都会被利用的证明。
阅读原文arxiv.org