跳到正文
原文
论文追踪· arXiv:2608.21101· Kai Wang, Zeming Wei, BiaoJie Zeng, Chang Jin, An Wang, Xiaokun Luan, Zhixiao Lin, Jingjing Qu, Xia Hu, Xingcheng Xu·本站收录 · 原文发表

ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关

ClawSentry: A Progressive Multi-Tier Security Monitor for Safeguarding Autonomous LLM Agents

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

ClawSentry 在五个 Work Agent 的 SkillsSafety 上将 ASR 从 33.5–49.7% 压到 9.09–15.03%,干净技能合计 TSR 为 98.7%。

威胁模型攻击者发布恶意第三方 skill 包(供应链)或在任务上下文中嵌入隐藏指令(contextual injection)。

问题
智能体可执行代码、读本地文件并调用工具,恶意第三方 skill 或上下文注入能在准入、调用意图、执行效果和事后后果四处进入,被拒目标还会换表面重试。现有防护多只覆盖单一边界或独立评估每次调用。
方法
ClawSentry 经 Agent Harness Protocol 把同一策略挂到四个框架。FSPR 在首次使用前做确定性证据底线加只读包级审查;运行时 L1–L3 按效果信封逐级升级,会话级反绕过记录已拒绝效果,事后层异步回传证据且不撤回已完成动作。
实验与结果
作者报告:SkillInject 上 Codex/GPT-5.4 的 contextual ASR 从 39.55% 降到 2.61%,contextual TSR 从 83.78% 到 83.05%。五个 Work Agent 的 SkillsSafety ASR 从 33.5–49.7% 收到 9.09–15.03%,干净技能合计 TSR 为 98.7%。中毒任务上的 TSR 下降大部分发生在防御介入之前。
局限与可以继续做的
作者称包级与运行时门控仍是部署时控制,根因在分发;未做交互式人工复核,Defer 一律当 Block,报告的受保护 TSR 是有人值守的下界。直接越狱、无工具错位、被攻陷 OS、API 操纵和权重投毒不在范围内。主实验评审为 gemini-3.5-flash,论文未报告时延、token 和价格。
实验设置Codex/GPT-5.4、Codex/GPT-5.5 等 · SkillInject、SkillsSafety 等 · ASR、TSR 等
威胁模型
攻击者发布恶意第三方 skill 包(供应链)或在任务上下文中嵌入隐藏指令(contextual injection)。保护主机文件系统、凭证与密钥、网络出站和命令执行。ClawSentry 主动调解 locus A–C 与跨尝试迁移;locus D 非回溯观察。直接越狱、无工具的基座错位、被攻陷的宿主 OS、模型 API 操纵和权重投毒不在范围内。
模型
Codex/GPT-5.4Codex/GPT-5.5Claude Code/GLM-5.1Claude Code/MiniMax-2.7Kimi CLI/Kimi-K2.5Claude Code/MiniMax-M3gemini-3.5-flash
基准
SkillInjectSkillsSafetyclean-utility suite101-package mixed corpus
指标
ASRTSRtoxic recallclean false-block rateGateway review volume
AI 导读全文 386 字

研究者提出开源、框架无关的 Agent 运行时安全监督网关 ClawSentry,用于拦截被恶意第三方技能劫持的 Agent 行为。该方法把 Agent 风险分为技能准入、调用意图、执行效果和事后后果四个环节:执行前由 First-use Skill Package Review(FSPR)在确定性证据下限下审查技能包,未决案例升级到有界只读的 Agent 审查;运行时采用确定性 L1、规则锚定 L2 语义审查和只读 L3 取证 Agent 的三层渐进决策引擎,只对残余歧义投入上下文审查,并用会话级反绕过机制识别换工具与改写重试。事后路径将高严重度证据非回溯地送入后续审查。通过 Agent Harness Protocol(AHP)抽象,同一策略可应用于 Codex、Claude Code、Kimi CLI 和 Gemini CLI,无需修改 Agent 内部。

深度解读

6 个问题,约 9,800 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    智能体风险沿生命周期四处进入且会换表面重试,单点防护盖不住。

    智能体被恶意 skill 或隐藏指令劫持后,风险会沿控制环的多个边界进入,并在被拒绝后换表面重现;现有防护通常只守一个生命周期边界或一次调用。

    • 场景与重要性:作者称,LLM 智能体已从对话转向执行代码、读取本地文件和编排外部工具;一旦获得本地文件系统、网络和命令执行权限,一个被恶意第三方 skill 劫持的智能体可造成数据外泄、权限提升或级联失陷,威胁超出基座模型本身。
    • 现有方法不足:作者称,现有防护大多作用于单一位点,或把每次调用独立评估。覆盖一个边界之外,单边界防御即使看到改写或换工具的重试,也无法知道当前调用在重复一个已被拒绝的目标。因此同时需要跨可观察生命周期边界的覆盖,以及跨尝试的状态。
    • 核心观察:作者认为 agentic risk 是渐进的,可在四个位点进入——skill 准入、调用时意图、执行时效果、事后后果;被拒绝的危险目标还会跨表面形式、工具或轮次重现。
    • 威胁模型:
      • 攻击者:发布恶意第三方 skill 包供智能体安装调用(供应链),或在智能体处理的任务上下文中嵌入隐藏指令(上下文注入)。评测区分 obvious injection(恶意意图显式)和 contextual injection(恶意指令藏在合法任务中)。
      • 资产:主机文件系统、凭证与密钥、网络出站、命令执行。
      • 防御范围:ClawSentry 主动调解 locus A–C 与跨尝试迁移;locus D 非回溯地观察,因为效果已经发生,主流 harness 没有撤回工具返回结果的钩子。
      • 范围外:从不跨越可观察 skill 或运行时调解边界的威胁——直接的用户到模型越狱、没有工具中介效果的基座错位、被攻陷的宿主操作系统、模型 API 操纵、权重投毒。
    • 提出的系统:作者提出开源、与框架无关的安全监督网关 ClawSentry,经 Agent Harness Protocol(AHP) 在不改智能体内部的前提下,把同一策略用于 Codex、Claude Code、Kimi CLI 和 Gemini CLI。首次使用前由 First-use Skill Package Review(FSPR) 做包级证据审计;运行时用 L1–L3 渐进决策,并加会话级反绕过;事后路径把高严重度证据非回溯地送入后续审查。
  2. 有哪些相关研究?

    相关工作按智能体、注入风险和单点防护分组,Table 1 对比覆盖轴。

    相关工作分成智能体系统、安全风险和智能体防护三组;作者用 Table 1 把代表性防护按位点覆盖对齐。

    自主 LLM 智能体

    • ReAct(Yao et al., 2023)、AutoGPT(Significant Gravitas, 2023)、OpenHands(Wang et al., 2025b):智能体通过迭代推理规划并行动,常经 MCP(Anthropic, 2024)通信。作者称,授予文件系统、API 和终端访问会扩大攻击面。
    • 协议碎片化(Kong et al., 2025; Yan et al., 2026):既有综述记录了基于 LLM 的智能体系统中异构通信机制和碎片化协议。作者据此把 AHP 定义在统一 CanonicalEvent 上。

    安全风险

    • 间接提示注入(Greshake et al., 2023; Zhan et al., 2024):藏在文档或网页中的恶意指令劫持执行,可导致未授权 shell、权限提升或数据外泄(Lupinacci et al., 2026)。作者称这类利用是语义的而不是签名式的,传统检测大体无效(Fang et al., 2024)。
    • 能力等价重试(Yan et al., 2025)与事后后果(Naik et al., 2026):被阻断后,智能体可改写参数、把目标拆到多轮或换工具;工具返回内容本身也可能携带间接指令。调用时混淆载荷见 Liu et al., 2025。
    • 进攻侧能力:作者引用 Anthropic(2025a, 2025b, 2026a, 2026b)、Wang et al.(2026)的 CyberGym、Microsoft Security(2026)和 OpenAI(2026a),说明读代码并判断意图的能力攻防共用,且已出现在公开威胁报告中。作者把 ClawSentry 放在运行时调解层,审查对象是智能体的下一步动作。

    智能体防护

    • 对话级过滤:Llama Guard(Inan et al., 2023)、Zeng et al.(2024)、Ghosh et al.(2024)、NeMo Guardrails(Rebedea et al., 2023)用辅助模型或规则过滤人机对话中的恶意内容。Spotlighting(Hines et al., 2024)、Rebuff(Protect AI, 2023)和 Yi et al.(2025)针对直接与间接提示注入。作者称,智能体具备自主执行后,提示级过滤不够。
    • 系统级架构:执行隔离 IsolateGPT(Wu et al., 2025)、动态规则监控 DRIFT(Li et al., 2025)、安全设计模式(Beurer-Kellner et al., 2025),以及借鉴 RBAC(Sandhu et al., 1996)限制工具权限。沙箱评测环境包括 ToolEmu(Ruan et al., 2024)和 AgentDojo(Debenedetti et al., 2024)。AgentSpec(Wang et al., 2025a)与 OWASP GenAI Security Project(2025)被作者用来指出单阶段防护留下的缺口。
    • Table 1 的覆盖对比:LlamaGuard、Spotlighting、Rebuff 无 skill 准入、无反绕过、无端到端智能体基准;IsolateGPT 只覆盖 C 且非框架无关;DRIFT 与 AgentSpec 覆盖 B/C 并有智能体基准,但无 A、无反绕过、非框架无关。作者称,在所调查的系统中,ClawSentry 是唯一在 A、渐进 B/C、跨尝试反绕过、框架无关和端到端基准上均报告支持的系统,并写明这不是对全领域的穷尽比较。

    基线与基准

    • 基线方法:无保护的原始 Work Agent(raw)、以及受控比较中的 AgentSpec(Wang et al., 2025a)、Progent(Shi et al., 2025)、SkillGuard(Zeng et al., 2026)、A.S.E(Chen et al., 2026)。FSPR 响应还比较 hard block、warning 和 runtime feedback。
    • 基准/数据集:SkillInject(Schmotz et al., 2026)、SkillsSafety(Jin et al., 2026,良性载体来自 SkillsBench,Li et al., 2026)。

    作者把本文定位为同时满足跨边界覆盖和跨尝试状态、且与底层框架无关的选择性审查网关:把有能力的审查者放在只读外部监督位置,而不是让它成为执行者。

  3. 论文如何解决这个问题?

    AHP 统一事件,FSPR 守准入,L1–L3 按效果逐级裁决并记已拒绝效果。

    ClawSentry 把监督对齐到智能体生命周期:确定性硬证据单调保留,分析器只提供证据,网关保留最终策略权。所有机制消费 AHP 的规范事件,并带上网关持有的包、工作区和信任上下文。

    问题设定与 AHP

    • 四个位点加一个横切性质:A 为 skill 准入/供应链;B 为调用时意图;C 为执行时效果;D 为事后后果。横切性质是能力等价的后续/绕过迁移:被拒绝后保持 capability 与 target,改写参数、跨轮拆分或换工具。
    • CanonicalEvent:适配器把各框架的 pre-action hook、工具执行和 post-action 结果归一成带 SHA-256 event_id、session_id、tool_name 和通用 payload 的事件,框架特有状态放在隔离的 framework_meta。新增框架只需轻量适配器。
    • 双通道:位点 A–C 的事前事件经本地 Unix Domain Socket 同步阻塞,直到网关返回 Allow、Block 或 Defer。位点 D 经 HTTP Webhook 异步发送,不阻塞、也不撤回已发生的效果。

    FSPR:首次使用前的包审查

    • 确定性底线:扫描器建立声明、文件、入口、引用和已观察能力的有界清单;规则把具体不一致和可疑结构变成证据底线。高严重度发现不能被后续模型回答抹掉,已能确立准入风险时短路。证据轴包括身份完整性、能力与清单对齐、数据边界与执行面、指令通道完整性、状态变更范围、再入与持久激活、审查证据质量。
    • 有界只读智能体审查:未决包进入 agentic-readonly 审查者,可在 skill 根内列出、读取和搜索,工具包不提供写、执行、安装或网络动作。网关把其证据记录与确定性底线合并:规则对已知不变量有权威,智能体审查覆盖单文件模式表达不了的关系。
    • 缓存与裁决:缓存身份来自包内容和审查策略版本;包或策略变化则重新裁决。评测配置中,策略允许的 suspicious 与 inconsistent 裁决会阻止准入。FSPR 判断使用前的整包证据,与运行时 L3 分开。

    效果归一的 L1–L3

    • 效果信封与六维快照:每个事件映射到含 capability、target、scope、artifact role 和证据来源的 effect envelope。六维为工具危险 D1、目标敏感 D2、命令模式危险 D3、会话累积 D4、智能体信任 D5、注入证据 D6。Table 3 说明这些维与基准的 RD1–RD6 不是同一套。
    • 路由分数:复合分数为 Bt = w123max(D1,D2,D3)+w4 D4+w5 D5,St = Bt(1+λ D6/3)。最大值避免把同一效果的多种表面描述当成独立证据;注入乘子在底层动作已经有能力时加重导向信号。该分数是路由与审计基底,不是裁决本身。权重与阈值在附录 A,正文未给出具体数值。
    • 三级漏斗:L1 为确定性策略引擎,无提供者调用,用滑动窗口使过期会话风险失效,并用效果感知短路关闭清楚案例;被禁用能力的等价物、未解析包装器和生成的未来执行路径走保守路由。L2 把版本化攻击模式规则与单轮 LLM 结合,内置库有 25 个模式,来自 OWASP Top 10 for Agentic Applications 的前五类 ASI01–ASI05;操作者可替换 YAML 而不改决策契约。L2 可以提高 L1 风险;要降低则需要绑定当前事件与效果的单独校验 clearance,硬发现始终有效。L3 在显式更深审查路由,或 L2 不决且触发策略匹配时调用;多轮分析器经只读工具查看有界工作区、轨迹和会话风险,YAML 审查技能的工具允许列表与全局只读白名单取交。语义分析降级时,已建立的 L1 决定仍然有效,需要上下文审查的动作没有有效的效果绑定 clearance 不得放行。

    会话信任、反绕过与事后反馈

    • 操作者授予的会话范围:可选的 session scope profile 记录任务实际需要的权限,授权只经操作者级通道生效,攻击者能影响的文本不能自行扩大权限。范围评估单调:只能把决定收紧为 Defer 或 Block,不改写 FSPR、后续守卫和各层已有裁决。
    • 能力等价后续守卫:在普通层级选择之前查询会话内已拒绝效果的紧凑记录。精确重复和归一化的破坏性效果确定性处理;不确定的跨工具等价提升到 L3。残余候选由经过清洗的 LLM 识别器只判断当前动作是否为先前高风险 Block 或 Defer 的后续;正向匹配只激活网关配置的 L3 路由,识别器不能选择执行结果。
    • 事后后果:异步分析工具输出中的间接指令、密钥暴露、外泄和混淆。已完成事件保持 Allow。合格发现作为证据广播,操作者可在智能体继续利用之前停止任务;若分析先完成,高严重度结果也可提高后续动作的审查强度。附录 A 给出规则、权重、阈值和审查技能清单的说明,正文未逐条展开。
  4. 论文做了哪些实验?

    五套 Work Agent 上 ASR 下降且干净 TSR 保持,中毒 TSR 损失多在防御前。

    实验设置

    • Work Agent:端到端为 Codex/GPT-5.4、Codex/GPT-5.5、Claude Code/GLM-5.1、Claude Code/MiniMax-2.7、Kimi CLI/Kimi-K2.5。受控研究用 Claude Code/MiniMax-M3,与主实验的 MiniMax-2.7 不是同一发布,数值只在各自块内比较。
    • 评审:主实验除非另有说明,安全评审为 gemini-3.5-flash,同时承担 Gateway L2/L3 与 FSPR。替换实验另用多个提供者,正文点名的后端包括 minimax-m2.7 与 kimi-k2.5。
    • 基准规模:SkillInject 有 180 条 obvious、139 条 contextual。SkillsSafety 有 155 例、六个风险域 RD1–RD6,良性载体来自 SkillsBench。干净效用套件为 58 个干净任务配干净 skill。混合语料 101 个包:48 个有毒 SkillsSafety、48 个干净 SkillsBench、5 个干净 SkillInject 回归包。每项受控研究用固定种子随机抽取的 60 例 SkillsSafety 子集。
    • 指标与判定:ASR 越低越好,TSR 为良性用户任务完成、越高越好,只计完整验证器通过。SkillsSafety 用确定性验证器判定不安全行为,并用该例的验证器测试给良性完成打分。SkillInject 的攻击成功和任务完成都由其自带 LLM judge 打分。论文未说明该 judge 的模型名。无人值守基准把 Defer 确定性地当作 Block。
    • 信任声明:受保护的 SkillsSafety 会话由 harness 经 §6.3 的任务运行通道,按例发放操作者授予的产物路径声明,只覆盖任务数据读和任务输出写。
    • 重复:基础设施故障的运行在可能时重跑,否则从所有分母中排除。论文未报告独立重复次数。

    主结果

    SkillInject(Table 4,%)。CS 为 ClawSentry。

    表格较宽,可左右滑动

    Work AgentObv. ASR rawObv. ASR CSCtx. ASR rawCtx. ASR CSCtx. TSR rawCtx. TSR CS
    Codex/GPT-5.418.754.4739.552.6183.7883.05
    Codex/GPT-5.529.384.0939.868.4087.0184.75
    CC/GLM-5.131.104.4953.9114.2981.9476.27
    CC/MiniMax-2.735.266.0237.6010.8583.3369.49
    Kimi CLI/K2.534.665.6327.746.8279.2264.41

    SkillsSafety 合计(Table 5,%)。Raw 为基准已发布基线;两个 TSR 列都在有毒包存在时测量。

    表格较宽,可左右滑动

    Work AgentASR rawASR +CSTSR rawTSR +CS
    Codex/GPT-5.444.512.5038.725.66
    Codex/GPT-5.541.815.0342.630.07
    CC/GLM-5.133.512.4037.423.14
    CC/MiniMax-2.734.29.0920.615.58
    Kimi CLI/K2.549.710.2031.016.33
    • 作者解读 SkillInject:受保护后每个配置的显式与隐蔽攻击都被压低;obvious ASR 收到 4.09–6.02%(作者称 4.2–7.2×),contextual ASR 收到 2.61–14.29%(作者称 3.5–15.2×)。合法上下文任务在 Codex 上保留:受保护 TSR 与 raw 相差不超过 0.73 和 2.26 个百分点。Claude Code 与 Kimi 的 contextual TSR 下降更大,Table 4 中 MiniMax-2.7 从 83.33% 到 69.49%,K2.5 从 79.22% 到 64.41%。
    • 作者解读 SkillsSafety:每个 Work Agent 的 ASR 都下降,33.5–49.7% 收到 9.09–15.03%,作者称 2.7–4.9×、绝对改进 21.1–39.5 个百分点。广度来自同一评审配置在 Work Agent 之间的迁移。受保护 TSR 下降 5.0–14.7 个百分点。
    • Figure 6(b):四个 Codex/Claude Code 配置的干净任务 raw TSR 均为 100%,受保护为 98.2–100%,合计 98.7%。Figure 2 给出无保护时各域 ASR,例如 Kimi CLI/K2.5 的 RD1 为 76.0、RD2 为 72.0、RD3 为 26.9、合计 49.7;作者称 RD1、RD2 在每个家族都高,RD3 明显更低。

    中毒案例的 TSR 分解

    • 测了什么:60 例 Codex/GPT-5.4、覆盖 RD1–RD6。A 无 skill,B 同类干净 SkillsBench skill,C 中毒包且关闭 ClawSentry,D 同一包加硬拦截。A–C 不含 ClawSentry。
    • 结果:Figure 7 中固定分母 TSR 为 A 43.3%(26/60)、B 50.0%(30/60)、C 31.7%(19/60)、D 25.0%(15/60)。干净 skill 比无 skill 高 6.7 个百分点;中毒在防御介入前比干净 skill 低 18.3 个百分点,比无 skill 低 11.7 个百分点;从 C 到 D 再降 6.7 个百分点。
    • 作者解读:干净参考到受保护点的 25.0 个百分点距离中,大约四分之三发生在网关做任何决定之前,并已反映在 Table 5 的 raw 列。剩下 6.7 个百分点被归为过度拦截,是无人值守、把 Defer 当 Block 的直接成本;D 是有人值守操作点的下界。作者认为良性任务与攻击路径在同一产物中,拒绝动作会截断当前轨迹。

    FSPR 与受控比较

    • 包判别(§7.5,Figure 9):101 包上用不同于主评审的两个后端。minimax-m2.7 识别全部 48 个有毒包,接受 53 个干净包中的 49 个;kimi-k2.5 识别 48 个中的 43 个,接受 53 个中的 50 个。作者称两者的干净过度拦截都低于 8%,并给出 5.7–7.5% 的残余干净误拦率,且这不是主评审配置下的直接测量。
    • FSPR 响应(Table 6 的对应块):在固定 Work Agent、60 例和评审的条件下,hard block 相对 warning 把 ASR 降低 16.09 个百分点,TSR 相差 2.41 个百分点,并在两个轴上优于 runtime feedback。作者称差距是结构性的:软响应仍让包进入执行。
    • 评审替换(§7.6,Table 2):同一网关执行链上替换五个提供者,ASR 为 11.11–17.24%。作者称保护主要在网关拥有的执行链,而不是某一个审查模型。

    其他消融与分析

    • 选择性审查量(§7.7、附录 F):五个评审替换、300 次 provider–case 执行上,到达 L2 的 L1 流量为 13.8%,仅 L3 为 1.37%;分解后 L2/L1 为 12.5%,L3/L2 为 11.0%,各评审 L2/L1 在 11.0–14.2%,L3/L1 在 1.0–1.7%。FSPR 为每个 provider–case 2.30 次首次包审查,不计入 Gateway 比例。反绕过触发 483 次,按会话状态单计。论文未报告每次请求的时延、token 和价格。
    • 基线对照:受控块还比较 AgentSpec、Progent、SkillGuard 和 A.S.E;正文给出的可回查数字是 hard block 相对 warning 的 16.09 个 ASR 百分点和 2.41 个 TSR 百分点。其余基线的逐格数字在提供的文本中列对齐不可靠,这里不转写。
    • 无人值守约定(附录 G):所有报告的 ASR 与 TSR 都使用 Defer→Block;不把未观察的人工决定计入。
    • Figure 8:按域画出 A–D 的完整任务通过数,每域 10 例;可见各域通过数不同,例如一域的无 skill 为 9、干净为 8。
    • 负面/例外:受保护后 SkillsSafety TSR 仍下降 5.0–14.7 个百分点;SkillInject 上非 Codex 的 contextual TSR 下降大于 Codex。Kimi-K2.5 的 FSPR 漏掉 48 个有毒包中的 5 个。作者把中毒会话里的大部分 TSR 损失归因于中毒本身,而不是网关。
  5. 有什么可以进一步探索的点?

    作者认为根因在分发时,门控是部署控制;报告的 TSR 是无人值守下界。

    作者指出的局限与后续方向

    • 部署时控制不是根因(§7.4、§8):作者称包级与运行时门控仍是部署时控制;安全与效用要在任务开始前、在准入门以及最终在分发时一起保住。中毒包一旦获准,可达到的参考是 C=31.7% 而不是干净 skill 的 50.0%,再往上的点数只有给攻击所要利用的自由度才能收回。
    • 无人值守的 Defer 映射(附录 G、§7.4):基准没有操作者,每个事前 Defer 都执行成 Block。作者称这会保守地拒绝交互审查者会批准的合法工作,报告的受保护 TSR 是有人值守操作点的下界,测到的过度拦截包含这一约定的成本。
    • 架构性而非参数性(§7.4):作者称良性任务与攻击路径在同一产物里,关于一个的决定必然关于另一个;决定发生在包已经引导过的会话中,拒绝动作截断当前轨迹,而不是恢复“从未提供该包”时的轨迹。
    • FSPR 误拦不是主配置的直接测量(§7.5):5.7–7.5% 来自另外两个后端,作者写明它估计准入期过度拦截的规模,不是 §7.3 与 §7.4 主评审配置下的直接测量。
    • 范围外威胁(§3.3):直接用户到模型越狱、没有工具中介效果的基座错位、被攻陷的宿主 OS、模型 API 操纵和权重投毒不在本工作范围内。
    • 成本只测到请求量(附录 F):漏斗计数的是架构控制的审查请求量;每次请求的时延、token 消耗和价格仍是操作者所选审查后端的属性。作者计划以开源形式提供代码、配置和审查规则。

    实验覆盖范围

    • 端到端 Work Agent 为 Codex/GPT-5.4、Codex/GPT-5.5、Claude Code/GLM-5.1、Claude Code/MiniMax-2.7、Kimi CLI/Kimi-K2.5 共五个;AHP 还接到 Gemini CLI,但端到端表未单列 Gemini CLI 的 ASR。
    • 主实验安全评审为 gemini-3.5-flash。FSPR 判别另用 minimax-m2.7 与 kimi-k2.5。评审替换在同一网关上比较五个提供者,ASR 11.11–17.24%(§7.6)。
    • 评测材料为 SkillInject(180 obvious、139 contextual)、完整 SkillsSafety(155 例、RD1–RD6)、58 个干净任务、101 包混合语料,以及各项受控研究各自固定的 60 例子集。
    • 判定沿用各基准自己的 harness:SkillsSafety 为确定性验证器,SkillInject 为自带 LLM judge;无人值守全程 Defer 当 Block。附录 B 给出可审计计数,论文未报告独立重复次数。
    • 对照与机制测量包括无保护 raw、FSPR 的 hard block / warning / runtime feedback、AgentSpec、Progent、SkillGuard、A.S.E,以及 L1–L3 请求量。受控研究的 Work Agent 为 Claude Code/MiniMax-M3,不与主表合并。
  6. 总结一下论文的主要内容

    ClawSentry 用包准入、三级运行时门控和反绕过,压低 skill 攻击并保住干净任务。

    ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。

    • 问题:风险可在准入、调用意图、执行效果和事后后果进入;被拒绝的目标还能改写、拆轮或换工具重试。作者认为单点过滤、沙箱或输出审核各自只守一处,而且逐次观察不等于认出同一次被拒效果。
    • 方法:AHP 把 Codex、Claude Code、Kimi CLI、Gemini CLI 的事件归一成规范事件。FSPR 在首次执行前用确定性证据底线,未决包再做有界只读跨文件审查。运行时把动作收成效果信封,经 L1 规则、L2 规则锚定语义审查和只读 L3 逐级处理;后续守卫在选层之前比对已拒绝效果。事后层只异步报告,不撤回已完成动作。审查者只提供证据,网关保留 Allow、Defer、Block。
    • 结果:SkillInject 上 Codex/GPT-5.4 的 contextual ASR 从 39.55% 降到 2.61%,contextual TSR 从 83.78% 到 83.05%(Table 4)。五个 Work Agent 的 SkillsSafety ASR 从 33.5–49.7% 收到 9.09–15.03%,其中 MiniMax-2.7 为 9.09%、GPT-5.5 为 15.03%(Table 5)。四个 Codex/Claude Code 配置的干净技能 TSR 合计 98.7%(Figure 6b)。60 例 GPT-5.4 上,中毒本身把 TSR 从干净 skill 的 50.0% 拉到 31.7%,硬拦截再降到 25.0%(Figure 7)。
    • 作者的结论:作者认为网关在有毒 skill 与干净 skill 之间拉开不对称,干净工作上的约 1.3 个百分点开销解释不了中毒会话里 5.0–14.7 个百分点的 TSR 降幅。剩余的执行成本被写成无人值守硬边界的代价;操作者可以在测得的操作点之间取舍。作者认为更根本的收口在任务开始前的准入,以及最终的分发。评测配置使用 gemini-3.5-flash,作者称所报告的剖面不依赖前沿级审查模型。
阅读原文arxiv.org