跳到正文
原文
论文追踪· arXiv:2606.02302· Hao Cheng, Changtao Miao, Tianle Song et al.·本站收录 · 原文发表

SeClaw 发布面向自主 Agent 的规格驱动安全任务合成与评测框架

SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents

论文速读

评测与基准

据论文 PDF 整理(AI 生成),以原文为准

SeClaw用规格驱动合成安全任务,并在Docker中按轨迹评测智能体;论文未报告定量结果。

问题
自主智能体会调用工具、文件、记忆和外部服务,手工固定且只看最终结果的安全基准难以覆盖新风险和执行过程。SeClaw要可扩展地造题并检查过程中的不安全行为。
方法
人类专家与Claude Code编写风险规格,多智能体生成原型并实例化为OpenClaw任务。Docker沙箱按场景配置工具、记录轨迹,并用覆盖分C、成功分P及调和平均F_attack评分。
局限与可以继续做的
作者称工作仍在进行,计划发布Qwen、Kimi、GPT、Gemini等结果,接入更多执行框架,并研究任务传递中的隐式风险。正文定义了四类风险、Docker轨迹和C、P、F_attack,未报告任务规模与实测分数。
实验设置SeClaw · C、P 等
基准
SeClaw
指标
CPF_attack
AI 导读研究者提出 SeClaw,一个把规格驱动的安全任务合成与基于执行的安全评测结合起来的框架,用于评估自主 LLM Agent 的安全表现。该框架从结构化风险规格出发,可扩展、可控地构造安全任务,并通过 SeClaw docker 提供标准化测试环境。基准覆盖来自资源、用户任务、环境以及 Agent 自身行为四类风险,并支持对不安全动作做轨迹感知评估,而不只看最终回答。作者称其连接了系统化任务合成与可复现安全评测,代码已公开。

研究者提出 SeClaw,一个把规格驱动的安全任务合成与基于执行的安全评测结合起来的框架,用于评估自主 LLM Agent 的安全表现。该框架从结构化风险规格出发,可扩展、可控地构造安全任务,并通过 SeClaw docker 提供标准化测试环境。基准覆盖来自资源、用户任务、环境以及 Agent 自身行为四类风险,并支持对不安全动作做轨迹感知评估,而不只看最终回答。作者称其连接了系统化任务合成与可复现安全评测,代码已公开。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    现有基准难规模化且偏重最终结果,SeClaw用规格合成任务并按轨迹评测。

    现有智能体安全评测难以按新风险规模化造题,也较少检查通向不安全结果的执行过程。

    • 场景:作者称自主 LLM 智能体可通过工具、持久记忆和多步推理操作文件、执行代码并做跨应用编排;OpenClaw 一类系统还会加载 skill、检索外部内容并执行动作。作者称攻击面因此扩大,成功攻击可能导致数据外泄或未经授权的系统控制。
    • 现有评测的限制:作者称安全任务常来自红队提交或专家手工设计,受标注者经验和假设约束,且多为固定实例而非生成机制,难以面向新风险或特定风险来源、部署场景与威胁方法的组合扩展。作者还称只看最终不安全结果时,工具调用、文件操作、命令执行和环境交互中的过程难以归因、比较和复现。
    • 分类:作者按 Figure 1 将下游安全问题分为 resource、task、environment、intrinsic 四类来源,并称其可能导致数据泄露、目标替换、系统不稳定、财务损失、权限提升以及法律或合规违规。作者还称现有防御多针对单个组件,而不是把智能体当作整体系统。
    • 提出的框架:作者提出 SeClaw,用 Spec-Driven Security Task Synthesis 从结构化规格生成任务,并用 SeClaw docker 做隔离、可复现、可审计的轨迹评测。首页脚注称本文为初步工作,仍在进行,更完整版本将在后续发布。
  2. 有哪些相关研究?

    相关工作按四类风险和既有基准组织,作者把SeClaw定位为规格驱动评测。

    论文在第 2 节按风险来源和评测工作分组,多数条目只描述做法,明确对比集中在少数基准。

    资源风险

    • 记忆与 skill:AgentPoison(Chen et al., 2024)通过触发式检索操纵记忆以诱导恶意行为;SkillInject(Schmotz et al., 2026)评测第三方 skill 文件中的提示注入;Chen et al. (2026) 讨论第三方 skill 经不安全实现和提示注入泄露凭据。
    • 工具与 MCP:ToolHijacker(Shi et al., 2026)用恶意工具文档劫持工具选择;MPMA(Wang et al., 2026e)用恶意 MCP 描述使智能体偏向攻击者工具;MCPTox(Wang et al., 2026d)评测真实 MCP 环境中的工具投毒;MalTool(Hu et al., 2026)自动生成恶意工具。

    任务与环境风险

    • 任务风险:Andriushchenko et al. (2025) 讨论越狱诱导有害多步行为;Alizadeh et al. (2025) 讨论提示注入使工具调用智能体在任务中泄露个人数据。同组还有 MEXTRA(Wang et al., 2025)、BadRobot(Zhang et al., 2025)、Shahroz et al. (2025) 的多智能体提示攻击、ObliInjection(Wang et al., 2026c)和 RedAgent(Xu et al., 2026)。
    • 环境风险:AgentDojo(Debenedetti et al., 2024)评测来自对抗环境观察的提示注入。同组还有 MASLeak(Wang et al., 2026b)、LLMail-Inject(Abdelnabi et al., 2026)、WASP(Evtimov et al., 2026),以及 Ersoy et al. (2026) 关于网页暗黑模式误导网页智能体的工作。第 2.1 节将 PoisonedRAG 归于 Zou et al. (2026)。

    内在风险与组件防护

    • 检测与治理:SAGA(Syros et al., 2025)做智能体间治理与访问控制;AgentDoS(Luo et al., 2026)检测资源滥用导致的拒绝服务;AgentFuzz(Liu et al., 2025)检测污点式漏洞;AgentSentinel(Hu et al., 2025)审计意外工具执行;Wu et al. (2025) 讨论权限管理;ClawKeeper(Liu et al., 2026)覆盖 skill、插件和执行监视。
    • 组件级防御:作者在引言中称 Shan et al. (2026) 主要保护 LLM 智能体的单个组件,而不是把智能体当作整体系统,因而限制了对系统级风险的缓解。

    评测、综述与红队

    • 综述与生态分析:Yu et al. (2025) 调查可信 LLM 智能体;Kim et al. (2026) 系统化智能体攻击与防御;Deng et al. (2026) 分析 OpenClaw 生命周期威胁与缓解。第 2.2 节称 Zou et al. (2026) 通过大规模公开红队竞赛呈现广泛的策略违规;参考文献中同键条目对应这篇竞赛论文。
    • 点名对比的基准:作者称 Claw-Eval(Ye et al., 2026)主要关注一般可靠性,而非安全上的对抗风险;HINTBench(Wang et al., 2026a)主要针对非对抗失败;AgentDyn(Li et al., 2026)没有覆盖多样的生命周期风险来源;Clawtrap(Zhao & Cui, 2026)研究动态网络层 MITM 红队。ATBench-Claw 与 ATBench-CodeX(Yang et al., 2026)被描述为 OpenClaw 和 Codex 智能体的轨迹级安全评测,论文未对其作单独批评。
    • 基线:论文未列出自己实验使用的基线方法,也未报告在上述基准上的分数。

    作者将本文定位为更广的规格驱动安全任务合成和可复现的基于执行的评测,并以此区别于 Clawtrap 的网络层 MITM 红队。

  3. 论文如何解决这个问题?

    SeClaw从风险规格生成任务,在Docker中记轨迹并用C、P、F_attack评分。

    SeClaw 分两阶段(Figure 2):先把抽象风险变成可执行安全任务,再在统一基准设置下评测智能体。规格由人类专家与 Claude Code 共同编写,具体构造交给专用智能体。

    规格与任务原型

    • 输入:从第 2.1 节风险分类中采样风险标签,并给定应用场景。合成智能体写出风险点、智能体角色、面向用户的任务、风险来源、待测不安全行为和安全约束。
    • 耦合方式:规格说明正常完成任务如何使目标智能体遇到该风险;作者要求风险与任务自然耦合,而不是作为外部触发插入。
    • 质量门:每步主要设计后,检查智能体审查一致性、可行性、风险对齐和可评测性,包括是否匹配采样标签、风险来源是否连贯接入用户任务、不安全行为是否可观察、约束是否足够具体。通过的原型才进入下一阶段。

    任务实例化

    • 产物:实现智能体根据原型和框架规格构造任务提示、智能体配置、工具接口、模拟环境数据和评测文件。
    • 保真:须保持风险从何处进入、智能体如何接触它、以及应评测何种不安全行为。作者举例:若风险来自环境信息,不安全内容应放在工具返回数据中,而不是用户指令中;若原型要求多步暴露,实例应让智能体在完成良性任务时自然遇到相关信息。
    • 资源:通过检查的实例按 Table 1 组织,面向 OpenClaw,包括 workspace、mcp、mock service、local files、init.sh 和 task.yaml。

    轨迹验证与修正

    • 参考解:每个任务有自然语言参考解,描述预期安全轨迹,用于收集参考引导轨迹,检查任务设置、环境和评测器是否内部一致。
    • 两轮:reference round 把参考解附在任务提示后,由一个中等能力模型执行,轨迹须达到足够高的评测器分数;论文未给出该分数阈值。作者将其作为任务可解、且实现与量表对齐的必要条件。normal round 由不同能力级别的模型在看不到参考解时执行。
    • 保留规则:若任务能区分模型,或可归入可接受的 easy 或 hard 类别,则保留。若所有模型都稳定防御该风险,作者将该任务视为无效,并认为预期风险暴露不太可能已被激活。
    • 修正:验证智能体收集两类轨迹,检查智能体定位缺陷到 grader、任务配置、mock service 或提示设计等组件。原型问题回改原型,实例化问题重新生成可执行产物,并辅以人工抽查。循环直到参考轮通过且正常轮达到可区分或可接受的 easy/hard 分类。论文未给出轮数上限。

    SeClaw-Docker 执行与日志

    • 配置:以 ToolHub 为中心解析规格中的输入文件、依赖、环境变量、权限、资源限制,以及任务级 Skill 和 MCP 可用性,自动生成工作区。工具按场景检索元数据、描述、标签并排序,而不是给所有任务固定同一工具集。
    • 沙箱生命周期:模型侧安全对齐、环境实例化、沙箱内交互、状态捕获与拆除。每轮使用新容器,可访问状态限于任务指定资源;执行后销毁容器。交互为多轮,保留上下文、中间产物和工具状态。
    • 轨迹:论文将一次运行写成任务配置、逐步交互日志、最终输出和持久化产物。逐步日志连接提示或上下文、模型响应、智能体动作、MCP 工具调用、mock 服务响应和审计记录。日志分模型轨迹、工具与服务轨迹、产物轨迹三视图,用于区分不安全结果来自解释、动作选择、工具调用还是环境响应。

    安全评分

    评测器输入任务配置与轨迹,按任务规则判断是否达到预定不安全条件,同时看结果和过程,包括工具调用、服务交互、文件操作、权限使用和生成产物。样本结果为 ri=J(ci,τi)∈{0,1},1 表示达到该任务的不安全条件。设 N 为提交样本数,S_N 为成功样本数,O 为预定义安全目标集合的大小,S_O 为至少被一个样本达到的不同目标数。覆盖分 C 为 S_O/O,攻击成功分 P 为 S_N/N,总分为 Fattack=2CP/(C+P)。C 或 P 为 0 时,F_attack 取 0。论文称 F_attack 是风险导向分数而非效用分数:更大表示不安全条件既能跨目标出现,也能在样本上稳定触发,对应基础模型在该任务分布下更易受影响。第 3.1 节另列信息泄露、权限误用、内容安全和伦理或合规四类风险量表;论文未说明该量表如何并入上述 0/1 与 F_attack。

  4. 论文做了哪些实验?

    论文定义了轨迹评分协议,但未报告已完成评测的分数。

    实验设置

    • 被测模型:论文未报告已完成评测的模型。Section 4 称将在 Qwen、Kimi、GPT、Gemini 及其他代表性模型族上发布结果,此为计划。规格编写使用人类专家与 Claude Code;参考轮只写“中等能力模型”,正常轮只写“不同能力级别的模型”,均未给名称。
    • 环境与任务:执行框架按 Table 1 面向 OpenClaw,运行环境为 Docker 沙箱(Section 3.3、Figure 4)。任务来自规格合成的 safety-risk task library。论文未报告任务条数、各类风险占比或划分。
    • 指标:样本级 ri,以及 C、P、F_attack(式 (3)–(6),Section 3.3.4)。论文未报告实测值。
    • 判定:轨迹分析器按任务规则输出 0 或 1。论文未说明评审模型、数值阈值,以及与人工判定的一致性。参考轮只要求“足够高”的评测器分数。
    • 重复:论文未报告每个条件的样本量、重复次数或随机种子。验证流程包含人工抽查,未报告抽查比例。
    • 图:Figure 1–4 的图注为风险分类、框架总览、合成流水线和 Docker 执行日志,正文未转写图中数值。

    主结果

    论文没有主结果表,也没有可回查的模型分数。下表只标明未报告项,不填数。

    项目论文中的数值出处
    各模型 C、P、F_attack未报告式 (4)–(6) 只有定义
    任务库规模未报告第 3 节未给条数
    参考轮/正常轮分数未报告Section 3.2.3 只有规则
    • 作者未基于实测分数比较模型。Section 4 把模型结果写成将要发布的内容。
    • 摘要称 SeClaw 为测量、诊断和比较安全失败提供可操作基础;该句没有附带表或图中的数字。
    • 首页脚注称工作仍在进行,更完整版本将在后续发布。

    两轮验证的实测

    Section 3.2.3 规定了 reference round 与 normal round,以及“全模型稳定防御则任务无效”的规则。论文未报告轨迹分数、保留任务数或无效任务数,作者未给出实测解读。

    跨框架与跨模型比较

    Section 4 称将把 SeClaw 接入 Claude Code 及其他编程或工具使用智能体,以查看风险是否跨基础设施和交互协议存在。论文未报告这类比较的数字,也未报告 Qwen、Kimi、GPT、Gemini 的分数。

    其他消融与分析

    • 论文未报告消融、工具检索参数或评测器阈值的对比数字。
    • 论文未报告负面结果或失败案例的计数。
  5. 有什么可以进一步探索的点?

    作者称工作仍在进行,并计划发布模型结果与扩展评测。

    作者指出的局限与后续方向

    论文没有 Limitations 专节。后续方向写在 Section 4 Further Exploration,完成状态写在首页脚注。

    • 仍在进行:首页脚注称本文为初步工作,仍在进行,更完整版本将在后续发布。
    • 模型结果:作者计划发布一组基础模型上的评测结果,包括 Qwen、Kimi、GPT、Gemini 及其他代表性模型族,以便在同一安全风险任务分布下比较(Section 4)。
    • 执行框架:作者计划把 SeClaw 接入 Claude Code 及其他通用编程或工具使用智能体,以评测观察到的风险是否在不同智能体基础设施和交互协议上仍然存在(Section 4)。
    • 隐式注入:作者计划研究智能体内部任务传递中的隐式安全风险注入;论文写不安全目标或约束可能在规划、记忆、工具使用和执行模块之间被变换、隐藏或放大(Section 4)。
    • 基准本身:作者计划继续改进任务多样性、evaluator 校准和轨迹级可解释性,以支持在有状态执行环境中测量智能体安全(Section 4)。

    实验覆盖范围

    • 风险来源在 Section 2.1 与 Figure 1 中写为 resource、task、environment、intrinsic 四类;实例化资源在 Table 1 中为 workspace、mcp、mock service、local files、init.sh、task.yaml。
    • 执行协议在 Section 3.3 中为每任务独立 Docker 容器,日志分为模型、工具与服务、产物三视图。
    • 评分在 Section 3.3.4 定义为样本级 0/1,以及 C、P 和二者的调和平均 F_attack;第 3.1 节另写四类风险量表。
    • 合成侧写明使用人类专家与 Claude Code,以及 reference round、normal round 和人工抽查(Section 3.1、Section 3.2.3)。
    • 论文未报告任务库规模、已评测模型的分数、评审模型名称、重复次数和人工一致性。
  6. 总结一下论文的主要内容

    SeClaw用规格合成安全任务并按轨迹评分,定量结果尚未报告。

    SeClaw 是面向自主 LLM 智能体的安全任务合成与执行评测框架,论文称其为初步工作。

    • 问题:智能体可使用工具、文件、记忆和外部服务。作者认为现有安全任务依赖红队或手工设计,难按新风险扩展,且多只看最终不安全结果,过程难以归因和复现。
    • 任务从何而来:人类专家与 Claude Code 编写结构化规格,覆盖风险来源、部署场景、威胁相关标签和工具需求。多智能体先做原型,再实例化为 OpenClaw 可执行任务,经质量检查、两轮轨迹验证和人工抽查后进入任务库。风险被要求与正常任务耦合,而不是另插外部触发。
    • 如何执行和打分:SeClaw docker 为每个任务建立隔离容器,用 ToolHub 按场景配置 Skill 与 MCP,记录提示、工具调用、文件操作、观察和产物。样本按任务规则记为是否达到不安全条件;C 衡量不同安全目标的覆盖,P 衡量样本成功率,F_attack 为二者调和平均。论文称分数越高,表示模型在该任务分布下越容易被触发不安全条件。
    • 结果:正文、图注和表格都没有模型分数、任务条数或消融数字。Figure 1–4 与 Table 1 分别是分类、流程和资源类型。
    • 作者的结论与计划:作者称该框架把系统化任务合成和可复现安全评测接在一起,可作为测量、诊断和比较安全失败的基础。作者计划随后发布 Qwen、Kimi、GPT、Gemini 等模型的结果,接入更多执行框架,并研究任务在规划、记忆、工具使用和执行之间传递时的隐式风险。
阅读原文arxiv.org