跳到正文
原文
Hugging Face Daily Papers· arXiv:2610.02206·本站收录 · 原文发表

KaliBench:面向 Kali Linux 网络安全工具使用的细粒度基准

KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards

论文速读

评测/基准

据论文 PDF 整理(AI 生成),以原文为准

KaliBench 评测开源模型把安全意图译成 Kali CLI:无提示时 Exact Correct 最高 41.3%(GLM-5.2),SFT+GRPO 把 8B 的三模式平均 Total Score 提到 79.2%。

问题
现有评测测的是安全知识或端到端智能体任务,并不直接衡量模型能否为真实 Kali 工具生成可执行 CLI。命令行对语法、flag 绑定和参数顺序很严格,小错就会使执行失效。
方法
KaliBench 用手册约束生成、LLM 校验、沙箱执行和人工复核,得到 8504 条查询–命令对、1642 个工具。评测分 Unrestricted、Restricted、Hinted 三档,并用别名感知的分项打分做无需运行的可验证奖励。
实验与结果
24 个开源配置里,无工具提示时 Exact Correct 最高为 GLM-5.2 的 41.3%。可选参数是主要瓶颈;给文档后平均 Exact Correct 从 22.3% 升至 73.1%。SFT+GRPO 把 8B 的平均 Total Score 提到 79.2%,接近 685B 的 80.2%。
局限与可以继续做的
作者指出基准是单轮命令生成、依赖文档落地的数据,手册会随版本过时,校验与别名抽取仍不完备。评测集 5000 条、训练集 3504 条;专有模型只在 Unrestricted 上报告。
实验设置Llama3.1-Instruct 8B、Qwen3 8B 等 · KaliBench · Exact Correct、Tool Accuracy 等
模型
Llama3.1-Instruct 8BQwen3 8BQwen3 8B thinkingMistral-Small-3.2 24BGemma-3-it 27BGPT-OSS 20BGPT-OSS 120BLLaMA-3.3-Instruct 70BQwen2.5-Instruct 72BQwen3-Coder-Next 80BDeepSeek-V3.2 685BGLM-5.2 753BFoundation-Sec-Instruct 8BFoundation-Sec-Reasoning 8BLlama-Primus-Base 8B
基准
KaliBench
指标
Exact CorrectTool AccuracyOptional-Argument F1Positional-Argument F1Total Score
AI 导读全文 218 字

KaliBench 是面向 Kali Linux 自然语言到 CLI 翻译的细粒度基准与数据集,包含 8,504 条查询-命令对,覆盖 1,642 个工具、23 个能力维度和 5 个安全阶段。在三种评测模式、24 种通用与安全专用开源权重模型配置下,无限制设置中没有任何开源权重模型的精确命令准确率超过 42%。基于 KaliBench 的可验证奖励进行监督微调和强化学习,可显著提升 8B 模型,使其性能接近 685B MoE 模型。

深度解读

6 个问题,约 8,700 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    现有评测不直接衡量模型能否把安全请求译成可执行的 Kali CLI 命令。

    现有评测不直接衡量模型能否把自然语言安全请求译成精确、可执行的 Kali Linux CLI 命令。

    • 场景:作者称 LLM 已进入交互助手和自主智能体等安全工作流,而 Kali Linux 提供超过 2000 个预装安全工具包。分析人员要把高层目标译成 Nmap、Metasploit、Volatility 等工具的精确命令;参数顺序、flag 拼写、别名误用或工具选错都可使执行失效。
    • 现有不足:知识类基准(选择题、结构化问答)测的是概念理解;CyBench、NYU-CTF Bench、DefenderBench 等端到端任务把规划、环境交互、观察解释、工具调用和纠错混在一起,难以把失败归到单个环节。函数调用基准假定工具由 JSON schema 或 API 显式给出,而把数百个 CLI schema 放进提示词在部署中不现实。
    • 核心观察:安全工具调用实际是 schema-free 的 NL–to–CLI:模型必须自行推断工具与参数,并生成符合 UNIX shell 约定的可执行命令,而不是填写结构化字段。
    • 本文提出:作者提出 KaliBench,一个面向 Kali Linux 的细粒度基准与数据集,含 8504 条查询–命令对、1642 个工具、23 个能力维度和 5 个安全阶段。它用手册约束的生成、确定性规范化和别名感知评测,并给出无需运行命令即可计算的可验证奖励,用于 SFT 与 RLVR。作者称就其所知,这是 schema-free CLI 设定下评测安全工具调用的第一个基准。
  2. 有哪些相关研究?

    知识问答和端到端 CTF 都不单独衡量 schema-free 的 CLI 命令生成。

    知识类基准测概念,端到端基准测整条工作流,函数调用基准假定有显式 schema。

    通用与安全知识评测

    • MMLU、HELM:前者测通用知识,后者把多个基准收成统一框架;作者称它们不覆盖安全领域的操作约束。
    • SecEval、CyberMetric、CyberBench、SECURE、CS-Eval、SecBench、CTI-Bench:用选择题、判断题、简答或其他分类题覆盖软件与网络安全、密码学、工控和威胁情报。作者称它们主要测知识回忆和静态推理,而不是具体操作行为。

    端到端智能体评测

    • CyBench、NYU-CTF Bench:在 CTF 挑战里做端到端安全评测。
    • DefenderBench:在企业风格环境中研究同时包含防御与攻击工作流的语言智能体。作者称端到端成绩同时依赖规划、环境交互、观察解释、工具调用和纠错,难以归因。

    函数调用基准

    • BFCL、ToolSandbox、StableToolBench、HammerBench:覆盖单轮、多轮、对话和智能体设定,强调 schema 定义的 API 与确定性校验。作者称它们假定工具和参数由显式 schema 给出,不考虑必须从共享 CLI 推断工具的情况,也不提供细粒度、别名感知的命令正确性评估。

    基线方法与基准

    • 实验基线是 14 个通用开源模型和 7 个安全向开源模型,外加三个在 KaliBench 上再训练的变体;主表在自建的 KaliBench(评测 5000 条)上比较。专有对照为 GPT-5.6-Sol、Claude Opus 5,以及由 GPT-5.5 驱动、xhigh reasoning 的 OpenAI Codex。训练基座是 RedSage-Ins(8B),方法为 LoRA SFT、GRPO,以及 SFT 后再 GRPO。

    作者把 KaliBench 定位为对上述工作的补充:单独衡量命令生成,并分开评测工具选择、可选参数和位置参数;并称就其所知,尚无基准在 schema-free 条件下直接评测真实安全工具的自然语言到 CLI 翻译。

  3. 论文如何解决这个问题?

    手册约束生成加三阶段校验,再用别名感知分项分数做免运行奖励。

    KaliBench 把分析人员的自然语言请求映射到可执行 Kali 命令,并把命令拆成工具名、可选参数和位置参数,以便分项打分和免运行训练。

    数据生成

    • 语料:从 Kali Linux 仓库整理官方文档,2372 个工具的结构化 Markdown,含长短选项与别名,并用 metapackage 分类标注能力维度。
    • 生成:对每个工具用 Qwen3-Max 生成 10–13 条自然语言查询–命令对,并标注 tool name、别名感知的 flag–value 可选参数和位置参数。此阶段得到 27.7K 对,覆盖全部文档化工具。
    • 分类:按 kali-tools 的 23 个功能维度,并受 Lockheed Martin Cyber Kill Chain 启发归入五个阶段:Reconnaissance & Initial Access、Vulnerability Analysis、Exploitation & Payload Delivery、Post-Exploitation & Lateral Movement、Defensive Analysis & Reporting。跨阶段的能力只指定一个主角色。

    校验、清洗与划分

    • LLM-as-Verifier:把 query、generated_command 和 tool_manuscript 交给 LLM,检查 flag 与参数是否都有文档记载、命令是否只用受支持功能实现该查询。首轮滤掉 53.8%;413 个工具(17.4%)没有合格样本,于是迭代再生成再校验。得到 14.5K 对,相对初始数据移除 47.65%。提示词见附录 C.2。
    • 终端校验:在装有 Kali-linux-everything 的 Docker 沙箱中执行,记录 stdout、stderr、退出码和超时。参数是合成的,故用基于执行日志的规则过滤掉 LLM 未发现的幻觉工具或非法参数,滤掉已通过 LLM 校验样本的 11.95%。细节见附录 E。
    • 人工在环:在 Hinted 设定下分析最强模型仍失败的样本,先由 AI agent(OpenAI Codex,GPT-5.4 Thinking)对照 query、生成命令、真值命令和文档给出初判,再由人核对歧义与标注错误。额外判定 4.9% 无效,原因包括畸形选项、漏掉查询明确要求的参数、以及 flag 效果或操作数位置与请求不符。案例见附录 F。
    • 去重与划分:用 SemHash 把 [query, tool_name, ground_truth_command] 嵌入并做近似最近邻聚类,成对余弦相似度超过 0.90 则归为一组,每组保留代表样本。最终 8.5K 对(原始 27.7K 的 30.7%),覆盖 1642 个工具(69.2%)。评测集 5000 条覆盖全部 1642 个工具,训练集 3504 条覆盖 962 个工具。

    评测协议

    • 三种信息量:Unrestricted 只给自然语言查询;Restricted 另给随机抽到的 20 个候选工具名且含正确工具;Hinted 再给这些候选工具的官方文档,用来逼近 schema 式函数调用。提示模板见附录 C.3。
    • 解析:用 Python shlex 按 UNIX shell 约定做词法分析,不执行模型输出。可选参数以 -- 或 - 开头、顺序可变、允许别名;位置参数只有值且顺序固定。
    • 指标:Tool Accuracy 为选对工具;Optional-Argument F1 为别名感知的可选 flag 名匹配;Positional-Argument F1 为位置参数值的多重集匹配;Total Score 为工具分与参数分的平均;Exact Correct 仅当工具和全部参数都与真值一致时为 1。定义见附录 L。

    训练协议

    • 样本:评测用的同一提示模板,输入为 query、随机候选工具列表和工具文档。三种设定拼接后为 3504×3=10512 条。
    • SFT:以真值命令为目标,在 query 和可选工具信息条件下生成该命令。
    • RLVR:按文献 [9] 要求模型先在 think 标签内给出中间推理再输出命令。奖励来自分项指标:工具名、位置参数、别名感知的可选参数,另加精确命令匹配奖励和格式奖励。真值已在构建时经沙箱验证,因此奖励不需要执行模型输出。优化用 GRPO。骨干是表现最好的 8B 安全向模型 RedSage-Ins,用 LoRA(Unsloth)训练 SFT、仅 GRPO、以及 SFT 后再 GRPO 三个变体,合称 RedSage-K。
  4. 论文做了哪些实验?

    无提示时开源模型 Exact Correct 最高 41.3%;给文档后平均升至 73.1%。

    实验设置

    • 开源模型:14 个通用模型为 Llama3.1-Instruct 8B、Qwen3 8B 与 32B(各有 thinking 与非 thinking)、Mistral-Small-3.2 24B、Gemma-3-it 27B、GPT-OSS 20B 与 120B、LLaMA-3.3-Instruct 70B、Qwen2.5-Instruct 72B、Qwen3-Coder-Next 80B、DeepSeek-V3.2 685B、GLM-5.2 753B。7 个安全向模型为 Foundation-Sec-Instruct 8B、Foundation-Sec-Reasoning 8B、Llama-Primus-Base 与 Merged 8B、Llama-Primus-Nemotron 70B、RedSage-Ins 与 RedSage-DPO 8B。另有三个 KaliBench 上再训练的 RedSage-K 变体。摘要称共 24 个配置。
    • 数据:评测 5000 条,覆盖 1642 个工具;训练 3504 条,覆盖 962 个工具。
    • 推理:开源模型用 vLLM,在 NVIDIA A100 多卡上跑;72B 及以上经 OpenRouter API。其余来自官方 Hugging Face 仓库,固定推理配置,细节见附录 G.1。专有对照只在 Unrestricted 的全部 5000 条上评测。
    • 训练:LoRA,单张 H200(141GB),总 batch size 32,两个 epoch;细节见附录 G.2。
    • 指标:Exact Correct、Tool Accuracy、Optional-Argument F1、Positional-Argument F1、Total Score,以及三模式 Total Score 的平均 Avg。U / R / H 分别对应 Unrestricted、Restricted、Hinted。
    • 评审:分项分数由 shlex 解析后与真值组件做确定性匹配,不使用另一个 LLM 打分。论文未报告重复次数。

    主结果

    Table 1 报告开源模型在三种模式下的成绩。下表只列 Exact Correct 与平均 Total Score;U 为无工具提示。

    表格较宽,可左右滑动

    模型U ECR ECH ECAvg TS
    Foundation-Sec-Ins 8B14.719.156.265.2
    Qwen3 8B†20.927.780.973.8
    RedSage-K (SFT+GRPO) 8B32.237.469.479.2
    Qwen3-Coder-Next 80B26.231.079.976.3
    DeepSeek-V3.2 685/37B33.040.284.580.2
    GLM-5.2 753B41.352.074.881.3
    全模型平均22.328.373.173.6

    据 Table 1。EC 为 Exact Correct(%),Avg TS 为三模式 Total Score 平均(%)。† 为 thinking。表中省略了其余 18 个配置;开源 U 模式 EC 最低为 Llama3.1-Ins 8B 的 12.5%。

    • 模式:作者称从 U 到 R,平均 Tool Accuracy 从 72.0% 升到 95.2%,但 Optional F1、Positional F1 和 Exact Correct 只小幅上升,说明选对工具并不保证参数正确。H 的提升最大:平均 Optional F1 从 45.1% 到 87.8%,Positional F1 从 61.1% 到 90.1%,Total Score 从 59.4% 到 90.8%,Exact Correct 从 22.3% 到 73.1%。作者认为可选参数最难,其次是位置参数;无文档时参数构造是主要瓶颈。
    • 类型与规模:作者称安全向模型并不稳定优于强通用模型。紧凑组里,非 thinking 的 RedSage-Ins 在 U/R 的 Total Score 为 56.4% / 69.3%,高于非 thinking Qwen3 8B 的 55.5% / 68.2%;Hinted 上 Qwen3 8B 为 91.6%,高于 RedSage-Ins 的 89.5%。Qwen3† 8B 的 Avg 为 73.8%,高于 Gemma-3-it 27B 的 71.2% 和 Llama-Primus-Ins 70B 的 72.7%。作者认为成绩不只由规模决定。
    • 训练后:三个 RedSage-K 的 Avg 为 76.9(GRPO)、77.4(SFT)、79.2(SFT+GRPO)。SFT+GRPO 在开源模型 Avg 中排第三,比 DeepSeek-V3.2 的 80.2 低 1.0 个点。贡献项称三种模式上 8B 的平均 Total Score 提高 7.5 个百分点。SFT 的 Hinted Total Score 为 93.2%,高于基座 RedSage-Ins 的 89.5%;GRPO 与 SFT+GRPO 的 Hinted Total Score 为 88.8% 和 89.3%,低于基座。作者称配对分析看到参数构造错误和对已解样本的回退,SFT 初始化减轻了这种回退(附录 I)。

    专有模型与脚手架推理

    • 测了什么:GPT-5.6-Sol、Claude Opus 5,以及 GPT-5.5、xhigh reasoning 的 Codex,只在 Unrestricted 的 5000 条上评测。Codex 只对最终提交的命令打分。
    • 结果:Table 2 中,全量 5K 的 Exact Correct 为 GPT-5.6-Sol 61.68%、Codex 51.68%、Claude Opus 5 44.02%;已回答子集上分别为 61.83%(4988/5000)、55.77%(4633)、59.89%(3675)。GLM-5.2 在该设定为 41.32%。未回答或被拦截计为不正确。
    • 作者解读:作者称覆盖率差异意味着提供商的安全限制会影响安全相关用法;Claude Opus 5 只回答了测试集的 73.50%。全量最高 61.68%,作者认为 KaliBench 仍未饱和。完整指标见附录 M。

    维度、工具与失败模式

    • Figure 5:作者称 23 个维度上相对难度在三种模式间大体一致;gpu 与 crypto-stego 分数较高,802-11 与 wireless 的最小值较低,尤其在 U 和 R。H 模式下 hardware 仍然偏低。作者称 U 的模型间离散最大,R 收窄,H 进一步收稳,但没有消除维度差距。阶段上,Reconnaissance 与 Vulnerability Analysis 较稳,Post-Exploitation 与 Defensive Analysis 变化更大。Figure 5 的箱线具体端点论文正文未逐项列出。
    • 离散:Total Score 的跨模型极差从 U 到 H 为 21.8、18.4、13.7 个百分点;Exact Correct 极差仍为 28.8、33.8、28.3 个百分点。作者认为文档让 Total Score 更接近,精确命令正确性的差距仍然大。
    • 失败与工具:作者归纳四类:长短选项混用、把位置参数当成 flag 或推断不存在的别名、只有短 flag 的工具被写成不存在的长选项、单复数选项名错误。作者称 truecrypt2john、jsql 这类调用简单、默认明确的工具更稳,nikto、hashrat 这类选项不规则的工具仍然难。附录 K 给出完整统计;作者认为工具难度更多来自接口复杂度,而不是某个模型的特有限制。

    其他消融与分析

    • 查询措辞(Table 3,八个配置的平均 Total Score 变化,百分点):Paraphrase 为 U +0.61、R +0.22、H −0.09;Informal 为 −0.55、−0.48、−0.28;Messy 为 −3.20、−1.40、−1.07。
    • Messy、Unrestricted(Figure 8 / 附录 N):每个被测配置的 Total Score 都下降;多数约 3 个百分点,最敏感的两个超过 4 个百分点,最小降幅 1.98 个百分点(Foundation-Sec-Rsn 8B)。作者认为这种下降不限于单一模型族。
    • 数据漏斗(Figure 2):生成 27.7K、覆盖 2372 个工具;LLM 校验后 14.5K、90.1%(2138)工具;可执行阶段图中标为 12.8K、74.0%(1756)工具;去重后 8.5K、69.2%(1642)工具。人工初检称超过 50% 的生成命令含幻觉或拼错选项。
    • SFT 与 GRPO 的互补:SFT 在三个模式的紧凑组 Tool Accuracy 最好,Hinted 提升最大;GRPO 在 U/R 的 Positional F1 和 Total Score 更强,Hinted 较弱。SFT+GRPO 的 U/R Total Score 与 Exact Correct 在紧凑组最好。
    • Figure 1 标注:图中 Exact Command Correct 一列标有 Gemma-3-it 27B 71.2、RedSage-Ins 8B 71.7、GPT-OSS 120B 75.7、Qwen3-Coder-Next 76.3、RedSage-K-SFT-GRPO-8B 79.2、DeepSeek-V3.2 685B 80.2、GLM-5.2 753B 81.3;这些数字与 Table 1 的 Avg Total Score 相同,图题写的是 Exact Command Correct。Unrestricted 侧另标 Qwen3-Coder-Next 26.2、RedSage-K 8B 32.2、DeepSeek-V3.2 33.0、GLM-5.2 41.3,与 Table 1 的 U 模式 Exact Correct 一致。
  5. 有什么可以进一步探索的点?

    作者认为应扩展到多步工作流、检索增强用工具和环境感知评测。

    作者指出的局限与后续方向

    • 单轮与文档落地数据:Discussion 写明局限包括只做单轮命令生成,以及依赖 documentation-grounded 数据。后续应扩展到多步工作流、检索增强的工具使用,以及环境感知评测。
    • 手册会过时:附录 O 称真值命令来自构建时的 Kali 手册;flag 的增删、弃用、改名或语义重释会使部分规范化命令过时。作者称工具常保持向后兼容,Hinted 设定因显式提供文档而进一步隔开这种漂移。
    • 文档自身不一致:附录 O 举例 regtree 手册对 -V 给出冲突语义(--no-values 与 --version),Impacket 若干工具的短选项写法也与常见约定不同。作者称完全确定性的规范化在文档与观察行为分歧、或多种变体并存时本质上是近似的。
    • 校验仍不完美:附录 O 称 LLM-as-Verifier 仍不完美;对随机子集的人工核查表明残留错误有限。论文未给出该子集的残留比例。
    • 别名覆盖不全:附录 O 称别名感知打分依赖半自动抽取的别名组,不能覆盖全部历史、发行版特定或社区采用的变体。
    • 定位:附录 O 把 KaliBench 写成对真实 CLI 调用的受控抽象,用来补充操作环境中基于执行或智能体的评测。

    实验覆盖范围

    • 规模与划分:评测集 5000 条,覆盖全部 1642 个工具;训练集 3504 条,覆盖 962 个工具;三种提示拼接后训练样本为 10512(Section 3)。
    • 开源评测:Table 1 列出通用、安全向和 RedSage-K 共 24 行配置,三种模式都报告 Exact Correct、Tool Accuracy、Optional F1、Positional F1 和 Total Score。72B 及以上走 OpenRouter,其余用 vLLM;论文未报告重复次数。
    • 专有与脚手架:GPT-5.6-Sol、Claude Opus 5、Codex(GPT-5.5,xhigh)只在 Unrestricted 的 5000 条上评测;全量 Exact Correct 把未回答计为不正确(Table 2)。
    • 训练:骨干为 RedSage-Ins 8B,变体为 SFT、GRPO、SFT+GRPO;LoRA,单张 H200,batch size 32,两个 epoch(Section 4、附录 G.2)。
    • 稳健性:八个配置在 Paraphrase、Informal、Messy 三种改写上报告 Total Score 变化(Table 3);附录 N 给出 Unrestricted 下 Messy 的逐配置降幅。维度分析按 23 个能力维度和 5 个安全阶段聚合(Figure 5)。
  6. 总结一下论文的主要内容

    KaliBench 用 8504 条可执行命令对衡量 schema-free 的 Kali CLI 生成,并拿分项分数做免运行训练。

    KaliBench 是面向 Kali Linux 的自然语言到 CLI 基准:8504 条经校验的查询–命令对、1642 个工具、23 个能力维度、5 个安全阶段,评测集 5000 条、训练集 3504 条。

    • 问题:知识问答和端到端 CTF 都不单独回答“模型能否写出可执行命令”。CLI 没有可塞进提示词的完整 schema,工具选择、flag–值绑定和参数顺序都必须由模型自己推断。
    • 做法:用官方手册约束 Qwen3-Max 生成,再经 LLM 校验、Kali Docker 沙箱执行和人工在环清洗;SemHash 以余弦相似度 0.90 去重。评测分三档:只给查询、给 20 个候选工具名、再给这些工具的文档。shlex 解析后按工具、可选参数 F1、位置参数 F1、Total Score 和 Exact Correct 打分。同一套分项信号作为 SFT 与 GRPO 的奖励,不执行模型输出。
    • 开源结果:Table 1 中,无提示时 Exact Correct 平均 22.3%,最高为 GLM-5.2 的 41.3%;给文档后平均升至 73.1%,DeepSeek-V3.2 为 84.5%。从无提示到只限制候选工具,平均 Tool Accuracy 从 72.0% 升到 95.2%,参数分数上升幅度小。作者认为可选参数是主要瓶颈。
    • 训练与专有对照:RedSage-Ins 8B 经 SFT+GRPO 后,三模式平均 Total Score 为 79.2%,U 模式 Exact Correct 为 32.2%;DeepSeek-V3.2 的平均 Total Score 为 80.2%。贡献项称该 8B 的平均 Total Score 提高 7.5 个百分点。GRPO 与 SFT+GRPO 的 Hinted Total Score 低于未再训练的 RedSage-Ins。全量 5000 条上,GPT-5.6-Sol 的 Exact Correct 为 61.68%,Codex 51.68%,Claude Opus 5 44.02%,后者只回答 73.50%。
    • 作者结论:限制候选工具主要解决“用哪个工具”,文档主要改善“命令怎么写”;失败常常来自领域知识不足,而不是没理解意图。作者认为 KaliBench 仍未饱和,并计划后续走向多步工作流、检索增强用工具和环境感知评测。附录 O 同时说明手册会过时、文档偶有冲突、校验与别名表都不完备。
阅读原文huggingface.co