CyberMaskQA:面向网络安全问答的大语言模型隐私感知基准
CyberMaskQA: A Privacy-Aware Benchmark for Evaluating Large Language Models in Cybersecurity Question Answering
作者提出CyberMaskQA;250题上Llama的MCQA平均准确率78.0%,作者称掩码与问答反向。
- 网安问答要在含IP、主机名和账号等标识的组织上下文中做事件响应与漏洞分析,云端处理在受监管环境中往往不可行。现有基准多测事实知识,作者称缺少能同时评测运行推理与隐私保留的标注数据。
- 作者用四阶段流水线构建CyberMaskQA:收集标准与匿名规程并写基础场景,由Claude Sonnet 4.5扩展上下文,经Gemini 3 Flash与人工校验后掩码敏感实体,再从250题扩到2000题。
- CyberMaskQA-250上,Llama-3.1-8B的MCQA平均准确率78.0%,Ministral-3-8B为40.8%。后者掩码召回92.5%、精确率61.7%。作者称二者反向,Figure 9标注R=-0.52。
- 论文未设局限专节。Conclusion称需能同时优化效用与保密的架构。评测为250题、四款开源模型、one-shot的准确率与掩码精确率/召回率;未报告重复次数、温度和2000题分数。
- 被测模型
- Llama-3.1-8B-InstructInternLM3-8B-InstructMistral-3-8B-InstructQwen2.5-7B-Instruct
- 基准
- CyberMaskQA-250CyberMaskQA-2000
- 指标
- accuracyprecisionrecall
研究者提出 CyberMaskQA,一个隐私感知的网络安全问答基准,用于同时评估大语言模型的运营推理与隐私保护能力。该基准通过人工构建的基础场景结合 LLM 驱动的语义扩展生成,在资产与权限间建立明确因果依赖,并为每个实例标注精确的私有实体标签以支持受控信息披露。对问答准确率与掩码性能的评估显示,该基准可用于开发可部署的情境感知网络安全模型并研究隐私-效用权衡;数据集与生成框架将在论文被接收后发布。
深度解读
这篇论文试图解决什么问题?
作者称现有网安QA基准缺少组织上下文与隐私标注,因而提出CyberMaskQA。
如何在含敏感标识的组织上下文中评测网络安全问答,并同时衡量隐私保留。
- 场景:作者称事件严重性判断、告警优先级等任务依赖资产角色、网络分段和用户权限;日志与配置含 IP、主机名、用户账号等标识,在受监管环境中用云端模型处理往往不安全或不可行。Table I 将所需上下文写成资产角色、关键性和系统依赖等。
- 现有不足:作者称多数基准来自教材、标准和公开文档,主要测事实知识,而不是运行时推理。PRIV-QA 与 CON-QA 虽有隐私机制,但数据彼此分离或范围较窄,不能充分覆盖必须同时做上下文推理与隐私保留的场景。
- 作者的观察:作者称只在公开数据上训练的模型容易拟合与上下文无关的启发式,难以泛化到依赖机构上下文的部署。
- 提出的基准:作者提出 CyberMaskQA 流水线:人工基础场景加 LLM 语义扩展,并为每条样本标注私有实体,以便受控披露。初始集为 CyberMaskQA-250,再扩成 CyberMaskQA-2000。作者计划在论文被接收后发布数据集和生成框架。
有哪些相关研究?
相关基准或测事实知识,或缺标注掩码;作者用Table II定位联合评测缺口。
引言与 Related Work 把相关工作分成网安问答数据和带隐私机制的框架;Table II 另列若干数据集的规模。
网安问答数据集
- CyberMetric(Tihanyi 等,2024):用 GPT-3.5 与 RAG,从 NIST 标准和教材生成选择题,规模从 80 到 10K。作者称它主要评测事实知识,不含机构上下文或隐私敏感信息。
- CyberBench(Liu、Shi 与 Buford,2024):十个数据集、四类任务,包括命名实体识别、摘要、选择题问答和文本分类。作者称任务被拆开,不能做一体评测,也不支持上下文推理或隐私评测。
- AttackQA(Krishna,2024):正文称约 25K 条带理由的问答,约 80% 用 Llama3-8B 基于 MITRE ATT&CK 合成,并由更大的 LLM 做质量控制。作者称它没有敏感信息的掩码标注。Table II 最右列记为 25355。
隐私相关数据与框架
- SensitiveQA / PRIV-QA(Li 等,2025):正文称有 50k 条中文和 7k 条英文、含 PII 的开放式对话,PII 未标注且闭源。Table II 最右列记为 7214,与正文规模不一致;规模以表中 7214 为准。作者称它不是选择题,评测流程更复杂。
- CON-QA(Singh 等,2025):引言称其在合同领域用云端 LLM 做隐私保护问答。作者把 PRIV-QA 与 CON-QA 并称,认为这些方法依赖彼此分离或范围较窄的数据。
- Table II 中的其余数据集:SecQA(Liu,2023)、CyberLLaMa(Zhang 等,2025)、pii-masking-300k(Ai4Privacy,2024)。最右列规模分别为 242、42404、300000。正文未逐篇展开批评。掩码指标作者称遵循先前工作 [12]、[15]。
基线与对照
- 基线方法:评测没有引入其他问答系统或检测器,直接报告四款开源模型在 CyberMaskQA-250 上的结果。
- 对照数据集:Table II 将 CyberMaskQA 与上述数据集并列。转写后部分列可能错位,这里只采用正文已写明的对比,以及各行最右的规模数字。CyberMaskQA 一行的人工核对与总规模,正文分别对应 250 与 2000。
作者称,先前数据集都没有在同一框架里同时具备网安问答、运行上下文和显式隐私标注;CyberMaskQA 用依赖机构上下文的选择题,并提供 PII 与运行信息的标注及掩码版本。
论文如何解决这个问题?
四阶段流水线:基础题、上下文扩展、实体掩码,再扩到2000题。
CyberMaskQA 用四阶段流水线,把人工基础场景扩成带组织上下文、标准答案和敏感实体标注的选择题,再生成掩码版本。Figure 1 给出总览。
文档、模式与基础场景
- 文档:基础题对齐 NIST 特别出版物(文中举例 SP 800-53)、CIS Critical Security Controls、OWASP(文中举例 OWASP Top 10)、ISO/IEC、GDPR(文中举例 Article 33)、HIPAA,以及一所大学 IT 环境中匿名化的操作规程。
- 模式:每条含 Context(如 CSV 日志)、Question、Answer Options(A–D)、Correct Answer、Entities、Masked Fields。Figure 2 为模式示例。
- 基础规模:作者构建 30 个基础场景。正确答案被设计为直接依赖所给上下文。
四个领域
- Identity & Access Management:权限生命周期、基于角色的访问控制和最小权限。CyberMaskQA-250 有 76 条、840 个标注私有实体。
- Threat Detection & Incident Analysis:从技术日志识别可疑模式,文中举例 SQL injection 与 XSS。48 条、418 个实体。
- Incident Response & Escalation:对照 HIPAA、GDPR 等判断严重性和后续合规步骤。47 条、282 个实体。
- Security Posture & Prevention:网络架构、移动设备管理和安全培训优先级。79 条、601 个实体。作者称各类条数不同,是因为各领域现实场景有差异。
上下文扩展与校验
- 生成:Claude Sonnet 4.5 在保持基础逻辑依赖的前提下生成多种企业上下文。Figure 4 展示同一基础问题上的不同变体。
- 扰动检验:作者故意改错问题和答案,共 10 条。GPT-5.2 Instant 漏掉 3 条,Gemini 3 Flash 将全部扰动标为不正确。随后用 Gemini 3 Flash 审完全部生成条目并标记可疑项。
- 人工校验:人工复核标记项并检查全部生成题,从 260 条中删除 10 条。三方面是:政策是否与 Stage 1 标准一致且只有一个逻辑上成立的答案;场景是否过于相似;IP、用户名等是否符合场景。Figure 5 的修正是地点与 IP 不一致时替换 IP。
掩码
- 标签:Table III 为 USER ACCOUNT、IP ADDRESS、URL、FILE PATH、HOSTNAME、SOFTWARE、OS、HARDWARE、GROUP、IDENTIFIER、LOCATION、DATE。用户可指定掩哪些类型,并选用全掩码、不掩码或混合版本。
- 替换:Claude 4.5 Sonnet 接收 3 个人工掩码示例,按模式替换 Context、Question 和选项中的敏感实体,并保留原值到标签的对照表。正文未列出提示词全文。
- 校验:人工先标出掩码正确性和逻辑问题,再用 Gemini 3 Flash 查漏,然后人工复核标记项。250 条中 115 条掩码失败并经人工修正。作者将一类错误称为 Foundational Carry Over:基础题漏掉的敏感值会传到派生变体;修正基础题可避免相关变体重复失败。
扩到 2000 题
- 规模:基础问题库扩到 60 条;每条扩成 30–40 个上下文,多于 250 题阶段使用的 10 个上下文。
- RAG:模型读入 OWASP、NIST 等标准、指南和攻击报告,按每批 10 条生成基础问题,直到新写出 70 条。提示按先前人工反馈调整,文中点名的问题包括 IP 与地点对齐、避免重复题和占位值。
- 掩码复用:扩展集沿用同一掩码流程,并按反馈调整提示。文中点名的问题包括 [GROUP] 与职业角色的对应、成员指称,以及 [LOCATION] 的处理。
论文做了哪些实验?
四款开源指令模型在CyberMaskQA-250上做one-shot问答与掩码;作者称准确率与隐私保留反向。
实验设置
- 被测模型:Llama-3.1-8B-Instruct、InternLM3-8B-Instruct、Mistral-3-8B-Instruct、Qwen2.5-7B-Instruct。Section IV.A 用这些名称;Figure 6–9 将第三款标为 Ministral-3-8B。下文结果沿用图中名称。作者称这些开源模型可在资源受限的边缘环境本地推理,以避免把敏感数据送到外部云服务。
- 数据:评测集为 CyberMaskQA-250,250 道选择题。四类规模见 Section III.A。Section IV 未报告 CyberMaskQA-2000 上的模型结果。
- 协议:MCQA 与掩码都是 one-shot,先给一对示例再给新题。MCQA 要求只输出 A、B、C 或 D。掩码要求输出 JSON,把 Context、Question 和选项中的敏感实体换成如 [IP_ADDRESS] 的占位符,作者称与先前数据集 [16] 一致。
- 指标:MCQA 为 accuracy。precision 是正确掩码数除以模型掩掉的全部实体,recall 是正确掩码数除以全部真值实体。论文未写 LLM 裁判,也未报告温度、重复次数,以及 MCQA 输入是原始上下文还是掩码上下文。
- 对照:没有其他问答方法基线,四款模型互为参照。
主结果
Section IV.B 写明的 MCQA 准确率如下。Figure 6 还有未在正文绑定到模型与类别的数字,表中不填。
模型 平均准确率 Threat Detection & Incident Analysis Llama-3.1-8B 78.0% 95.8% InternLM3-8B 76.4% 89.6% Qwen2.5-7B 75.2% 89.6% Ministral-3-8B 40.8% 未报告 - 作者称 Llama-3.1-8B 平均准确率 78.0%,其后是 InternLM3-8B 76.4% 与 Qwen2.5-7B 75.2%;Ministral-3-8B 为 40.8%。作者认为这可能与其训练偏向长文本生成、而非受约束的单 token 分类有关:它常在字母前写出冗长理由,即使推理正确也会导致抽取失败。
- 作者称多数模型在 Threat Detection & Incident Analysis 上最高,并认为可能是因为上下文证据更清楚、所需推断更少。该类上正文给出 Llama 95.8%、InternLM 89.6%、Qwen 89.6%。
- 作者称 Identity & Access Management 最难,因为答案要跨文档整合用户组、权限映射和资源要求。正文未给出该类准确率。
掩码与问答的关系
- 总体:作者称 Ministral-3-8B 平均 recall 最高,为 92.5%,precision 为 61.7%,并归因于过度掩码。作者称其在提示下更强调少泄漏隐私,而不是减少对非敏感信息的掩码。
- 类别:作者称 Threat Detection & Incident Analysis 的掩码较好,因为常依赖单一、不含糊的信号;Identity & Access Management 的用户名、工牌号、IP 格式固定,掩码更一致;Security Posture & Prevention 更难,因为政策文本把组织用语和普通名词混在一起。Figure 7 的其余数字在转写中对不上模型,不列。
- 反向关系:作者称 MCQA 准确率最高的 Llama-3.1-8B 掩码最弱,MCQA 最低的 Ministral-3-8B 掩码更强。Figure 9 标注 QA 准确率与掩码 recall 的趋势 R = -0.52。作者认为问答受益于精确推理,掩码偏向保守生成。作者还称 Ministral-3-8B 与 Qwen2.5-7B 偏向高 recall、较低 precision,Llama-3.1-8B 偏向 precision、牺牲 recall;工作点取决于隐私泄漏和输出不可用哪一种代价更高。
实体级掩码
- 格式:作者称对四个 LLM 平均后,格式稳定的 IP_ADDRESS、FILE_PATH 更高,格式多变的 IDENTIFIER、GROUP 更低(Figure 8)。转写后的柱无法逐个对应数字,不逐条抄录。
- IDENTIFIER:作者称其没有统一格式,模型 recall 为 79–95%,会把非敏感数字串也掩掉,因而 precision 低。作者认为这类掩码可能需要基于规则的后处理,而不能只靠 LLM 判断。
- 例与高召回类:作者举 Q93,称 Llama 正确掩了用户账号,却把动作标签也掩掉,同时未掩 IP 与时间戳。作者称 FILE_PATH 与 DATE 的 recall 高于 95%。
其他消融与分析
- 论文未报告提示词、掩码标签子集、示例数量或模型规模的消融。
- 扰动校验:10 条中 GPT-5.2 Instant 漏 3 条,Gemini 3 Flash 全部标出(Section III.B)。
- 掩码人工修正:250 条中 115 条失败(Section III.C);作者用 Foundational Carry Over 描述漏标从基础题传到变体。
- 生成题删减:260 条中去掉 10 条(Section III.B)。
有什么可以进一步探索的点?
论文未设局限专节;Conclusion称需要同时优化效用与保密性的架构。
作者指出的局限与后续方向
- 论文没有 Limitations 或 Future Work 专节。Discussion 解释问答与掩码的差异,没有把某项设计写成工作局限。
- Conclusion 称两类目标依赖不同能力,并称需要能同时优化操作效用与数据保密性的架构方法。
实验覆盖范围
- 模型分数来自 CyberMaskQA-250 上的四款开源指令模型:Llama-3.1-8B-Instruct、InternLM3-8B-Instruct、Mistral-3-8B-Instruct、Qwen2.5-7B-Instruct(Section IV.A)。
- 报告的指标是 MCQA accuracy,以及掩码 precision 与 recall;两类任务都是 one-shot(Section IV.A)。
- 250 题覆盖四个领域,各类条目数和私有实体数写在 Section III.A;掩码标签为 Table III 的 12 类。
- 构建阶段用 Claude Sonnet 4.5 生成上下文并掩码,用 Gemini 3 Flash 做条目与掩码校验,并用 10 条扰动比较 GPT-5.2 Instant 与 Gemini 3 Flash(Section III.B–C)。
- 论文未报告评测重复次数、采样温度、LLM 裁判或人工一致性,也未说明 MCQA 输入是原始还是掩码上下文。Section IV 未报告 CyberMaskQA-2000 上的模型分数。
总结一下论文的主要内容
CyberMaskQA联合评测带上下文的网安问答与掩码;作者称四模型上准确率与隐私反向。
作者构建隐私感知网安问答基准 CyberMaskQA,用来同时看依赖组织上下文的选择题推理,以及敏感实体掩码。
- 问题:事件分级、告警优先级等决策依赖机构特有的资产、权限和拓扑,而这些材料含 IP、账号等标识。作者称公开事实型基准测不到这种推理,云端处理敏感运行数据又往往不可行。
- 做法:流水线把标准与匿名化规程落成 30 个基础场景,用 Claude Sonnet 4.5 扩展上下文,经 Gemini 3 Flash 与人工校验得到 250 题,再按 12 类标签掩码,并扩到 2000 题。每题是四选一,带实体标注和掩码字段。
- 问答:在 CyberMaskQA-250 的 one-shot 设置下,Llama-3.1-8B 的 MCQA 平均准确率 78.0%,InternLM3-8B 为 76.4%,Qwen2.5-7B 为 75.2%,Ministral-3-8B 为 40.8%。威胁检测类上,正文给出 Llama、InternLM、Qwen 分别为 95.8%、89.6%、89.6%。
- 掩码:Ministral-3-8B 的平均 recall 为 92.5%、precision 为 61.7%。作者称准确率更高的模型掩码更弱,反之亦然;Figure 9 的趋势为 R = -0.52。作者还称 FILE_PATH 与 DATE 的 recall 高于 95%,IDENTIFIER 的 recall 为 79–95% 但 precision 低。
- 作者结论:作者称边缘模型上推理表现与隐私保留存在一致权衡,两类目标依赖不同能力,因此需要能同时优化操作效用与数据保密性的架构。作者计划在论文被接收后发布数据集与生成框架。