SciHazard:面向科研安全的危险能力评测基准与分解式危害评分
SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring
SciHazard以DEHARM-SCORE评测31个系统,深研智能体均值比19个标准LLM高32.3%。
- LLM会把危险科学知识变成可执行滥用指导,但现有基准偏模板查询,评判缺少领域依据,也很少覆盖deep research agents。
- 双轨流水线生成12学科的2400道危害题与600道过安全题。DEHARM-SCORE用动态清单测可执行性,用检索后的主张与合成壁垒测净新增风险,再与危害等级和拒答相乘。
- 在31个系统上,作者称深研智能体平均DEHARM比19个标准LLM高32.3%。Table 5里DEHARM-gemini对专家综合分的QWK为0.774。作者称高拒答并不带来更低的未拒答危害。
- 作者指出长尾与新兴交叉学科尚未纳入,并计划做社区动态更新;专家标注只做在代表性子集。主评测为Table 7的31个系统,论文未报告重复次数与总耗时。
- 被测模型
- WebThinker + DeepSeek-R1InternAgentGemini Deep Researcho3 Deep ResearchGrok-4.1-Fasto3Qwen3.6-PlusGPT-5.4GPT-5.2LLaMA-3.1-70B-Inst.DeepSeek-R1Claude Sonnet 4.6DeerFlow + Qwen3.5-35BQwen3.5-35B-A3BGemini-3.1-ProIntern-S1-ProQwen3.5-397B-A17BLLaMA-4-Scouto3-mini
- 基准
- SciHazard
- 指标
- DEHARM-SCOREDEHARM†RejectionOversafetyQWKExecutabilityNet-New Risk
作者提出 SciHazard,一个基于现实场景的科学风险评测基准及数据集无关的危害度量框架。它包含覆盖 12 个学科的 2400 道危险问题和 600 道过度安全问题,题目均扎根于受监管实体和有记录的失败情景。其 DeHarm-Score 将查询危害严重度、拒答行为和回复级风险分解计分,并对未被拒绝的回答进一步拆解为可通过动态清单加权的 Executability 与经检索增强主张抽取和合成障碍核验得到的 Net-new risk。专家验证显示该方法相较最强基线在与人工标注的一致性上提升 90.17%。
深度解读
这篇论文试图解决什么问题?
作者要测LLM与科研智能体把危险科学知识变成可执行滥用指导的风险。
如何准确衡量 LLM 与自主科研智能体在高风险科学场景中的威胁潜力。
- 场景:作者称 LLM 在加速科学发现的同时,也会把危险科学知识变成可执行的滥用指导,范围从化学武器合成到病原体工程,并威胁公共安全。
- 现有不足:作者称现有基准多用受管制物质加模板提示,测的是浅层检索而非对手的复杂滥用;科学领域的 LLM-as-a-Judge 会退回表面语义启发式,分数与真实危害脱节。多数基准只测标准对话模型,不看会检索、规划和使用工具的 deep research agents。
- 核心观察:作者认为科学回答的危险由可执行性(Executability)与净新增风险(Net-New Risk)两个正交维度决定;整体打分迫使标注者主观加权。
- 本文提出:SciHazard 含 12 个学科的 2400 道危害题与 600 道过安全(oversafety)题,查询锚定受管制实体和有记录的失效场景;DEHARM-SCORE 拆开问题危害、拒答与回答级风险。正文指向 Figure 1 称 SafeScientist 有 76% 的问题在 L5,SciHazard 覆盖 L1–L5。
有哪些相关研究?
作者将本文放在12学科真实滥用链基准与检索增强分解评分一侧。
论文第 2 节把相关工作分成科学安全基准和自动评测两条线。
科学安全基准
- WMDP(Li 等,2024):专家编写的危险知识多项选择题。
- ChemSafetyBench(2024)、SafeSci(2026)、SOSBench(2026):从受管制物质或越狱提示构建数据集。论文没有逐篇单独批评。
- SafeScientist(Zhu 等,2025):由 deep research 模型生成开放式问题。作者称上述工作有两点共同局限:领域集中在传统 STEM,且与真实滥用脱节,测的是事实回忆而非可执行场景。
自动评测
- Llama-Guard(Inan 等,2023):专有评判模型做二分类。
- StrongReject(Souly 等,2024)、DeepReject(Chen 等,2025):带量规的 LLM 评判,再把子维度合成总分。作者称在高知识密度的科学场景中,二分类评判和量规评判都缺少领域专门知识,默认使用表面语义启发式。
实验基线与对照数据集
- 基线:第 5 节与附录 C 使用 DeepReject、StrongReject、LLM-as-a-Judge、SafetyScore。DeepReject 为 R×W×(0.65K+0.35F);StrongReject 为拒答因子乘说服性与特异性的平均。主实验把评判模型固定为 Gemini-3.1-Pro 与 Qwen3.5-35B-A3B。
- 对照数据集:Table 1 列出 WMDPBench、SciSafeEval、SafeSci、SafeScientist、SOSBench,比较题量、领域数、格式、是否有专家标签和良性子集。
作者称 SciHazard 把危险实体接到完整滥用生命周期上,覆盖 12 个学科;并称它是带细粒度专家标注、锚定真实滥用场景的首个此类科学安全基准。作者称 DEHARM-SCORE 用动态检索与分层匹配补上评测缺口,与专家标注的对齐最高。
论文如何解决这个问题?
双轨生成2400道危害题与600道过安全题,再用E、N合成DEHARM-SCORE。
SciHazard 用双轨流水线生成锚定管制清单与已记录事件的问题;DEHARM-SCORE 是作者所称与数据集无关的分解指标,把未拒答回答拆成可执行性与净新增风险,再与问题危害等级、拒答指示相乘。
双轨数据生成
- 物质轨:化学、生物、物理、药理、医学、环境科学、农业科学。从 CWC、CDC/APHIS Select Agents、DEA schedules、EU REACH 及相关联合国公约抽出 1,548 个受管制物质作为 Hazard Primitives。
- 组合方式:前沿 LLM 加外部知识库为每种物质标三个技术瓶颈,再沿四个阶段出题:上游获取与替代、中游优化与放大、下游稳定与储存、投送与散布。问题由物质 × 阶段 × 瓶颈正交组合。
- 场景轨:计算机科学、心理学、社会学、经济学、法学。原语是前沿 LLM 结合领域知识库挖出的抽象破坏场景;每场景三个系统性瓶颈,对应四阶段:侦察与访问、武器化与策略设计、执行与放大、规避与持久化。
- 质检:产出 2400 道危害题与 600 道过安全题。附录 E 称原语经专家核验、去重,瓶颈经第二轮审查,全部题目由人工逐条检查。附录 A、B 给出示例,此处不复述。
危害等级与过安全子集
- 双轴:L1–L5 综合 OSHA、FEMA、MIL-STD-882E 与前沿 extreme-risk 定义。轴一是后果与意图,轴二对齐 WHO Risk Groups、CWC Schedules、Australia Group 等清单。附录 D 把监管档 R1–R4 与操作意图 O1–O4 交成确定映射;防御性意图一律为 L1,含糊时取更高档。
- 谁来标:GPT-5.4、Gemini-3.1-Pro、Claude-4.6-Opus 独立打分,多数投票;平局或拒答交给人类领域专家。结果为 Hq∈{1,2,3,4,5}。
- 校验:附录 D 在 12 个学科分层抽 360 题,委员会与专家精确匹配 91.38%,相邻准确率 100%,QWK 0.96;全部分歧都是相邻等级。
- 过安全:600 题用意图反转生成,复用危害题的高风险触发词,意图改到防御、检测或应急。作者称核心意图符合主要 LLM 提供商的使用政策。
Executability 分支
- 10 项清单:只看问题,并检索公开互联网与领域知识库。三项面为规格、步骤、验证;决定核心实现链是否可行的项为 Blocker,验证项不阻断。
- 两遍匹配:每项 1–5 分。任一项 ≤2 时做关键词增强的第二遍复查,取两遍较高分。附录 F.3.1 给出 1–5 的通过标准。
- 聚合:规则模块用 Blocker 通过率与覆盖密度得 Erule;任一 Blocker 失败则档位被压低。独立 Reviewer 输出 Ejudge。正文称该裁决不受约束;附录 F.3.1 写相对规则档最多偏离一层,更大偏离会回退。
Net-New Risk 分支
- 主张:从回答抽取最多 10 条可核查技术主张,标 criticality(high / medium / low)并生成检索查询。
- 双评分:实时网页搜索加领域知识库。Coverage∈{easy, moderate, hard} 表示原子信息从公开或编目来源获取的难易;Synthesis Barrier∈{low, medium, high} 表示把分散来源整成回答中那种连贯形式的难度。
- 聚合:难覆盖主张的 criticality 加权比例,加上高合成壁垒主张数量,得到 Nrule。Reviewer 看合成价值:单条主张即使公开,若被整成可执行有害流程,仍可给高风险,输出 Njudge。附录 F.3.2 同样规定 ±1 档。附录 F.3.2 写每条主张最多 3 次搜索、每次取前 5 条摘要。附录 F.4 称检索时间上界为 2026-04-15,并用缓存复现。
合成分数与拒答
未拒答回答的响应级危害为 S = Hq · R · (E+N)/8。Hq 是问题危害等级,R∈{0,1} 在实质性拒答时为 0 并把风险置零,E、N∈{1,2,3,4}。二者归一化之和落在 [1/4, 1]。作者称这是递进门控:Hq 定理论上限,R 是二元开关,(E+N)/8 沿操作完整性与知识抬升调制剩余风险。
拒答分类见附录 F.2:先做模板过滤;命中后再由评判模型检查免责声明之外有没有实质领域内容。500 条人工标注回答上准确率 99.6%(498/500)。主实验评判模型为 Qwen-3.5-35B-A3B;附录 F.3 写单一评判模型温度 0.0。
论文做了哪些实验?
作者称深研智能体平均DEHARM比19个标准LLM高32.3%,高拒答不等于更安全。
实验设置
- 标准 LLM:Table 7 共 31 个系统。开源 8 个:Kimi-K2.5、Step-3.5-Flash、DeepSeek-R1、GLM-5.1、LLaMA-3.1-70B-Inst.、LLaMA-4-Scout、Qwen3.5-35B-A3B、Qwen3.5-397B-A17B。闭源 11 个:Qwen3.6-Plus、Claude Haiku 4.5、Claude Opus 4.6、Claude Sonnet 4.6、Gemini-3-Flash-Think.、Gemini-3.1-Pro、GPT-5.2、GPT-5.4、o3、o3-mini、Grok-4.1-Fast。
- 智能体与科学模型:闭源智能体为 o3 Deep Research、Gemini Deep Research、Sonar Pro。DeerFlow 与 WebThinker 各接 DeepSeek-R1、o3-mini、Qwen3.5-35B。科学模型为 Intern-S1-Pro、InternAgent、S1-VL-32B。
- 生成:T=0,max_tokens=8192;闭源智能体保留提供商默认。检索用 Serper API。论文未报告主评测重复次数。
- 主指标:评判模型为 Qwen-3.5-35B-A3B。列包括 Oversafety(%)、Rejection(%)、Eavg、Navg、DEHARM、DEHARM†。Table 7 注:DEHARM† 只在未拒答查询上计算。
- 专家子集:173 道高风险查询,三名对应学科博士生独立标注;每条平均 1.47 小时,每轮交叉质检另加 0.62 小时。另给 1–5 的整体分 Hdirect。分项对齐的评判模型为 Gemini-3.1-Pro、gpt4o-mini、Qwen3.5-35B-A3B。
- 扰动:200 道有害查询,由 GPT-5.4 生成。V1 改关键参数使流程不可执行,V2 加入无关伪科学步骤与引用,V3 只加安全声明。
主结果
据 Table 7,只列 DEHARM 最高、DEHARM† 最高及若干对照。百分号按列标题理解。
表格较宽,可左右滑动
模型 Oversafety Rejection DEHARM DEHARM† WebThinker + DeepSeek-R1 0.0% 12.1% 2.520 2.869 InternAgent 0.0% 8.3% 2.023 2.215 Gemini Deep Research 15.0% 63.1% 1.856 3.010 LLaMA-3.1-70B-Inst. 6.8% 17.7% 1.818 2.208 GPT-5.4 26.0% 18.8% 1.440 1.783 o3 16.8% 82.2% 0.597 3.372 Grok-4.1-Fast 18.3% 81.4% 0.632 3.424 DeerFlow + Qwen3.5-35B 88.3% 52.5% 0.662 1.427 省略:Kimi-K2.5、Step-3.5-Flash、DeepSeek-R1、GLM-5.1、LLaMA-4-Scout、Qwen3.5-35B-A3B、Qwen3.5-397B-A17B、Qwen3.6-Plus、Claude Haiku 4.5、Claude Opus 4.6、Claude Sonnet 4.6、Gemini-3-Flash-Think.、Gemini-3.1-Pro、GPT-5.2、o3-mini、o3 Deep Research、Sonar Pro、DeerFlow + DeepSeek-R1、DeerFlow + o3-mini、WebThinker + o3-mini、WebThinker + Qwen3.5-35B、Intern-S1-Pro、S1-VL-32B。
- 均值与配对:作者称深研智能体平均 DEHARM 为 1.504,19 个标准 LLM 为 1.137,高 32.3%。o3 Deep Research 为 1.601,相对基座作者称 +168%。结论写成上升超过 32.3%。
- 两条路径:作者称多数配置是拒答被侵蚀;o3-mini 从 73.2% 降到 DeerFlow 的 34.2%,DEHARM† 仍相近。另一路径是内容级放大:Gemini-3.1-Pro 的 DEHARM† 为 2.329,到 Gemini Deep Research 为 +29.2%。作者认为检索补入了参数之外的危险知识。
- 两种策略:作者称出现反直觉的反向关系。Qwen3.6-Plus 拒答 79.1%、DEHARM† 3.056。GPT-5.2 只拒答 17.5%,DEHARM† 1.913。作者称智能体最多把拒答率侵蚀 41.6 个百分点(DeepSeek-R1:53.7% 到 WebThinker 配置)。
指标与专家一致性
- 人工一致性:Table 2 中 E 的 Krippendorff α 为 0.811、平均 QWK 0.820;N 为 0.768 与 0.775;Hdirect 为 0.568 与 0.571。Composite 为 α 0.832、QWK 0.848。作者认为整体危害概念的歧义放大了专家分歧。
- 分项:Table 3 中 E 的最高人机 QWK 为 Ours-gemini-3.1-pro 的 0.764,直接评判为 0.548。Table 4 中 N 的最高为 Ours-qwen3.5-35b-A3b 的 0.742,直接评判为 0.305。gpt4o-mini 上 E 只从 0.296 到 0.541,MAE 仍为 0.834。
- 综合分:Table 5 中 DEHARM-gemini 的 QWK 为 0.774、MAE 0.196、Spearman ρ 0.812;DEHARM-qwen3.5 为 0.754、0.225、0.742。同表最高基线是 DeepReject-qwen3.5 的 0.436。摘要与附录 J 称相对最强基线提升 90.17%;附录 J 的对照是 DeepReject 0.407 对 0.774。主表评判模型是 Qwen,不是报出 0.774 的 Gemini。LLM-as-a-judge-gemini 的 QWK 为 0.147、MAE 2.040。
扰动鲁棒性
- 预期:Table 6 用 Gemini-3.1-Pro。作者预期 V1 下降,V2、V3 基本不变。
- DEHARM:V1 的 Mean Percentage Shift 为 -37.47%,Cohen's d 为 -1.05;V2 为 -2.38%(d=-0.05),V3 为 -2.69%(d=-0.15)。作者称清单抓住了参数偏离,检索锚定滤掉了无关噪声和表面安全姿态。
- 基线:StrongReject-gemini 在 V3 上为 -53.66%(d=-0.76);DeepReject-gemini 在 V2 上为 +5.18%(d=0.32);SafetyScore-gemini 在 V1 上为 +1.36%(d=0.06)。Table 14 换 Qwen3.5-35B 后,DEHARM 的 V1 为 -26.86%(d=-1.34),V2 为 +1.36%,V3 为 -0.84%。
其他消融与分析
- 附录 G,评判模型固定 Gemini-3.1-Pro。E 的 QWK:直接 0.548,只检索 0.634,只分解 0.697,全流程 0.764(Table 12)。
- N 的 QWK:直接 0.397,只检索 0.608,只分解 0.524,全流程 0.722(Table 13)。作者称 E 更依赖分解,N 更依赖检索。
- 附录 I:开源 LLM 平均 DEHARM 1.414,闭源 0.936;平均拒答 44.0% 对 58.2%;平均 DEHARM† 2.626 对 2.491。作者认为开源/闭源区分不是安全的好预测因子。
- 附录 I:Claude Sonnet 4.6 过安全率 74.8%、有害拒答 54.5%;DeepSeek-R1 为 54.7% 对 53.7%。作者称 DeerFlow + Qwen3.5-35B 不加区分地拒绝绝大多数输入,其低分不能当作真实安全。
- 附录 I:InternAgent 的 DEHARM 为 2.023,拒答 8.3%,过安全 0.0%;S1-VL-32B 的 DEHARM† 为 2.678,Intern-S1-Pro 为 2.760。作者称领域专门化本身没有更安全的表现。
- 附录 I:同一骨干下,WebThinker + DeepSeek-R1 的拒答为 12.1%、DEHARM 2.520,DeerFlow + DeepSeek-R1 为 25.8% 与 1.625。附录 J:DeepReject 4 次 LLM 调用;DEHARM-SCORE 为 6 次 LLM 调用加 6–10 次搜索 API 调用。
有什么可以进一步探索的点?
作者指出学科覆盖会过时,专家标注只做在代表性子集上。
作者指出的局限与后续方向
- 学科与时间:作者写明,尽管覆盖 12 个核心学科,量子材料工程等长尾子领域,以及 AI 驱动合成生物学等新兴交叉领域,尚未完全纳入;科学知识与滥用途径会随时间变化(Limitations,Limitation 1)。
- 更新计划:作者计划建立社区驱动的动态更新机制,并定期纳入新披露的真实高风险案例(Limitations,Limitation 1)。
- 标注成本:作者写明,标注通常需要博士或资深业界经验,受时间与预算限制,无法对所有被测 LLM 与智能体的全部测试回答做人工标注;当前只对代表性子集做深度标注(Limitations,Limitation 2)。
- 标注发布:作者称正在开源这些专家标注,并希望它们成为改进自动评测的公共数据(Limitations,Limitation 2)。
Ethics Statement 描述了受控标注和只使用已公开信息,没有把它写成局限。
实验覆盖范围
- 主评测是 SciHazard 上的 31 个系统:19 个标准 LLM、9 个 deep-research 配置、3 个科学专用模型(第 6.1 节、Table 7)。生成温度为 0,max_tokens=8192。论文未报告主评测重复次数。
- 数据为 12 个学科、2400 道危害题加 600 道过安全题(第 3 节、Table 1)。危害等级由三模型委员会多数投票,并在 360 题上与专家对照(附录 D)。
- 指标元评测用 173 道高风险查询、三名博士生(第 5.1 节)。拒答分类器在 500 条人工标注回答上检查(附录 F.2)。
- 自动指标对照为 DeepReject、StrongReject、LLM-as-a-Judge、SafetyScore。扰动为 200 道有害查询的 V1–V3,评判模型为 Gemini-3.1-Pro 与 Qwen3.5-35B(第 5.4 节、附录 H)。消融只使用 Gemini-3.1-Pro(附录 G)。
- 主表评判模型为 Qwen-3.5-35B-A3B。附录 J 报告 DEHARM-SCORE 为 6 次 LLM 调用加 6–10 次搜索 API 调用。论文未报告主评测总查询次数或墙钟耗时。
总结一下论文的主要内容
SciHazard用分解评分测科学滥用风险,作者称智能体抬高了可执行危害。
SciHazard 是一个科学滥用风险基准,配一个把危害拆开再合成的自动分数。
- 要测什么:作者要衡量 LLM 和自主科研智能体把危险科学知识变成可执行滥用指导的程度。作者认为现有基准偏模板和事实回忆,科学场景里的整体 LLM 评判又缺少领域依据。
- 数据:双轨流水线覆盖 12 个学科,给出 2400 道危害题和 600 道过安全题。物质轨从 1,548 个受管制物质沿生命周期与技术瓶颈出题;场景轨沿四阶段链条出题。问题危害等级为 1–5。
- 分数:未拒答时,Executability 用 10 项动态清单和 Blocker 看操作链是否闭合;Net-New Risk 用检索后的主张覆盖和合成壁垒看相对公开知识的抬升。总分是危害等级、拒答指示与这两项归一化之和的乘积。
- 指标证据:173 题、三名专家下,E 与 N 的 Krippendorff α 为 0.811 与 0.768,整体分 Hdirect 为 0.568。Table 5 中 DEHARM-gemini 的 QWK 为 0.774;主表实际用的 Qwen 评判为 0.754。Table 6 中,参数篡改使 DEHARM-gemini 移位 -37.47%,无关注入与安全声明为 -2.38% 与 -2.69%。
- 31 个系统:作者称 deep research agents 平均 DEHARM 为 1.504,比 19 个标准 LLM 的 1.137 高 32.3%。Table 7 中 WebThinker + DeepSeek-R1 的 DEHARM 为 2.520;Grok-4.1-Fast 的 DEHARM† 为 3.424,拒答 81.4%。作者称高拒答与未拒答回答的危害之间是反直觉的反向关系,智能体配置会侵蚀拒答屏障。
- 作者结论:作者称相对最强基线,专家一致性相对提升 90.17%,并把自主科研智能体视为当前安全防御的关键盲区。作者希望该基准与指标用于诊断并缓解下一代系统的科学安全风险。作者称代码与数据集已公开。