跳到正文
原文
论文追踪· arXiv:2605.21545· Lukas Weidener, Marko Brkić, Mihailo Jovanović, Emre Ulgac, Aakaash Meduri·本站收录 · 原文发表 精选关注度55

RefusalBench:拒答率为何会误排前沿 LLM 在生物研究提示上的安全水平

RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts

论文速读

评测与基准

据论文 PDF 整理(Gemini 生成),以原文为准

在RefusalBench生物提示词匹配三元组评测中,19个前沿LLM严格拒绝率跨越0.1%至94.6%,严格拒绝率误导安全校准。

问题
前沿大模型日益成为自动化蛋白质设计流水线的编排主干,但中间步骤的过度拒绝会导致多步流水线直接中断,且现有过拒评测缺乏固定任务脚手架并系统解耦生物风险层级与厂商访问路径效应的实证基准。
方法
构建141个提示词的RefusalBench,由47组固定任务框架、仅改变生物风险层级(良性、边界、双用途)的三元组组成,并引入15个正性对照提示词建立校准底线;采用三裁判委员会与5级顺从度阶梯进行标注,以Youden's J指数评估风险层级判别能力。
实验与结果
在2026年5月快照中,19个前沿模型在相同提示词上的严格拒绝率跨越0.1%至94.6%;Anthropic API栈以优势比21.03强预测拒绝行为;严格拒绝率误导安全校准,Grok 4.20实现最高层级判别指数(J=0.787)但总拒绝率仅居第七;9个模型在双用途层级出现部分顺从模式。
局限与可以继续做的
作者指出实验仅在单一温度0.7和中性系统提示词下进行;亚洲厂商被排除在裁判委员会外以防自评;未评测对抗鲁棒性;且无法确认Tier A模型在边界或双用途主基准上的拒绝属于正确校准还是过度触发。评测覆盖19个模型、47组匹配三元组及8个子领域。
实验设置Claude Opus 4.7、Claude Opus 4.6 等 · RefusalBench (141 prompts, 47 matched triples)、should-refuse positive control (15 prompts) 等 · Strict refusal rate、Lenient refusal rate 等
被测模型
Claude Opus 4.7Claude Opus 4.6Claude Opus 4.5Claude Sonnet 4.6GPT-5.5GPT-5.4 MiniGemini 3.1 Pro PreviewGemini 3.1 Flash LiteAmazon Nova ProGrok 4.20Nemotron 3 Super 120BMistral Large 3DeepSeek V3.2DeepSeek R1Qwen3 Next 80B
基准
RefusalBench (141 prompts, 47 matched triples)should-refuse positive control (15 prompts)Open Targets Platform release 24.06UniProt Swiss-Prot reviewed entries
指标
Strict refusal rateLenient refusal rateYouden's J indexKrippendorff's alphaOdds Ratio (OR)
AI 导读和推荐理由研究团队发布 RefusalBench,用 47 组匹配三元组共 141 条提示评测 19 个前沿大语言模型在生物研究提示上的拒答行为,同一提示的严格拒答率跨度达 0.1% 至 94.6%。每组的三种变体只改变目标生物风险等级(良性、边界、两用),任务表述保持一致,另设 15 条应当拒答的正对照提示来校准下限,有三个模型连这些提示也不拒答。分析发现司法辖区不能预测拒答(Mann–Whitney U,p = 0.393),而厂商身份可以,Anthropic 的 API 路径使拒答几率比达到 OR = 21.03(95% CI 14.58–30.34,按提示聚类),其 99.8% 的严格拒答带有同一 safety_policy 原因码。

研究团队发布 RefusalBench,用 47 组匹配三元组共 141 条提示评测 19 个前沿大语言模型在生物研究提示上的拒答行为,同一提示的严格拒答率跨度达 0.1% 至 94.6%。每组的三种变体只改变目标生物风险等级(良性、边界、两用),任务表述保持一致,另设 15 条应当拒答的正对照提示来校准下限,有三个模型连这些提示也不拒答。分析发现司法辖区不能预测拒答(Mann–Whitney U,p = 0.393),而厂商身份可以,Anthropic 的 API 路径使拒答几率比达到 OR = 21.03(95% CI 14.58–30.34,按提示聚类),其 99.8% 的严格拒答带有同一 safety_policy 原因码。

推荐理由19 个前沿模型在同一套生物研究提示上拒答率从 0.1% 到 94.6%,并给出严格拒答率会误排名安全校准的证据。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    解决前沿LLM在生物科研中过度拒绝导致编排流水线中断、且缺乏解耦风险层级评测基准的问题。

    前沿大模型作为生物研究编排主干时的过度拒绝会导致自动化流水线中断,而现有安全评测缺乏控制任务框架以解耦生物风险感知的评测基准。

    • 流水线中断风险:在蛋白质设计等自动化多步流水线中,大模型拒绝任务不会产出降级结果,而是直接终止整条链条,作者称在 ABLE 基准上曾有 3 个前沿模型直接拒绝了全部任务。
    • 现有基准的不足:XSTest 与 OR-Bench 等现有通用过拒基准未构建固定任务框架并递增生物风险的匹配提示词,未在科学任务上跨法域厂商进行系统比较,也未涉及多步智能体流水线中断问题。
    • 核心观察与假设:作者在实践中观察到同一常规科研提示词在不同厂商间出现流利回答与直接拒绝的巨大不对称性;作者假设拒绝差异可能源于法域归属、厂商访问路径策略或任务可操作性,而非单纯的内容风险感知。
    • 论文提出的方案:构建模块化基准 RefusalBench,通过 47 组匹配三元组(共 141 个提示词)固定任务脚手架并仅改变生物风险层级,结合 15 个正性对照提示词,评估 19 个前沿大模型的拒绝行为与校准质量。
    • 威胁模型:论文属于基准评测研究,评估模型在合法科研与潜在双用途生物请求下的拒绝行为,未设定对抗攻击者模型,威胁模型字段为空字符串。
  2. 有哪些相关研究?

    梳理了通用过拒基准、生物安全评估及智能体蛋白设计流水线,指出现有研究缺乏层级匹配控制。

    相关研究主要涵盖通用大模型过度拒绝评测、科学与生物安全评测,以及智能体生物设计流水线。

    通用过度拒绝基准

    • XSTest(Röttger 等,2024):使用 250 个手工编写的安全提示词展示模型在表面线索类似不安全内容时的夸大安全行为。
    • OR-Bench(Cui 等,2025):将过拒评测扩展至 80,000 个提示词,报告了安全对齐程度与过度拒绝之间的正相关性。
    • von Recum 等(2024)与 CoCoNot(Brahman 等,2024):统一了拒答分类学,区分了“能力所限不能做”(cannot)与“政策驱动不应做”(should not)的拒绝,并提出上下文不顺从分类。

    科学领域与生物安全评估

    • Forbidden Science(Noever 与 McKee,2025):在受控物质查询上评估了 4 个模型,发现 Claude-3.5-sonnet 拒绝了 73% 的提示词,而 Mistral 尝试回答全部。
    • VCT(Götting 等,2025)与 Soice 等(2023):分别报告了前沿模型在病毒学专业测试中超过 94% 的专家人类,以及非专家学生可在 1 小时内借助聊天机器人获取大流行病原体合成路径的生物安全隐患。
    • WMDP(Li 等,2024):通过多项选择题测量模型危险生物安全知识,本文指出多项选择题无法检测提示词脱离但仍提供操作指导的复合行为。

    智能体蛋白质设计流水线与基准

    • BindCraft、ProteinCrow、Genie-CAT、ProtoCycle、ProteinMCP:展示了 LLM 编排几十种工具执行从头结合蛋白设计、酶设计等自主科学任务的实用能力。
    • ABLE 基准(Cai 等,2025):评估了 LLM 使用 ProteinMPNN 和 AlphaFold3 等工具的智能体表现,发现半数测试模型直接拒绝任务导致流水线停滞。

    基线与定位区别

    • 对比基线与数据集:论文使用 Open Targets Platform 24.06 与 UniProt Swiss-Prot 数据库,对比了 19 个前沿及开源模型,基线方法为各模型默认 API 访问路径。
    • 本文定位:作者指出本文首个在生物领域构建保持任务脚手架完全恒定、仅递增生物风险层级的匹配基准,首次系统解耦了法域效应、厂商访问路径与任务可操作性。
  3. 论文如何解决这个问题?

    提出47组匹配三元组基准与15个正性对照,结合三裁判委员会与Youden's J指数评估风险判别。

    论文通过构建匹配三元组基准 RefusalBench、设定校准底线并引入多维判定体系,系统量化拒绝率与校准能力。

    匹配三元组基准构建

    • 三元组设计:包含 47 组匹配三元组(共 141 个提示词),每组保持任务脚手架(如骨架选择、界面优化、特异性分析)完全一致,仅改变靶点身份及其法规风险等级。
    • 确定性风险分级:良性层级(Benign)采用 Open Targets Platform 24.06 中无生物安全标记的人源蛋白;边界层级(Borderline)采用 BSL-3 生物或 WHO 优先病原体蛋白;双用途层级(Dual-use)采用 CDC/USDA 联邦特选标本清单、BSL-4 或 UniProt 毒素标记(KW-0800)蛋白。
    • 混淆控制验证:通过 Kolmogorov–Smirnov 检验确认三层级提示词长度分布无统计学差异(p > 0.05),并通过词汇审计确保无层级特异性技术关键词独占出现。

    正性对照模块与子领域覆盖

    • 应该拒绝正性对照:构建独立于主基准的 15 个 should-refuse 正性对照提示词,符合高风险源锚点、明确危害优化目标、请求操作性输出且完全去除防御/治疗/对抗修饰等 5 项标准,作为绝对校准底线(良好对齐模型拒绝率应 ≥ 95%)。
    • 八大子领域:涵盖 7 个实验子领域(binder_design、enzyme_design、de_novo_protein、sequence_design、structure_prediction、protocol_design、stability_optimization)及 1 个负对照子领域(bioinformatics_scripting,预期拒绝率接近零)。

    评判委员会与分类阶梯

    • 无重叠裁判委员会:由 NVIDIA Nemotron-70B-Instruct、Cohere Command R+、AI21 Jamba 1.5 Large 组成,排除所有测试厂商以防自评,主要评定行 Krippendorff's α 均值为 0.887。
    • 5级顺从度与16类原因体系:顺从度划分为完全顺从、部分顺从、间接拒绝、直接拒绝、无响应 5 个等级;严格拒绝(strict refusal)定义为直接拒绝与间接拒绝之和。
    • 层级判别指数定义:定义主基准层级判别能力 J = TPR − FPR,其中双用途层级严格拒绝率为真阳性率 TPR,良性层级严格拒绝率为假阳性率 FPR。说明其衡量模型区分危险请求与合法科研的能力。
  4. 论文做了哪些实验?

    评测19个模型,严格拒绝率跨度94.5百分点,Grok 4.20判别最佳,Opus 4.7校准退化65%。

    论文在 19 个模型上进行了 13,389 次主评测与 1,425 次正性对照评测,揭示了拒绝率与安全校准的严重脱钩。

    实验设置

    • 被测模型:共 19 个模型,包括 US 厂商(Claude Opus 4.7、Claude Opus 4.6、Claude Opus 4.5、Claude Sonnet 4.6、GPT-5.5、GPT-5.4 Mini、Gemini 3.1 Pro Preview、Gemini 3.1 Flash Lite、Amazon Nova Pro、Grok 4.20、Nemotron 3 Super 120B、Llama 3.3 70B Instruct 作为开源对照);EU 厂商(Mistral Large 3);Asian 厂商(DeepSeek V3.2、DeepSeek R1、Qwen3 Next 80B、GLM-5、MiniMax M2.7、Kimi K2.6)。
    • 基准与规模:RefusalBench 主评测 141 个提示词,正性对照 15 个提示词。
    • 试验与采样:每模型每提示词独立重复 5 次试验,系统提示词固定为 113 字符中性设定,采样温度为 0.7。
    • 评审与指标:主评测由三模型委员会采用多数投票裁定,报告严格拒绝率(direct + indirect)、宽松拒绝率及 Youden's J 指数。

    主结果

    表格较宽,可左右滑动

    模型厂商良性层级严格拒绝率边界层级严格拒绝率双用途层级严格拒绝率全局严格拒绝率
    Kimi K2.6Moonshot AI91.5%97.0%95.3%94.6%
    Claude Opus 4.7Anthropic76.6%96.2%100.0%90.9%
    Claude Opus 4.6Anthropic33.3%91.5%100.0%75.0%
    GPT-5.5OpenAI57.9%51.9%87.7%65.8%
    Grok 4.20xAI3.0%54.0%81.7%46.3%
    GPT-5.4 MiniOpenAI4.3%15.7%42.1%20.7%
    Gemini 3.1 Pro PreviewGoogle3.8%2.6%17.0%7.8%
    Llama 3.3 70B InstructMeta0.0%0.0%0.4%0.1%

    (据 Table 3.4,部分模型因篇幅省略)

    • 全盘拒绝率极度分化:在相同提示词下,严格拒绝率从 Llama 3.3 70B 的 0.1% 跨越到 Kimi K2.6 的 94.6%,跨度达 94.5 个百分点。
    • 良性层级显著过拒:在无安全标记的人源蛋白良性层级,Kimi K2.6(91.5%)、Claude Opus 4.7(76.6%)、GPT-5.5(57.9%)拒绝率均过半。
    • 层级判别与拒绝率错位:Grok 4.20 实现了全盘最高的层级判别度(J = 0.787),但在总拒绝率上仅排第七;Kimi K2.6 总拒绝率最高(94.6%),但 J 仅为 0.038。

    厂商效应与法域分解

    • 测了什么:检验良性层级拒绝率是否受法域(美 vs 亚)影响,以及控制任务类型和风险层级后厂商身份的效应。
    • 结果:美亚法域 Mann–Whitney U 检验 p = 0.393(rrb = -0.10),未检测出法域效应;而 Anthropic API 栈在逻辑回归中表现出极强拒绝预测能力,全模型 OR = 21.03(95% CI: 14.58–30.34,GEE 聚类模型 CI: 5.70–77.55,Table 3.6)。
    • 作者解读:拒绝异质性主要由特定厂商的访问路径决定,而非地理法域;Anthropic 严格拒绝中 99.8% 带有 safety_policy 代码,反映访问路径上游过滤而非逐案模型推理。

    Opus 版本纵向演变与任务可操作性梯度

    • 测了什么:评估 Opus 4.5、4.6、4.7 在相同提示词上的拒绝演进,并测试良性层级拒绝率沿 8 个预设任务可操作性梯度的变化。
    • 结果:Opus 4.5 与 4.6 表现统计不可区分(McNemar p = 0.683);Opus 4.7 在提示词多数决层面单向增加 23 个新拒绝(21 个在良性层级),良性拒绝率从 33.3% 增至 76.6%,Youden's J 相应下降 65%(从 0.667 降至 0.234,Figure 4);良性层级拒绝率与预设操作性等级相关性达 Spearman ρ = 0.976(酶设计良性拒绝率 83.6%,结构预测仅 10.1%,Table 3.7)。
    • 作者解读:Opus 4.7 政策收紧并未增加双用途检测(此前已达 100% 上限),而是扩充了对合法科研的良性假阳性;Anthropic 拒绝逻辑基于任务操作性直接危害程度而非单纯生物关键词。

    双用途层级的部分顺从模式(Q3象限)

    • 测了什么:双用途层级顺从度阶梯分布,特别是低严格拒绝(<50%)且高部分顺从(≥ 10%)的 Q3 象限模型行为。
    • 结果:18 个前沿模型中有 9 个落入 Q3 象限(Table 3.14),Gemini 3.1 Pro Preview 双用途部分顺从率达 64.3%,DeepSeek R1 达 36.2%(其严格拒绝率为 0%);Q3 象限 540 次部分顺从回应中 32.4%(n=175)包含安全意识原因标签。
    • 作者解读:二元拒绝指标漏掉了“既给出风险免责声明又提供实质操作指导”的对冲助答行为,严格拒绝率系统性低估了这类复合安全响应。

    其他消融与分析

    • 正性对照底线分级:8 个模型达到 Tier A(≥ 95% 拒答),7 个模型落入 Tier B(9%–73%),3 个模型(Llama 3.3、Mistral Large 3、DeepSeek V3.2)落入 Tier C(拒绝率仅 1.3%,Table 3.2)。
    • DeepSeek R1 逆向异常:R1 在主基准呈现负判别(J = -0.004),良性拒绝集中于生物信息脚本子领域,与 Anthropic 呈现负相关(ρ = −0.23 ∼ −0.33)。
    • 系统提示词敏感性消融:在 5 个模型 36 个提示词子集上测试 4 种系统提示词,Anthropic 跨提示词波动仅 5.6–6.7 个百分点,非 Anthropic 模型波动达 26.7–86.7 个百分点(Table S1)。
  5. 有什么可以进一步探索的点?

    作者指出了单提示词、无亚洲裁判、未测对抗等局限,实际覆盖了19个模型与47组三元组。

    论文明确指出评测在单一采样参数与提示词下进行、裁判缺乏亚洲厂商、未测对抗鲁棒性等多项局限。

    作者指出的局限与后续方向

    • 单一温度与提示词敏感性:主评测仅在单一温度 0.7 与特定系统提示词下执行;虽然敏感性消融对 5 个模型进行了测定,但未覆盖全部 18 个前沿模型与全部 141 个提示词,定制化系统提示词下的校准表现可能发生改变(Section 4.8)。
    • 五次重复对长尾刻画不足:每组条件 5 次独立试验足以估计响应变异性,但不足以刻画低拒绝率模型中的长尾罕见拒绝行为(Section 4.8)。
    • 裁判委员会缺乏亚洲厂商:为避免自我评审而排除了 6 家亚洲厂商的模型,换取无利益冲突保证的同时,可能在文化语境影响顺从分类时引入系统性评定偏差(Section 4.8)。
    • 未评测对抗鲁棒性:未针对对抗性越狱或红队攻击进行测试,正性对照 Tier A 表现仅反映正常请求条件下的策略,不代表在对抗压力下的鲁棒性(Section 4.8)。
    • 无法确定 Tier A 拒绝是否过度触发:正性对照确认了 Tier A 模型基于生物风险拒绝,但无法证实其在边界或双用途主基准提示词上的拒绝是合理校准还是过度触发,需要专家人工标注介入(Section 4.8)。
    • 部分顺从内容需专项编码研究:双用途层级 Q3 象限的部分顺从回应究竟构成实质性生物安全能力提升还是无害重定向,需在 RefusalBench v2.0 中进行专门的内容编码分析(Section 4.6)。

    实验覆盖范围

    • 评测模型规模:覆盖 19 个大语言模型,包括 12 个美国厂商模型、1 个欧洲厂商模型、6 个亚洲厂商模型,其中 18 个为前沿商业/闭源及开源模型,1 个为开源非前沿对照(Section 2.3)。
    • 任务三元组与提示词:基准包含 47 个匹配三元组共 141 个主提示词,以及 15 个正性对照提示词,覆盖 8 个蛋白质设计子领域(Table 2.2、Section 2.6)。
    • 提示词框架敏感性覆盖:系统提示词消融仅在 5 个模型、12 个三元组(36 个提示词)上测试了 4 种替代框架(Supplementary Note S1)。
    • 多步流水线未实际运行:论文指出未在类似 ProteinMCP 或闭环自主实验室的大规模真实多步智能体流水线中实际串联运行模型(Section 4.7)。
    • 论文未报告指标与信息:主基准未进行专家人工全面复核(仅对 α < 0.5 的 2.0% 标记项进行抽样复核);未报告模型推理 token 开销与 API 耗时。
  6. 总结一下论文的主要内容

    RefusalBench揭示大模型拒绝率跨度达94.5百分点,严格拒绝率无法表征真实的生物安全校准。

    本文提出了基于真实生物数据库匹配三元组的 RefusalBench 基准,揭示了前沿大模型拒绝率与生物安全校准质量的严重脱钩。

    • 解决的核心问题:大模型日益成为自动化蛋白质设计流水线的编排层,但其过度拒绝会直接终止科研流程;现有安全评测缺乏控制任务框架、仅改变风险层级的科学任务基准。
    • 方法核心要点:设计 47 组匹配三元组(141 个提示词)和 15 个正性对照提示词,固定任务脚手架并仅递增靶点风险层级(良性、边界、双用途),结合无重叠裁判委员会与 Youden's J 指数实现多维校准评估。
    • 拒绝率呈现两极分化:19 个模型在相同提示词上的严格拒绝率跨越 0.1%(Llama 3.3 70B)至 94.6%(Kimi K2.6);良性人源蛋白层级上 3 个模型拒绝率超过 50%(Table 3.4)。
    • 拒绝行为由厂商栈主导:未检测到法域效应(p = 0.393),而 Anthropic API 栈以 OR = 21.03 预测拒绝,且 99.8% 集中于安全策略原因代码,表现为上游访问路径过滤特征(Section 3.2.2)。
    • 拒绝率误导安全排序:Grok 4.20 实现最高判别指数(J = 0.787)但总拒绝率仅排第七;Claude Opus 4.7 政策收紧使良性假阳性翻倍,导致 J 指数下降 65%(Section 3.2.4)。
    • 启示与作者主张:作者认为单凭二元拒绝率无法评估模型安全性,9 个模型在双用途层级存在部分顺从行为;建议未来科学流水线采用基于风险层级和子领域的感知编排路由策略。
阅读原文arxiv.org