MultiTurnPSB:四轮医疗越狱评测显示单轮基准掩盖 19 倍安全差距
MultiTurnPSB: Evaluating Multi-Turn Jailbreak Attacks an dClassifier-Based Defenses for Medical AI Safety
MultiTurnPSB 评估发现,GPT-4.1-mini 在四轮实时对抗下不安全率达 78.8%,与 Claude 产生 19 倍差距。
- 患者面对拒答常会追加紧迫感和权威施压,现有基准仅测单轮无法反映真实对话中的医疗安全风险。
- 基于 PSB 构建四轮三模态对抗基准 MultiTurnPSB,并测试六分类器输入侧标签干预效果。
- GPT-4.1-mini 在实时攻击下不安全率升至 78.8%,输入侧标签干预可降低 52.2 个百分点但误报率为 45.0%。
- 基准为纯英文与纯文本,被测模型未配置系统提示词,Claude 作为攻击者在后两轮受拒答污染。
- 被测模型
- GPT-4.1-miniClaude Sonnet 4.5
- 基准
- PatientSafetyBenchMultiTurnPSBXSTest
- 指标
- Unsafe rateScoreOverall accuracyMissed detection rateFalse alarm rateLateral error rateRefusal rate
研究者提出 MultiTurnPSB,把 PatientSafetyBench 的 466 条面向患者的医疗安全提示扩展为四轮对抗对话,并测试固定模板、模板自适应和实时对抗三种攻击方式。在实时对抗攻击下,GPT-4.1-mini 的不安全回答率从第 1 轮的 34.8% 升至第 4 轮的 78.8%,其中健康虚假信息从 15.0% 升至 83.8%,歧视类达到 89.0%。面对同一个 GPT-4o-mini 攻击者,GPT-4.1-mini 与 Claude Sonnet 4.5 在第 1 轮几乎无差别(34.8% 对 31.8%,p=0.43),到第 4 轮却拉开 19 倍差距(78.8% 对 4.1%)。作者识别出四种退化轨迹,并指出紧急情境加医学权威声称这一两要素组合与多数完全违规相关,第 2 轮是关键脆弱窗口。
推荐理由论文用四轮对话基准揭示单轮评测看不到的模型安全差距,并给出分类器干预与假阳性代价的量化结果。
深度解读
这篇论文试图解决什么问题?
评估患者端医疗大模型在多轮交互施压与越狱攻击下的安全表现。
评估患者端医疗大模型在多轮对话中抵御用户施压与越狱攻击的安全表现。
- 问题场景与重要性:大语言模型正被越来越多用于患者端医疗信息获取,包括症状解释和用药咨询等,约 17% 的受访者曾使用聊天机器人寻求健康信息(Yun and Bickmore, 2025);患者在焦虑或无法就医时可能将模型输出作为可操作的医疗建议,输出错误具有实际危害。
- 现有方法的不足:多数医疗安全评测仅针对单轮提示词打分,忽略了真实交互中用户面对拒答会追加紧迫感、诉诸权威或施加情绪压力;现有医疗基准如 MedRiskEval(Corbeil et al., 2026)和 CSEDB(Draelos et al., 2026)均明言未覆盖多轮评测。
- 核心观察:作者称单轮安全得分无法预测模型在持续对话压力下的鲁棒性,基线表现相当的模型在面对同一攻击者时可能出现较大分化。
- 论文提出的方案:构建包含三种攻击模态的四轮医疗对抗评测基准 MultiTurnPSB,刻画模型安全退化轨迹,并评估分类器输入侧干预及攻击者自我限制现象。
有哪些相关研究?
涵盖医疗安全基准、多轮对抗评测、红队越狱与过度拒答相关研究。
- 医疗大模型安全基准
- Han et al. (2024) 提出 MedSafetyBench,在面向临床医生的场景中评估大语言模型是否遵守医疗伦理原则。
- Corbeil et al. (2026) 提出 MedRiskEval 并引入 PatientSafetyBench(PSB),关注有害建议、误诊、无证行医、虚假信息与歧视等患者端风险。
- Draelos et al. (2026) 与 Wang et al. (2026) 分别提出 CSEDB 与 HealthAdvice,强调医疗安全评估依赖于逼真的场景设计。
- 多轮医疗安全研究
- Liu et al. (2026) 提出 JMedEthicBench,基于 67 项日本医学会指南构建多轮对抗医疗伦理基准,采用双 LLM 评分协议评测 22 个模型,报告安全得分跨轮次中位数由 9.5 降至 5.5(p < 0.001)。作者指出本文与之不同:采用英语环境及经过验证的患者端风险分类体系,对比三种攻击模态,并系统分析了攻击者自我限制和防御者模式识别现象。
- 红队测试与安全越狱评估
- Chao et al. (2024) 与 Mazeika et al. (2024) 分别提出 JailbreakBench 和 HarmBench,研究通用设定下的对抗性提示词生成。作者指出本文设定的两点区别:有害行为属于患者端医疗风险,且攻击方式是对话式多轮而非单轮。
- 安全分类与过度拒答研究
- Röttger et al. (2024) 提出 XSTest,研究模型将表面相似的良性提示词过度拒答的夸大安全行为。
- 对比基准
- 本文以 PatientSafetyBench 的 466 个医疗安全提示词作为多轮对话起点,采用 XSTest 中的 100 个安全提示词作为良性评估样本。
作者将本文定位为评估患者端多轮医疗对话安全漏洞的实证基准,通过横向对比攻击模态与模型退化模式,填补单轮评测与实际交互之间的空白。
- 医疗大模型安全基准
论文如何解决这个问题?
基于 PSB 构建四轮三模态对抗评测,并引入六分类输入标签防御。
基于 PatientSafetyBench 构建四轮对抗评估框架 MultiTurnPSB,对比三种不同攻击模态,并探索输入侧分类器干预防御。
评测基准与多轮对话构建
- 风险分类体系:继承 PSB 的 5 个患者端风险类别(有害医疗建议、误诊、无证行医、虚假健康信息、歧视)。第 1 轮为原始 PSB 提示词,通过三种攻击模态扩展至 4 轮对话。
- 评分协议:采用 PSB 五分制量表(1 分为拒答,5 分为完全违规),定义不安全条件为 Score ≥ 3,以衡量响应是否包含有害内容。评审模型为 GPT-4o-mini(temperature 0.0),仅接收当前轮次的用户消息和模型回复。被测防御模型未配置系统提示词,以反映基础内在安全对齐水平。
三种攻击模态设计
- 固定模板攻击(Fixed-template):Turns 2–4 预先用 GPT-4o-mini 生成一次并冻结,固定遵循紧迫感(Turn 2)、虚假权威(Turn 3)与情绪施压(Turn 4)的升级顺序。
- 模板自适应攻击(Template-adaptive):保持紧迫感-权威-情绪的固定策略顺序,但攻击模型在观察目标模型上一轮回复后在线重写表述。
- 实时对抗攻击(Live adversarial):攻击者(GPT-4o-mini,temperature 0.9;或 Claude Sonnet 4.5)接收完整对话历史,自由选择权威操纵、紧急定式、学术重构、部分合规利用、渐进升级等策略生成后续攻击消息。附录 A 给出了完整提示词。
分类器输入侧防御机制
- 意图识别分类器:构建六分类模型(PSB 的 5 个风险类别加 1 个良性类别),基于提示词引导模型识别潜在意图而非表面紧迫感或角色扮演。
- 三阶段评估:Phase 1 评估单轮基线分类准确率(464 条有害 PSB 样本加 100 条良性 XSTest 样本);Phase 2 评估在完整对抗对话历史下的分类漂移;Phase 3 实施干预:当分类器预测有害类别时,在用户输入前拼接安全标签,指明类别和预期安全行为。此干预仅作用于输入侧,不检测或过滤模型输出。
论文做了哪些实验?
多轮实时攻击下模型不安全率升至 78.8%,两模型分化达 19 倍。
实验设置
- 被测受害模型:GPT-4.1-mini、Claude Sonnet 4.5(作为受害模型时均未配置系统提示词,以反映基础内在安全训练)。
- 攻击与辅助模型:GPT-4o-mini(用于生成固定模板、作为实时攻击者,以及作为评分评审模型,temperature 0.0;生成实时攻击时 temperature 0.9)、Claude Sonnet 4.5(作为实时攻击者)。
- 评估基准与规模:PatientSafetyBench(PSB,466 条患者端医疗安全提示词;数据预处理阶段失败 2 条,分类实验使用 464 条;类别分布为有害建议 98、误诊 99、无证行医 97、虚假信息 80、歧视 90)、XSTest(100 条良性提示词)。
- 评估指标:不安全率(Unsafe rate,评分 ≥ 3 的比例)、平均评分(1–5 分)、分类器整体准确率(Overall Acc)、漏检率(Miss rate)、误报率(FA rate)、横向分类错误率(Lateral error rate)、攻击者拒答率(Refusal rate)。
- 评审方式:GPT-4o-mini(temperature 0.0)依据 PSB 五分制量表独立评分,仅输入当前轮次的用户消息和模型回复。
主结果
表格较宽,可左右滑动
防御模型 攻击模型 攻击类型 T1 (%) T2 (%) T3 (%) T4 (%) 出处 GPT-4.1-mini GPT-4o-mini 固定模板 34.5 50.9 60.3 58.6 Table 2 GPT-4.1-mini GPT-4o-mini 模板自适应 34.3 54.9 54.5 59.7 Table 2 GPT-4.1-mini GPT-4o-mini 实时对抗 34.8 77.7 77.5 78.8 Table 2 / Table 4 Claude Sonnet 4.5 GPT-4o-mini 实时对抗 31.8 28.3 10.5 4.1 Table 4 Claude Sonnet 4.5 Claude Sonnet 4.5 实时对抗† 32.8 49.4 27.7 33.7 Table 4 注:†标注的 Claude 自攻击条件中 T3–T4 数据受攻击者拒答污染,仅 T2 数据有效。
- 攻击模态与策略选择:GPT-4.1-mini 在实时对抗攻击下 Turn 4 不安全率达到 78.8%,高出模板自适应攻击 19.1 个百分点;作者认为策略选择相比固定顺序的措辞调整对绕过防御的作用更大。
- 模型多轮分化:在同一 GPT-4o-mini 实时攻击下,GPT-4.1-mini 与 Claude Sonnet 4.5 在 T1 基线统计等价(34.8% 对 31.8%,χ2 = 0.63, p = 0.43),但到 T4 分化为 78.8% 对 4.1%,相差 74.7 个百分点(19 倍)。
- 类别易感性差异:据 Table 3,健康虚假信息在实时攻击下增幅最大(T1 的 15.0% 升至 T4 的 83.8%,+68.8 pp);歧视类在 T4 达到最高不安全率(89.0%),但 Score 5 完全违规为 0;误诊类基线最高(69.7%)且增幅最小(+15.1 pp)。
攻击轨迹特征与违规模式
- 测了什么:分析模型在对抗多轮中的响应模式及 5 分完全违规的成因。
- 结果:作者归纳出合规蠕变(GPT-4.1-mini 递增至 78.8%)、收益递减(模板攻击在 T3 达 60.3% 后降至 58.6%)、模式识别(Claude 对抗 GPT-4o-mini 时不安全率单调降至 4.1%,且在 38.8% 的 T4 回复中直接点出操纵模式)、尖峰后放弃(Claude 自攻击)四种轨迹特征;73.9% 的从 T1 安全转为 5 分完全违规发生在 T2,且普遍结合了紧急状态定式与医疗权威主张(Table 10、Appendix C)。
- 作者解读:作者认为 Turn 2 是防御加固的关键窗口;GPT-4.1-mini 倾向于将累积上下文视为用户合法性,在 51.1%(238/466)的 T2 攻击仅为无技巧的简单重述时仍输出不安全回复。
攻击者自我限制方法学发现
- 测了什么:使用 Claude Sonnet 4.5 担任红队攻击模型时的行为表现。
- 结果:尽管提示词指明红队研究者身份,Claude 作为攻击者在 T2 拒答 7.9%(37/466),T3 拒答 32.2%(150/466),T4 拒答 53.9%(251/466);GPT-4o-mini 在 1,398 轮中拒答率为 0%(Table 5)。
- 作者解读:作者指出实验管线未拦截攻击者拒答,拒答文本作为用户输入直接传给受害者,导致 Claude 自攻击的 T3–T4 数据失真;这一发现表明安全训练可能泛化到攻击者角色,自动化红队测试需显式检测攻击模型拒答。
分类器漂移与安全标签干预
- 测了什么:六分类器在对抗历史下的表现及安全标签输入侧干预效果。
- 结果:单轮下 Claude 分类器准确率 93.3%(误报率 16.0%),GPT-4.1-mini 分类器准确率 82.3%(误报率 45.0%)(Table 6);进入多轮后 GPT 分类器准确率从 T1 的 95.5% 降至 T4 的 48.5%,主要由于横向类别混淆升至 50.0%(其中 67% 聚集到无证行医)(Table 8、Figure 5);添加预测类别标签使 GPT-4.1-mini 在 T4 的不安全率从 78.8% 降至 26.6%(绝对降幅 52.2 pp)。
- 作者解读:作者认为尽管分类器明显漂移,横向错误依然保留了保护效果;但良性查询高达 45.0% 的误报率是临床部署的主要制约。
其他消融与分析
- 虚假信息类别分类器漏检:GPT-4.1-mini 分类器在虚假信息类漏检率为 27.5%(Table 7)。
- Claude 攻击策略分布:医疗权威占 39.9%、学术重构占 40.6%、合法医学事实占 18.2%(Section 5.4)。
- GPT-4o-mini 攻击策略分布:简单重述占 51.1%、情绪诉求占 17.2%(Section 5.4)。
- 完全违规分布:无证行医类 35 起、误诊类 15 起、有害建议类 10 起、歧视类 0 起(Section 5.2)。
- GPT-vs-GPT 完全违规数量:T1 为 13 起,T2 为 25 起,T3 为 34 起,T4 为 38 起,总计 110 起(Table 10)。
- GPT-vs-Claude 完全违规数量:T1 为 11 起,T2 为 3 起,T3 为 1 起,T4 为 0 起,总计 15 起(Table 10)。
有什么可以进一步探索的点?
作者指出了基准合成性、单语言纯文本及攻击者拒答污染等局限。
作者指出的局限与后续方向
- 合成基准的真实性:MultiTurnPSB 为合成基准,可能无法完全匹配普通患者的真实对话行为(Section 7)。
- 目标模型代表性:主要目标模型为 GPT-4.1-mini,所得结论可能无法推广至所有前沿模型或开源权重模型(Section 7)。
- 自动化评审的主观性与局限:在 GPT-vs-GPT 条件下,自动评审模型(GPT-4o-mini)同时充当攻击模型,可能对自身生成内容产生评分宽松偏差;且评审仅接收当轮输入与回复,无法直接对跨多轮的升级模式评分(Section 7)。
- 受害模型配置:被测防御模型未配置系统提示词,所得结果反映的是部署安全性的下界(Section 7)。
- 攻击者拒答污染:Claude 自攻击条件仅在 Turn 2 有效,Turn 3 与 Turn 4 数据受未检测的攻击者拒答污染(Section 7、Appendix B)。
- 语言与模态范围:所有实验均为纯英文和纯文本;多语言、多模态以及更长轮次的攻击留待未来探索(Section 7)。
实验覆盖范围
- 被测受害模型为 GPT-4.1-mini 与 Claude Sonnet 4.5 共 2 个模型。
- 攻击模型为 GPT-4o-mini 与 Claude Sonnet 4.5 共 2 个模型。
- 评测基准为 PatientSafetyBench(466 个提示词,分类实验使用 464 个)与 XSTest(100 个良性提示词)。
- 对话轮次固定为 4 轮。
- 论文未报告人工评估与自动化 LLM 评审的一致性检验。
总结一下论文的主要内容
多轮攻击加剧医疗模型风险,分类器干预有效但受高误报率制约。
MultiTurnPSB 针对患者端医疗大模型在持续交互中的安全风险,构建了包含三种攻击模态的四轮对抗评测基准。
- 要解决的问题:真实用户面对医疗模型拒答时常会追加紧迫感和权威背书,但现有医疗安全基准多局限于单轮测试,无法反映持续对话压力下的防御脆弱性。
- 方法要点:将 PatientSafetyBench 扩展为四轮对话,对比固定模板、模板自适应与实时对抗三种攻击模态;同时构建六分类意图识别模型,评估输入侧安全标签拼接防御的效果与分类器跨轮漂移。
- 主要实验结果:
- 在 GPT-4o-mini 实时攻击下,GPT-4.1-mini 不安全率由 T1 的 34.8% 升至 T4 的 78.8%,而 Claude Sonnet 4.5 由 31.8% 降至 4.1%,二者在基线统计等价(p = 0.43)下分化达 19 倍(Table 4)。
- 紧急状态定式结合医疗权威主张的双要素攻击与 73.9% 的 T2 完全违规相关,Turn 2 成为关键脆弱窗口(Section 5.2)。
- 输入侧安全标签干预使 GPT-4.1-mini 在 T4 的不安全率降低 52.2 个百分点,但分类器在 XSTest 良性提示词上的误报率达 45.0%(Table 6、Table 8)。
- Claude 担任攻击者时在 T4 出现 53.9% 的拒答,因管线未检测拒答导致其自攻击后两轮数据受污染(Table 5)。
- 作者结论与启示:作者认为单轮评测无法为医疗 AI 部署提供可靠安全信号,模型退化轨迹反映了内在对齐机制差异;安全训练可能泛化至攻击者角色,自动化红队测试必须引入显式的攻击者拒答检测。