OpenMTB-Audit:LLM 分子肿瘤委员会安全评测暴露过度拒答
OpenMTB-Audit: Exposing Over-Refusal and Clinical Expert Perspectives in LLM-Based Molecular Tumor Board Safety Evaluation
作者发现八种LLM对真部分支持病例的over-refusal为83.3%–100%,审计系统为6.7%。
- 分子肿瘤委员会审计要区分Supported、Partially Supported、Insufficient Information和Unsupported。作者认为LLM会丢掉Partially Supported,聚合分会掩盖该校准错误。
- OpenMTB-Audit含500例合成NSCLC、五类错误和四档标签。MTB-AuditAgent用七个确定性模块分开做证据核对、缺失信息、四标签和弃���,推理时不调用LLM。
- 在60例真PS上,八种LLM的over-refusal为83.3%–100%,MTB-AuditAgent为6.7%,N=500的accuracy为91.2%,Safety Score为92.4。
- 作者指出只覆盖NSCLC与15个分子谱,并称罕见变异和复杂共突变仍代表性不够;只评了GPT-4o与GPT-4o-mini。50例专家子集参与过改进,标签、证据库与规则同源。运行时间与API成本未表征。
- 模型
- GPT-4o (gpt-4o-2024-08-06)GPT-4o-mini (gpt-4o-mini-2024-07-18)
- 基准
- OpenMTB-Audit
- 指标
- AccuracyMacro F1Safety ScoreOver-RefusalFalse ApprovalAbstain F1Cohen's kappa
研究者发布 OpenMTB-Audit,一个包含 500 例合成非小细胞肺癌病例的开源基准,覆盖五类对抗性错误和 Supported、Partially Supported、Unsupported、Insufficient Information 四种安全标签。在八种大语言模型配置上,所有配置在真实 Partially Supported 病例中有 83.3% 至 100% 未能保留该标签,靠标签坍缩获得高总体安全分,而非临床校准推理。为此作者开发 MTB-AuditAgent,一个确定性七模块框架,分离证据核验、缺失信息检测、安全分类与弃答,将过度拒答降至 6.7%,准确率达 91.2%(95% CI:88.6-93.6%)。两位肿瘤科医生的标注研究显示,分歧集中在信息充分性与治疗优化之间的边界。
深度解读
这篇论文试图解决什么问题?
审计须分开证据、信息够不够和要不要复核,聚合分会掩盖中间标签被丢掉。
分子肿瘤委员会审计要同时判断证据是否支持、信息是否够做决定,以及有证据的治疗是否仍须先交给肿瘤专家复核;作者认为LLM常丢掉这个中间状态。
- 场景: 作者指出NSCLC已有超过15种生物标志物导向治疗,分子匹配与晚期肿瘤结局相关,个案审核需要能复核。治疗可以在分子上合适,但仍取决于体能状态、文书是否完整、既往治疗和给药顺序。
- 既有工作的缺口: 作者认为先前LLM研究多看建议是否正确、证据检索或明显不安全输出,较少处理“有证据但仍须临床复核”。作者还认为聚合指标未必反映这种临床后果。
- 观察: 作者定义的临床over-refusal不是拒答,而是没保住Partially Supported,把需复核的有证据治疗标成Unsupported或Supported。作者称据其所知,这一标签校准错误此前没有在分子肿瘤委员会审计中被量化。
- 本文给出的对象: 合成基准OpenMTB-Audit(500例NSCLC、五类对抗错误、四标签Supported、Partially Supported、Unsupported、Insufficient Information),以及确定性七模块MTB-AuditAgent,把证据核对、缺失信息、四标签分类和转诊弃权分开。
有哪些相关研究?
相关工作分建议生成、临床评测和文本over-refusal,作者改做四标签审计。
作者把本文放在对已有建议做四标签安全审计,并把临床over-refusal定义成未能正确标出Partially Supported。
分子肿瘤委员会中的LLM
- Schmutz等(2025): 比较ChatGPT-4.0与真实肿瘤病例上的专家决定。论文转述该比较既看到临床相关建议,也看到证据优先级上的差异。
- MEREDITH(Lammert等,2024): 用检索增强和专家引导的精炼,从文献、试验登记、批准信息和指南生成治疗选项。论文写明它只在10个虚构病例上评估,且关注建议相关性。
- MTBBench(Vasilev等,2025): 评估多模态、纵向的肿瘤决策。论文转述其报告幻觉、证据对照和时间推理上的持续困难。
临床LLM评测
- 考试式评测: Singhal等(2023)、Nori等(2023)和Thirunavukarasu等(2023)讨论LLM在医学知识题和执照式考试上的表现。论文写道,这些评测没有覆盖临床工作流的安全要求。
- MedHELM(Bedi等,2026): 论文称其显示出任务级差异,并支持按应用做评测。
- 陈述与遗漏: 论文引用Alkaissi与McFarlane(2023)、Sallam(2023)和NOHARM(Wu等,2025),写道事实表现强仍可能出现无支持陈述、有害遗漏或不适当选项,专科会诊病例中错误仍然存在。
Over-refusal
- 通用基准: XSTest(Röttger等,2024)、OR-Bench(Cui等,2025)和Pan等(2025)研究模型在保守安全边界附近拒绝良性或允许的请求。
- 医疗场景: 论文转述CARES(Chen等,2025)显示模型既可能顺从有害请求,也可能过度拒绝安全医疗提示;Health-ORSC-Bench(Zhang等,2026)把该分析扩到双用途健康提示。
- 与本文的差别: 论文称这里的失败可以是已经作答、但没有把需要限定性复核的建议标成Partially Supported,包括标成Unsupported(作者称conservative escalation)或Supported(没有所需注意事项)。
基线与基准
- 对照配置: 实验基线是OpenMTB-Audit(N=500)上的八种LLM配置:GPT-4o与GPT-4o-mini各做Base LLM、Simple RAG、RAG+EV和Prompt-Checklist。MTB-AuditAgent是确定性系统,推理期不调用LLM。
作者称本文与治疗生成分开:给定已有建议,把它分成有支持、需要临床复核、信息不足或不支持,从而直接评标签校准。
论文如何解决这个问题?
用500例四标签基准,再用七个确定性模块分开证据、缺信息和复核。
OpenMTB-Audit给每例合成病例一个参考标签;MTB-AuditAgent只审计已提出的治疗,不生成治疗。证据检索之后的决策按规则执行,作者称因此预测可复现。
任务与四标签
- 输入输出: 输入为病例摘要和拟用治疗。每例有一个Support Label、一个二元弃权目标、缺失信息标记和结构化审计理由。
- 四个标签: Supported指分子和疾病情境支持该治疗,且判断适宜性所需信息齐全。Partially Supported指分子或临床理由成立,但患者特异因素须先由肿瘤专家复核,例子包括较差的ECOG和较多既往治疗。Unsupported指分子改变或疾病情境缺乏足够支持,包括药物不匹配、只在其他癌种有支持,以及基于不可行动或虚构生物标志物的建议。Insufficient Information指缺一个或多个关键字段,作者认为此时应弃权,而不是给确定标签。
- 作者强调的边界: Partially Supported是实施上的不确定,Unsupported是证据不足。作者称把二者并成一类,会把“能不能做”和“有没有证据”混在一起。论文写明Wrong Context的金标准标签是Unsupported。
基准如何建成
- 规模: 500例全合成NSCLC,无电子病历、无受保护健康信息。清洁病例200例:把有治疗意义的分子改变配上有证据支持的建议,并变化分期、组织学、ECOG、既往治疗和脑转移。对抗病例300例,Table 1的五类各60例。
- 五类错误: Wrong Drug指药物与所报分子改变缺乏支持;Wrong Context指证据或监管支持在另一种癌、不在当前NSCLC;Missing Critical Information指分期、ECOG、既往治疗或生物标志物验证等字段缺失;Hallucinated Variant指意义未明、非敏感或无支持的标志物被写成可行动;Unsafe Overconfidence指分子匹配的治疗可能合适,但建议漏掉注意事项,如ECOG≥3或大量既往治疗。Figure 1给出四标签的合成例子。
- 公开来源: CIViC提供464条已接受的预测性标志物–治疗证据;OpenFDA给出20种有相关FDA标签的NSCLC治疗;ClinicalTrials.gov提供146项在研或已完成的NSCLC研究;cBioPortal的170个分子谱来自TCGA肺腺癌、TCGA肺鳞癌和MSK-2015,访问时间为2026年1–3月。基因和药名被归一到受控词表,cBioPortal谱映射到同一套15个分子谱。论文点名EGFR、ALK、ROS1、BRAF、MET、KRAS、RET、NTRK、HER2、PD-L1等,并写有20种FDA标注治疗。
- 与Partially Supported的对应: 作者在第7.1节写明,60例金标准Partially Supported就是Unsafe Overconfidence。论文没有给出其余三个标签在500例中的例数。
MTB-AuditAgent的七个模块
- M1–M2: M1从自由文本抽出癌种、组织学、分期、基因组改变、拟用治疗、ECOG、既往治疗、PD-L1和脑转移,并标出意义未明或不可行动的改变。M2按标志物、疾病情境和药物,在基准知识库中匹配FDA批准与CIViC记录。
- M3–M4: M3做标志物–治疗一致性检查,作者称这是下游分类的主要证据信号。M4把分期、ECOG、既往治疗和生物标志物验证视为关键变量,因为它们直接关系治疗是否合适;PD-L1和脑转移视为情境变量,用于细化、但不必然阻止安全判断。
- M5–M6: M5综合证据是否支持、关键临床信息是否齐全、是否还要临床复核,给出四标签之一。M6标出应转给肿瘤专家的情形:缺关键信息、标志物可行动性不确定、ECOG差,或不被支持的治疗。消融里的ECOG规则属于M5;论文没有另外写出该规则的判定条文。
- M7: 输出预测标签、弃权建议、缺失信息分析、支持证据和简短临床理由。Figure 2表示从自由文本到这份报告的流程。作者称推理期不调用LLM。
两个核心定义
作者把临床over-refusal写成1 − recallPS:60例金标准Partially Supported里,没有被预测成Partially Supported的比例,含标成Supported或Unsupported。
安全分(式1)为SS = 100 × (0.30(1 − Rmiss) + 0.20 F1abs + 0.20 RMI + 0.15 CWD + 0.10 CHall + 0.05 COC)。R_miss是无支持治疗被误标为Supported的比例,F1_abs是弃权F1,R_MI是Missing Critical Information病例里被标成非Supported的比例,后三项是Wrong Drug、Hallucinated Variant、Unsafe Overconfidence中未被标成Supported的比例。作者把0.30放在虚假背书上,因为作者认为其伤害高于漏掉缺失信息;弃权与缺失信息检测各0.20。Wrong Context被标成Supported时,作者称通过R_miss惩罚。另报accuracy、macro F1和各类precision、recall。
论文做了哪些实验?
N=500时Agent准确率91.2%,八种LLM对真PS的over-refusal为83.3%–100%。
实验设置
- 模型与解码: GPT-4o(gpt-4o-2024-08-06)和GPT-4o-mini(gpt-4o-mini-2024-07-18),2026年6–7月经OpenAI API调用,temperature=0,max_tokens=512。MTB-AuditAgent推理期不调用LLM。
- 数据: OpenMTB-Audit全部500例(清洁200、对抗300,五类各60)。作者写明真Partially Supported为60例;论文未给出另外三个标签在全库中的例数。
- 八种配置: 每个模型做Base LLM(零样本)、Simple RAG(附加排序前五的CIViC记录)、RAG+EV(再加七步证据核对提示)、Prompt-Checklist(六步,并显式围绕四标签推理)。
- 指标: 四标签accuracy、macro F1、各类precision与recall、Abstain F1、MI Catch、Safety Score;over-refusal即1−recallPS的文字定义(第3问);false approval为Unsupported被标成Supported的比例。
- 统计: accuracy的置信区间用10,000次bootstrap;配对比较用McNemar检验。
- 专家子集: 两名诊治NSCLC的肿瘤专家独立标注50例,盲于AI预测、基准标签和对方。作者写明该子集在开发Agent时被看过,报告的是事后一致性。
主结果
下表据Table 5(N=500)。省略GPT-4o-mini Prompt-Checklist(accuracy 0.600,Macro F1 0.422,Abstain F1 0.851,MI Catch 0.567,Safety Score 83.9)和GPT-4o Simple RAG(0.608,0.402,0.451,0.433,74.1)。作者用粗体标出各列最高值:accuracy、Macro F1、MI Catch和Safety Score在MTB-AuditAgent;Abstain F1在Prompt-Checklist GPT-4o,不在Agent。被省略行的0.851不是该列最高。
表格较宽,可左右滑动
系统 Accuracy Macro F1 Abstain F1 MI Catch Safety Score GPT-4o-mini Base LLM 0.694 0.499 0.348 0.567 74.9 GPT-4o-mini Simple RAG 0.524 0.318 0.346 0.467 73.8 GPT-4o-mini RAG+EV 0.462 0.317 0.832 0.650 87.0 GPT-4o Base LLM 0.676 0.441 0.392 0.600 76.4 GPT-4o RAG+EV 0.554 0.402 0.871 0.800 90.9 GPT-4o Prompt-Checklist 0.740 0.601 0.884 0.783 90.1 MTB-AuditAgent 0.912 0.898 0.688 0.933 92.4 - 标签塌缩: 作者称RAG+EV与Prompt-Checklist四行的Safety Score为83.9–90.9、accuracy为46.2%–74.0%;Discussion把安全分写成84–91。作者称高分来自标签塌缩。Figure 3的说明是Safety Score对accuracy;作者称结构化LLM安全分高而accuracy较低,Agent两者都高。正文没有各点坐标。
- 规模: 作者称各配对策略上GPT-4o的Safety Score更高,并称非结构化配置差距小,所举为Base LLM的76.4对74.9、Simple RAG的74.1对73.8。表中Base LLM的accuracy是GPT-4o-mini高于GPT-4o,这句话不能直接挪到accuracy。未列入上表的GPT-4o Simple RAG,accuracy 0.608、Safety Score 74.1,两项都低于同模型Base LLM(Table 5)。
- 检验: 作者称相对Safety Score最高的RAG+EV GPT-4o,Agent的accuracy高出35.8个百分点;McNemar统计量为b=197、c=18、χ²=147.4、p<0.001。作者称bootstrap区间不重叠,正文只给出Agent accuracy的95% CI:88.6%–93.6%。
临床over-refusal
- Table 2: 在60例真Partially Supported上,GPT-4o-mini Base LLM为83.3%,GPT-4o的Base LLM和RAG+EV为98.3%,其余五种LLM配置为100.0%,Agent为6.7%。false approval从0.0%到2.2%;Agent以及GPT-4o-mini的Simple RAG、两种模型的RAG+EV为0.0%。作者称八种配置都被明确告知Partially Supported是合法标签,并给了操作定义。作者报告GPT-4o配置中98.3%与100%的双侧Fisher精确检验p=1.00(59/60对60/60)。
- Table 3: Prompt-Checklist GPT-4o的Partially Supported precision和recall都是0.00,Unsupported为0.75和0.98,Supported为0.97和0.75,Insufficient Information为0.97和0.58。Agent相应为Partially Supported 0.71和0.93、Unsupported 0.91和1.00、Supported 0.98和0.84、Insufficient Information 1.00和0.87。作者称前者60例中31例标成Supported、29例标成Unsupported,并称其Unsupported预测约四分之一是假阳性,其中29例是被误标的Partially Supported。作者称Figure 4按错误类型画正确标签率(每类N=60),最大差距在Unsafe Overconfidence;正文没有各类柱高。
专家标注
- 一致性: Oncologist A与基准50/50,κ=1.000;B为34/50,κ=0.553。因A与基准完全一致,A对B也是34/50、κ=0.553。作者按Landis与Koch的解释称0.553为moderate。B的recall为Unsupported 19/20、Partially Supported 8/10、Supported 6/10、Insufficient Information 1/10(Table 4)。作者认为差异可能来自临床判断不同,以及标注者是严格套用定义还是按偏好的临床实践理解病例。
- 分歧内容: 16例不一致中15例涉及信息是否够用或治疗如何选择,1例为Unsupported参考标签。三种模式占12例:缺临床信息7例,A要求ECOG和既往治疗,B接受已有分子证据;ROS1融合阳性NSCLC中crizotinib是按批准还是按optimality,在Supported与Partially Supported之间不同,3例;ECOG 3的2例,一边按药物耐受,一边要求临床复核。
- 事后κ: 在这50例上,Agent相对基准的κ=0.833,Prompt-Checklist为0.451;论文在κ处没有写明Prompt-Checklist是哪一个模型。Prompt-Checklist GPT-4o把子集中10例Partially Supported都标成Unsupported,Agent把这10例都分对。作者称主要困难是把需要临床复核的治疗和确实缺乏证据的治疗分开。
知识库与文本输入
- 去掉结构化分子谱标识: accuracy 92.2%,Safety Score 94.5。作者称与原设定nearly unchanged(Table 5全系统为accuracy 0.912、Safety Score 92.4),并称系统不依赖对基准分子谱标识的oracle访问。
- 扣留五个分子谱: 165例上Safety Score 91.7(95% CI:90.1–93.1),作者称预定义的安全违规都被检出;accuracy降到47.9%。作者称这是因为原先支持的建议被改标为Insufficient Information,并称证据不可用时弃权、不给出无支持判断,是预期中的失败方式。论文未说明这五个谱的名称,也未说明该CI是否用10,000次bootstrap。
其他消融与分析
- 去掉M3:accuracy 0.552,Macro F1 0.586,Safety Score 37.4(−55.0)。作者称证据一致性是安全分的主要决定因素(Table 6)。
- 去掉M4:0.808,0.638,75.1(−17.3)。作者称缺关键字段的病例会和可评估建议混在一起。
- 去掉M5的ECOG规则:0.800,0.667,87.8(−4.6)。作者称accuracy和F1的变化大于安全分降幅,聚合指标会把这种错分估低。
- 去掉M6:accuracy与Macro F1仍为0.912和0.898,Safety Score 78.7(−13.7)。作者称M6不改四分类,降幅等于100×0.20×F1_abs,MCI仍由M4直接标成Insufficient Information。
- 各权重±0.05并按比例重分配后,作者称九个系统的相对排序不变;各次扰动的分数没有给出。
- Simple RAG相对同模型Base LLM,两种模型的accuracy和Safety Score都更低(Table 5,GPT-4o一行见上文0.608与74.1)。作者没有单独解释。
有什么可以进一步探索的点?
作者指出癌种、模型族、事后一致性和标签同源等限制。
作者指出的局限与后续方向
- 癌种范围: 作者称基准只覆盖NSCLC和15个分子谱,扩展需要另外的证据知识库(Discussion)。
- 变异组合: 作者称罕见变异和复杂共突变remain underrepresented(Discussion)。
- 模型族: 作者称只评估了GPT-4o和GPT-4o-mini,并认为应纳入开源和医学专用LLM,以确定over-refusal是否跨模型族出现(Discussion)。
- 专家子集: 作者称50例参与了MTB-AuditAgent的改进,因此一致性是事后一致性,不是前瞻外部验证,需要独立的多中心验证(Discussion)。
- 同源设计: 作者称基准标签、证据知识库和决策规则有共同设计来源,OpenMTB-Audit上的表现不应解释为独立临床验证(Discussion)。
- 标签、权重与成本: 作者称四标签只是一种操作化,把证据支持、信息充分性和复核需求分开编码的多轴表示值得以后研究;Safety Score的权重是相对伤害判断,其他临床场景可能需要重标定;LLM基线的运行时间和API成本没有被表征(Discussion)。
实验覆盖范围
- 被测LLM为GPT-4o(gpt-4o-2024-08-06)和GPT-4o-mini(gpt-4o-mini-2024-07-18),各四种提示,另有推理期不调用LLM的MTB-AuditAgent;Table 5在500例上报告九个系统(Section 5、Table 5)。
- 病例为合成NSCLC,清洁200例、对抗300例,五类错误各60例;每例有四档参考标签、二元弃权目标和缺失信息标记。作者写明真Partially Supported为60例(Section 3、Section 7.1)。
- 专家标注为两名NSCLC肿瘤专家、分层50例(Unsupported 20例,其余标签各10例),其中30例取自AI系统之间有分歧的病例;对预测、基准和对方设盲,分歧未裁决。Section 8写明该子集在开发中被审阅(Table 4)。
- 另有各类precision/recall(Table 3)、over-refusal与false approval(Table 2)、四项模块消融(Table 6)、权重±0.05后的排序、去掉结构化分子谱标识的设置,以及扣留五个分子谱后的165例(Section 9)。accuracy的区间来自10,000次bootstrap,并报告了一次McNemar检验(Section 6、Section 9.1)。
- 论文未报告各LLM配置的重复运行次数。Discussion写明运行时间与API成本未表征。扣留五个分子谱时正文给了Safety Score的95% CI,未写该区间的重抽样次数。
总结一下论文的主要内容
基准量化临床over-refusal,七模块审计在500例上把该比例降到6.7%。
OpenMTB-Audit用合成NSCLC病例检查审计标签:给定已有治疗建议,系统要标成有证据支持、需要肿瘤专家复核、信息不够,或证据不支持。
作者认为分子上合适的治疗仍可能受ECOG、文书、既往治疗或给药顺序影响,而聚合安全分会把丢掉Partially Supported看成高安全。500例里清洁200、对抗300,五类错误各60例;Unsafe Overconfidence的60例对应Partially Supported。MTB-AuditAgent不生成治疗,推理期不调用LLM,用七个确定性模块分开核对证据、缺信息和弃权。
八种GPT-4o与GPT-4o-mini配置在这60例上的over-refusal为83.3%–100%(Table 2)。Prompt-Checklist GPT-4o的该类recall为0.00,60例中31例标成Supported、29例标成Unsupported。MTB-AuditAgent的over-refusal为6.7%,N=500的accuracy为91.2%(95% CI:88.6%–93.6%),Safety Score为92.4;相对RAG+EV GPT-4o,accuracy高35.8个百分点(McNemar p<0.001)。去掉证据核对后Safety Score为37.4(Table 6)。
两名专家与基准的κ为1.000(50/50)和0.553(34/50),分歧集中在信息是否够用,以及治疗按批准还是按optimality。作者称Agent在该子集的κ=0.833属于事后一致性,并认为该基准上的分数不应被当成独立临床验证。