跳到正文
原文
论文追踪· arXiv:2606.24115· Aminu Lawal, Niyoj Oli, Sachin Acharya, Prashnna Gyawali, Maria Carmen Romano, Binod Bhattarai·本站收录 · 原文发表

Gut-VLM 基准:九种幻觉检测方法在胃肠道内镜 VLM 上的评测

A Benchmark for Hallucination Detection in VLMs for Gastrointestinal Endoscopy

论文速读

评测与基准

据论文 PDF 整理(AI 生成),以原文为准

比较九种幻觉检测后,ReXTrust在Gut-VLM、MedGemma-4B上AUC为92.99,五模型均最高。

问题
胃肠道内镜VQA里,VLM可能给出与图像不符的回答,作者称这阻碍临床安全部署。幻觉检测此前多在放射学基准上评估,作者要检验这些方法在GI内镜上的表现。
方法
在Gut-VLM上用统一流水线比较九种检测器。黑盒看多样本一致性,灰盒看token概率、熵或语义聚类,白盒把ReXTrust改到中间层隐藏状态上训练。GREEN对照专家参考答案,分数低于1.0标为幻觉。
实验与结果
Table 1中ReXTrust在五模型上AUC均最高,MedGemma-4B为92.99。配对置换检验相对各模型AUC最高的非白盒均p<0.001。作者称平均而言token级灰盒高于聚类与黑盒;自信虚构会使这两类非白盒失效。
局限与可以继续做的
作者在4.5节写:ReXTrust每模型训练样本至多2400;只在Gut-VLM上评单轮VQA;标签依赖GREEN,可能漏掉技术不精确但临床可接受的临界错误;只评了ReXTrust一种白盒方法。论文未报告GREEN与人工一致性。
实验设置MedGemma-4B、MedGemma-27B 等 · Gut-VLM · AUC、AUPRC
被测模型
MedGemma-4BMedGemma-27BLLaVA-Med-7BLLaVA-v1.6-7B (Mistral)Lingshu-32B
基准
Gut-VLM
指标
AUCAUPRC
AI 导读一项被 MIUA 2026 接收的研究在 Gut-VLM 数据集(4,392 个胃肠道诊断 VQA 测试对)上评测了九种幻觉检测方法,覆盖 MedGemma-4B、MedGemma-27B、LLaVA-Med-7B、LLaVA-v1.6-7B 和 Lingshu-32B 五个 VLM。白盒方法 ReXTrust 在全部五个模型上取得最高 AUC,在 MedGemma-4B 上峰值达 93.0,较各模型最强对比方法均有统计显著优势(配对置换检验 p < 0.001);白盒隐状态访问平均带来 19.5 AUC 点的增益(区间 9.5–33.5),在 LLaVA-v1.6-7B 上仍保持 AUC 79.9,而黑盒与基于聚类的灰盒方法在该模型上接近随机水平。研究还指出"自信虚构"(模型以高样本间一致性或高 token 概率产生幻觉)是一致性与不确定性方法的系统性失效模式。

一项被 MIUA 2026 接收的研究在 Gut-VLM 数据集(4,392 个胃肠道诊断 VQA 测试对)上评测了九种幻觉检测方法,覆盖 MedGemma-4B、MedGemma-27B、LLaVA-Med-7B、LLaVA-v1.6-7B 和 Lingshu-32B 五个 VLM。白盒方法 ReXTrust 在全部五个模型上取得最高 AUC,在 MedGemma-4B 上峰值达 93.0,较各模型最强对比方法均有统计显著优势(配对置换检验 p < 0.001);白盒隐状态访问平均带来 19.5 AUC 点的增益(区间 9.5–33.5),在 LLaVA-v1.6-7B 上仍保持 AUC 79.9,而黑盒与基于聚类的灰盒方法在该模型上接近随机水平。研究还指出"自信虚构"(模型以高样本间一致性或高 token 概率产生幻觉)是一致性与不确定性方法的系统性失效模式。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    在GI内镜VQA上比较九种幻觉检测方法,检验放射学方法能否迁移。

    在胃肠道内镜VQA中,已有幻觉检测方法能否标出与影像不符的回答。

    • 临床场景:作者称VLM能联合解读影像并回答诊断问题,但幻觉是语言合理、却与视觉证据不一致的输出。在内镜里,这可以表现为漏检息肉,或报告并不存在的病灶;作者称这会威胁真实部署所要求的安全。
    • 现有评测的缺口:作者称检测评测多在MIMIC-CXR、SLAKE、PathVQA、VQA-RAD等放射学数据上。GI内镜有不均的图像质量、变化的光照和随器官变化的外观;息肉、溃疡性结肠炎、食管炎和解剖标志也与放射学所见不同。作者称因此看不出放射学上验证过的方法能否迁移。
    • 访问层级上的取舍:作者称现有方法按可访问的模型信息不同,在准确率、计算成本和部署可达性之间取舍。黑盒只用生成文本,灰盒用token分布,白盒用隐藏状态。
    • 本文的基准:在Gut-VLM测试集的4,392个VQA对上,用统一流水线比较九种方法、五个VLM。标签由GREEN对照专家核对过的参考答案生成,不由检测器自己产生。
    • 要单独看的失败模式:作者把confident confabulation定义为模型以高样本间一致性或高token概率产生幻觉。作者称这时一致性检测和不确定度检测会一起失效。
  2. 有哪些相关研究?

    检测方法按黑盒、灰盒、白盒组织;放射学基准迁移到GI内镜尚不清楚。

    论文没有独立的Related Work节,相关讨论在引言和方法说明里。

    医学VLM与临床幻觉

    • 报告与问答:作者引用医学报告生成工作,并称VLM可联合解读临床影像、对诊断问题生成自然语言回答。
    • 幻觉定义:作者将幻觉写成语言合理但与视觉证据不一致;高风险场景中可表现为漏检或虚假病灶。

    放射学上的检测评测

    • 被点名的数据:MIMIC-CXR、SLAKE、PathVQA、VQA-RAD。论文只把它们当作既有评测集中的领域,没有在本文报告这些集上的数字。
    • 作者的对比:作者称GI内镜的成像条件和病灶外观不同于放射学,因此那些数据上验证过的方法能否迁到内镜并不清楚。

    按访问层级引用的检测器

    • 黑盒:RadFlag(Zhang等,2025)面向医学VLM,用多次随机样本与主回答的蕴含一致性打分。SelfCheckGPT(Manakul等,2023)不访问模型内部,用NLI判断主回答句子是否被其他样本否定。
    • 灰盒:Li等(2024)给出无参考的token级不确定度。Semantic Entropy(Farquhar等,2024)把随机样本分成语义等价类再算熵。VASE(Liao等,2025)在医学VQA里额外使用弱视觉扰动下的样本。
    • 白盒:ReXTrust(Hardy等,2025)面向AI生成的放射学报告,用隐藏状态做细粒度幻觉检测。作者称本文把该框架改用于GI内镜VQA,而不是原样报告放射学结果。

    数据、标签与内部信号

    • Gut-VLM:Khanal等(2025)基于Kvasir-v2(Pogorelov等,2017)构建,参考答案经专家核对。本文用它做评测集。
    • GREEN:Ostmeier等(2024)的生成式放射学报告评价。本文用它对照参考答案产生幻觉标签。
    • 内部信号:作者引用先前工作称,幻觉时内部注意力与视觉token的对齐下降,更深层激活会偏离有依据回答的模式。这是作者解释白盒优势时引用的说法。

    比较对象:九种检测器在Gut-VLM上互比。论文未另列外部检测器作为基线。指标是AUC与AUPRC。

    作者把本文定位为同一条件下比较多类方法,并分析内镜图像上的检测行为。贡献列表还称,放射学基准上验证过的方法未能可靠迁移,尤其在通用VLM上,全部非白盒方法接近随机。

  3. 论文如何解决这个问题?

    在Gut-VLM上用统一流水线比较三类访问层级的九种检测方法。

    作者不提出新的检测器结构,而是在Gut-VLM上用同一套推理和标签,比较黑盒、灰盒、白盒共九种方法;白盒侧是把ReXTrust改编到GI内镜VQA。 Fig. 1把图像-问题对送入五个VLM,取出隐藏状态、token概率和回答,再由GREEN独立出标签,用AUC和AUPRC评估。

    数据与被测模型

    • 图像与类别:Gut-VLM基于Kvasir-v2,共1,816张内镜图、八类。正常标志为Cecum、Pylorus、Z-line;病理为Polyps、Oesophagitis、Ulcerative Colitis、Dyed-resected-margins、Dyed-lifted-polyps(Fig. 2)。
    • 划分与问题:沿用原工作的分层20%留出。训练1,450图、17,400个QA;测试366图、4,392个QA。每图12个结构化视觉问题,用来探不同临床推理维度。论文未在正文列出这12问的原文。
    • 五个VLM:MedGemma-4B与MedGemma-27B用Gemma 3骨干和SigLIP,医学图文覆盖放射、皮肤和病理。LLaVA-Med-7B用CLIP ViT-L/14和7B LLaMA,在约600,000条PMC生物医学图文指令上微调。Lingshu-32B是DAMO的32B医学通用VLM。LLaVA-v1.6-7B(Mistral)基于LLaVA-NeXT,论文称未在医学数据上训练。

    检测问题的形式化

    模型对图像x和问题q自回归生成回答y及逐步token分布。中间层l取层数除以2后向下取整,抽出隐藏状态;第0行是最终提示token,其后是生成token。作者把含有不能由(x, q)支持的断言的回答视为幻觉。

    分数超过阈值即判为幻觉:ŷhall=1[h(x,q,u)>τ]。三类方法只在可访问信息u上不同:黑盒用随机样本,灰盒用token分布,白盒用隐藏状态。

    黑盒与灰盒

    • 黑盒:不访问状态、logit或参数。RadFlag用主回答与随机样本的蕴含一致性打分。SelfCheckGPT-NLI用DeBERTa-v3-large检查主回答各句是否被其余样本否定,常被否定的句子标为幻觉。
    • token级灰盒:只来自一次贪心解码,不另采随机样本。AvgProb、MaxProb是有效token负对数概率的均值和最大值;AvgEnt、MaxEnt是各步完整输出分布香农熵的均值和最大值。四者都是不确定度分数,越高越倾向判为幻觉。
    • 聚类灰盒:Semantic Entropy要求temperature大于0的随机样本,用凝聚聚类分成语义等价类,相似度是DeBERTa-v3-large的NLI蕴含分,再对簇分布用模型似然算熵。VASE另外在弱视觉扰动图像上采样。论文未写扰动的具体形式。

    白盒ReXTrust与标签

    • 取层:隐藏状态取中间层。MedGemma-4B为第9层,MedGemma-27B为第14层,LLaVA-Med-7B与LLaVA-v1.6-7B为第16层,Lingshu-32B为第32层。论文未写分类器的层数或宽度。
    • 训练:用Gut-VLM训练集,每模型至多2,400个样本,5折交叉验证。GroupKFold把同一图像的12个QA放进同一折。五折模型做权重平均。训练用WeightedRandomSampler、余弦退火学习率和梯度裁剪(max norm 1.0)。论文未写学习率、批大小或优化器名称。
    • 标签:GREEN对照专家参考答案打0到1分。1.0为非幻觉,低于1.0为幻觉,表示至少一个临床不准确。作者称1.0是GREEN里的自然二分:恰好1.0表示所评临床维度全部事实对齐。同一规则既做测试标签,也做ReXTrust的训练标签。作者称该准则偏保守。

    统一推理与判定

    • 硬件与量化:单张NVIDIA A100;INT8权重(BitsAndBytes),激活bfloat16;回答上限128 token。九种方法共用一次贪心主回答和一条GREEN标签。
    • 随机采样:SelfCheckGPT-NLI、RadFlag、Semantic Entropy、VASE均为每问N=10、temperature 1.0、top-p 0.9。
    • 指标:AUC是阈值无关的主指标。AUPRC更受幻觉发生率影响;同一模型内各方法幻觉率相同,因此AUPRC只在模型内比较。作者计划在论文接收后公开代码。
  4. 论文做了哪些实验?

    ReXTrust五模型AUC均最高,配对置换检验均p<0.001。

    实验设置

    • 数据:Gut-VLM测试集366张图、4,392个QA对,八类,每图12问。训练划分1,450图、17,400个QA,只用于ReXTrust。
    • 被测VLM:MedGemma-4B、MedGemma-27B、LLaVA-Med-7B、LLaVA-v1.6-7B(Mistral)、Lingshu-32B。论文称最后一款未做医学域训练。
    • 检测器:黑盒为RadFlag、SelfCheckGPT-NLI;灰盒为AvgProb、AvgEnt、MaxProb、MaxEnt、Semantic Entropy、VASE;白盒为ReXTrust。九者互比,论文未另设外部检测器。
    • 推理:单卡A100,INT8权重、bfloat16激活,回答上限128 token。随机方法N=10、temperature 1.0、top-p 0.9;四项token统计来自一次贪心解码。
    • 标签与指标:GREEN分数低于1.0为幻觉,等于1.0为非幻觉。主指标AUC,并报告AUPRC。论文未报告GREEN与人工标签的一致性,也未报告整套评测的重复次数。
    • 检验:ReXTrust对每个模型AUC最高的非白盒方法做QA对水平配对置换检验,N=2,000,并对五次比较做Bonferroni校正(αadj=0.01)。

    主结果

    下表AUC取自Table 1,单位为%。Δ是第3.3节作者给出的、相对该列AUC最高非白盒方法的差值。幻觉率在同一模型的九种方法间相同。

    表格较宽,可左右滑动

    模型幻觉率ReXTrustAUC最高的非白盒作者给出的Δ
    MedGemma-4B76.5%92.99MaxEnt 59.46+33.5
    LLaVA-Med-7B57.3%90.46SelfCheckGPT-NLI 76.30+14.2
    LLaVA-v1.6-7B74.0%79.91AvgEnt 56.32+23.6
    MedGemma-27B61.1%90.39MaxProb 80.93+9.5
    Lingshu-32B44.1%91.43MaxEnt 74.70+16.7
    • 白盒排序:作者称ReXTrust在五个模型上AUC都最高;五次比较的p均小于0.001,Bonferroni校正后仍成立。作者称平均优势为19.5个AUC点,结论另给中位数16.7,范围9.5–33.5。摘要和结论把MedGemma-4B的峰值写成93.0,与Table 1的小数写法不同。
    • 非白盒的平均与例外:作者称token级灰盒是第二类,平均AUC为60–66,在更大的医学VLM上更接近ReXTrust。这是平均说法。Table 1的反例是LLaVA-Med-7B:SelfCheckGPT-NLI为76.30,高于该列MaxEnt的61.60。作者称LLaVA-v1.6-7B上黑盒和聚类灰盒接近随机(写成45.6–55.5),token级为52.4–56.3。
    • 低于50的AUC:Table 1中RadFlag在MedGemma-4B上为37.03,作者称低于随机;SelfCheckGPT-NLI在Lingshu-32B上为42.76;Semantic Entropy在MedGemma-4B上为39.32。作者称AUPRC受各模型幻觉率影响,不宜跨模型直接比。

    自信虚构

    • 比例:作者把样本间一致度不低于0.8的幻觉称为confident confabulation。五模型上它占幻觉样本的0.0%–20.4%,占全部幻觉样本的8.9%。点名最高的是Lingshu-32B 20.4%、MedGemma-4B 15.3%、MedGemma-27B 11.6%。论文未写0.0%对应哪一个模型。
    • Fig. 5:一张Cecum图像上,Lingshu-32B的10次随机样本中有8次给出Colon,2次给出正确的Cecum。SelfCheckGPT-NLI分数为0.1050。作者称0表示样本间完全一致、1表示完全矛盾,因此该分数会被排到非幻觉一端,而GREEN仍标为幻觉。
    • 作者的解释:SelfCheckGPT-NLI假设幻觉表现为样本间不一致,事实会稳定复现。作者称这在开放域文本中成立,但医学VQA里模型可以每次都给出同一个错误答案。他们称AvgProb、AvgEnt、MaxProb、MaxEnt同样受影响:错误token若概率高、熵低,会被当成非幻觉。Lingshu-32B回答平均2.96个词,87.3%不超过三词。作者称它虽是医学通用VLM,但未专门针对GI内镜解剖优化。

    非白盒平均水平

    • 作者给出的平均AUC:MaxEnt 66,MaxProb 64;Semantic Entropy 48.7,VASE 48.4;SelfCheckGPT-NLI 56.2;RadFlag 45.9。
    • 采样与收益:作者称Semantic Entropy和VASE即使用N=10,在五个模型上仍低于单次贪心的token级方法,并认为其收益依赖于生成多样性;输出短且确定时,多样性下降。
    • 无医学训练时:作者认为LLaVA-v1.6-7B上隐藏状态可能仍保留可区分的幻觉信号。这是对Table 1的解读,不是干预实验。第4.1节把白盒优势写成平均19.5个AUC点,并引用先前工作解释注意力与更深层激活。

    部署讨论中的操作点

    • 启发式参考:作者把AUC不低于75当作比较用参考,并写明这不是临床验证过的部署阈值。作者称ReXTrust在五模型上达到(写成79.9–93.0);MaxEnt与MaxProb在MedGemma-27B上达到(写成80.9,Table 1为80.85与80.93);SelfCheckGPT-NLI在LLaVA-Med-7B上达到(写成76.3,Table 1为76.30)。作者称MedGemma-4B和LLaVA-v1.6-7B上没有非ReXTrust方法达到该参考。
    • 召回优先:作者讨论人在回路、优先高召回的流程。作者认为在80%召回的阈值上,ReXTrust可能以可接受的精确率工作;论文未报告该点的精确率或误报数。作者称息肉和染色切除缘错误直接可行动且可能有害,解剖标志误识的即时危险较低;论文未按错误类型拆开AUC。
    • 代价:作者称白盒需要开源模型和按VLM分开的训练数据。无logit时,他们更倾向SelfCheckGPT-NLI,但短而自信的回答上会失效。作者称黑盒每输入生成N=10次,会给每次临床会话带来数小时额外计算;论文未报告实测耗时。

    其他消融与分析

    • 论文未报告N、温度、top-p、GREEN阈值或分类器结构的消融数字。第3.1节称替代阈值的敏感性在第4.5节说明,第4.5节未给其他阈值的结果。
    • 固定推理:N=10,temperature 1.0,top-p 0.9,贪心主回答,128 token上限,INT8,单卡A100。
    • ReXTrust层索引固定为9、14、16、16、32,不是扫层实验。
    • Table 1中ReXTrust的AUPRC,按表头列序为97.17、90.71、92.21、92.50、88.89。
    • Fig. 4只说明GREEN把1.0标成非幻觉、把0.0标成幻觉;论文未给这两例的检测器分数。Fig. 3是AUC热图,图注称高值偏绿、低值偏红;逐格数字以Table 1为准。
  5. 有什么可以进一步探索的点?

    作者指出训练样本、单数据集、单轮VQA、GREEN标注和仅一种白盒方法等限制。

    作者指出的局限与后续方向

    • 训练规模:ReXTrust的这一改编每模型最多用2,400个Gut-VLM训练样本,作者将其写成计算资源约束(第4.5节)。
    • 数据范围:结果只在一个GI内镜数据集Gut-VLM上评估(第4.5节)。
    • 交互形式:只评了单轮VQA。作者写,多轮对话里幻觉可能累积的情形不在范围内(第4.5节)。
    • 标签:真值依赖GREEN。作者称它可能未捕获全部临床重要错误,尤其技术上不精确但临床可接受的临界情形(第4.5节)。
    • 白盒种类:只评了ReXTrust一种白盒方法。作者称多数当代白盒方法需要完整注意力矩阵或隐藏状态;对LLaVA-v1.6-7B和Lingshu-32B这类固定patch、动态patch数的VLM,每图约2,400个图像token,注意力矩阵很大,计算上难以承担(第4.5节)。

    第4.5节没有另列具体的后续实验。第3.1节称替代标注阈值的敏感性在第4.5节说明,但该节没有给出其他阈值的数字。

    实验覆盖范围

    • 模型与规模:五个VLM都在Gut-VLM测试集上报告了AUC和AUPRC;测试集为366张图、4,392个QA对,训练划分为1,450张图、17,400个QA对(第2.1、3.3节,Table 1)。
    • 方法与采样:九种检测器覆盖黑盒、token级灰盒、聚类灰盒和一种白盒,共用贪心回答与GREEN标签;随机方法为N=10、temperature 1.0、top-p 0.9(第3.1节)。
    • 判定与检验:幻觉标签为GREEN分数低于1.0;主指标为AUC,并报告AUPRC;ReXTrust与每模型AUC最高非白盒方法的配对置换检验为N=2,000(第3.2–3.3节)。
    • 白盒训练:中间层隐藏状态,每模型至多2,400样本,5折GroupKFold且按图像分组,五折权重平均(第3.1节)。
    • 论文未报告的项目:GREEN与人工标注的一致性、替代阈值下的检测数字、整套评测的重复次数,以及本文在MIMIC-CXR、SLAKE、PathVQA、VQA-RAD上的对照结果。多轮对话,以及第4.5节所述需要完整注意力矩阵的其他白盒方法,作者写明不在本次评测中。
  6. 总结一下论文的主要内容

    九种检测方法在Gut-VLM五模型上的比较中,ReXTrust的AUC均为最高。

    这是一个胃肠道内镜VQA幻觉检测的比较基准,不是新检测器结构的提出。

    • 问题:VLM的回答可以语言通顺,却与内镜图像不一致。作者称既有评测集中在放射学数据,这些方法能否用于GI内镜并不清楚。漏检息肉或报告不存在的病灶,被作者写成部署时的安全问题。
    • 做法:Gut-VLM测试集有4,392个QA对。五个VLM、九种方法共用贪心回答和GREEN标签。黑盒看样本一致性,灰盒看token不确定度或语义簇的熵,白盒在中间层隐藏状态上训练改编后的ReXTrust。GREEN分数低于1.0标为幻觉。
    • 主结果:Table 1里ReXTrust的AUC在五个模型上都最高。作者给出的差值从9.5到33.5,平均19.5,结论中的中位数为16.7,配对置换检验均p<0.001。摘要把MedGemma-4B写成93.0,Table 1为92.99。LLaVA-v1.6-7B上为79.91;作者称该模型上黑盒和聚类灰盒接近随机。
    • 非白盒与失败模式:作者称平均而言token级灰盒高于聚类方法和黑盒。表格反例是LLaVA-Med-7B:SelfCheckGPT-NLI为76.30,高于MaxEnt的61.60。MedGemma-27B上MaxProb为80.93。自信虚构占全部幻觉样本的8.9%,在Lingshu-32B的幻觉样本中占20.4%。作者称高度一致或高概率的错误回答,会使一致性分数和熵都指向非幻觉。
    • 作者的结论:作者认为这一基准上,白盒隐藏状态在五个模型上都有AUC优势;不开源时,MaxEnt和MaxProb的平均AUC更高。作者认为检测策略不能未经特定架构验证就从放射学基准搬到GI内镜,并把AUC不低于75只当作比较参考,而不是临床部署阈值。
阅读原文arxiv.org