ClinMM-Bench 评测 15 个多模态大模型的多轮临床诊断推理
[Daily Paper] Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases
AI 导读
Yang 等人提出 ClinMM-Bench,用 1,089 个来自已发表病例报告的疑难病例和 3,760 张医学图像,评测 15 个多模态大模型在多轮渐进披露信息下的临床诊断推理。基准覆盖皮肤科、急诊、内科、肾内科、神经内科、肿瘤、眼科和放射科八个专科,平均分 5.45 轮对话披露信息,由 GPT-5-medium 和 Claude-4.5-Sonnet 作为独立评审按 0 到 2 分打分。作者将失败归纳为信息综合失败、知识映射错误、感知错误、过早结论和视觉幻觉五类,并发现医学专精在 27B 规模上收益消失、延长推理轨迹未稳定提升准确率且常降低事实召回,神经内科(0.949)和眼科(0.931)得分最高,内科(0.665)和放射科(0.646)最难。作者认为当前模型缺乏自主临床使用所需的推理忠实性,仅靠准确率不足以作为医疗 AI 的安全指标。