Scale AI 发布 CliniCARE-Bench:基于 MIMIC-IV 的临床审计智能体评测基准
CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR
AI 导读
Scale AI 研究团队发布 CliniCARE-Bench,一个由临床医生验证的基准,用于评估 AI 智能体在真实纵向 EHR 数据(MIMIC-IV)上的回顾性临床审计任务。基准包含 25 个由临床委员会编写并验证的场景,覆盖 14 个医学专科和十类推理技能,实例化为 750 个患者病例,要求智能体检索证据、应用临床政策并给出四种裁决之一(是、否、数据不足的不确定、医学上模糊的不确定)。评测不仅看准确率,还考察证据溯源、政策引用、流程合规和校准弃答。对 16 个前沿智能体系统的测试显示,原始准确率为 65.3%–76.1%,但在惩罚被禁止的推理捷径后,无缺陷准确率下降 4.8 至 14.8 个百分点,且所有系统在需要延后判断的病例上都系统性地弃答不足。
推荐理由
该基准用真实 EHR 数据考察临床审计智能体的证据溯源与校准弃答,并给出 16 个前沿系统的过程缺陷数据。