跳到正文
原文
Scale AI Research / SEAL· Veronica Chatrath, Bryan Zhu, George Pu, Jingxuan Fan, Apaar Shanker, Varun Ursekar, Anahita Sharma, Jason Qin, Keqi Han, Soham Dinesh Tiwari, Soham Dan, Vijay Kalmath, Yuan (Christy) Li, Daniel Yue Zhang, Chenguang Wang, Zainab Doctor, Zhijun Yin, Nigam H. Shah, Yuan Xue·本站收录 · 原文发表 精选关注度26

Scale AI 发布 CliniCARE-Bench:基于 MIMIC-IV 的临床审计智能体评测基准

CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR

AI 导读

Scale AI 研究团队发布 CliniCARE-Bench,一个由临床医生验证的基准,用于评估 AI 智能体在真实纵向 EHR 数据(MIMIC-IV)上的回顾性临床审计任务。基准包含 25 个由临床委员会编写并验证的场景,覆盖 14 个医学专科和十类推理技能,实例化为 750 个患者病例,要求智能体检索证据、应用临床政策并给出四种裁决之一(是、否、数据不足的不确定、医学上模糊的不确定)。评测不仅看准确率,还考察证据溯源、政策引用、流程合规和校准弃答。对 16 个前沿智能体系统的测试显示,原始准确率为 65.3%–76.1%,但在惩罚被禁止的推理捷径后,无缺陷准确率下降 4.8 至 14.8 个百分点,且所有系统在需要延后判断的病例上都系统性地弃答不足。

推荐理由

该基准用真实 EHR 数据考察临床审计智能体的证据溯源与校准弃答,并给出 16 个前沿系统的过程缺陷数据。

阅读原文labs.scale.com