Scale AI 发布 CliniCARE-Bench:临床 Agent 常因错误理由答对
CliniCARE-Bench: Clinical AI Agents Can Be Right for the Wrong Reasons
AI 导读
Scale AI 发布 CliniCARE-Bench,在 25 个临床场景、750 个来自 MIMIC-IV 的真实病例上评测 16 个智能体系统,四选一准确率最高仅 76.1%,最低 65.3%。该基准要求 Agent 在受治理、全程记录的工具环境中调查病例,并给出 Yes、No、Indeterminate: Lack of Data 或 Indeterminate: Medically Ambiguous 四种结论。若只认可既正确又未使用专家临床委员会禁止的捷径的结论,各系统得分下降 4.8 至 14.8 个百分点,排名也随之变化,Gemini-3.1-Pro 从 72.7% 降至 57.9%。所有系统都存在过度下结论,比例在 21.3% 至 55.3% 之间,而过度弃权仅 7.3% 至 16.5%。代码已在 GitHub 开源,论文见 arXiv。
推荐理由
Scale AI 用 750 个真实病例评测 16 个临床 Agent,把过程合规与答案正确分开计分,为高风险 Agent 的可审计评测提供了可迁移的框架。