跳到正文
原文
Hugging Face Daily Papers· arXiv:2609.30467·本站收录 · 原文发表

研究提出医疗答案事实核查失败分类法,指出检索后验证范式的固有局限

Where Does Retrieval-Based Open-Ended Evaluation Fail? Automatic Taxonomy Induction from Long-Form Medical Answer Factuality Verification

AI 导读

研究者针对开放式医疗答案的事实性验证,提出两套失败分类法,把失败拆解为检索阶段的五类质量维度错误和验证器推理的六个连续步骤错误。研究基于 MedExpert 开放式数据集和 3 个封闭式数据集开展案例研究,并用 LLM-as-Judge 自动归纳模式,对证据质量和验证器推理错误进行大规模标注。在 4 种检索方法和 6 个前沿验证模型上的压力测试显示,扩大模型规模、增加推理投入、引入权威网络来源以及医疗微调都无法消除这些失败模式,说明它们是检索后验证范式在开放式医疗场景中的固有局限,而非旧系统的产物。代码与数据已公开。

阅读原文huggingface.co