分析与理论arXiv 2609.30467
研究提出医疗答案事实核查失败分类法,指出检索后验证范式的固有局限
归纳开放式医学长答案检索核验的失败分类
- arXiv
- 2609.30467
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- GPT-5.4、Mistral Small 3 (24B-Instruct-2501)、Mistral Small 4 (119B-2603) 等 8 个
- 组件RAG
摘要作者把开放式低召回归为证据是否在库、能否被定位,以及与声明是否对齐。
这篇工作诊断开放式医学事实核验的 retrieve-then-verify 管线断在哪里,而不是提出新的核验器。