研究:无关信息污染患者病历并干扰 LLM 临床推理
Incidental information contaminates patient notes and disrupts clinical reasoning in LLMs
AI 导读
研究评估了大语言模型在临床记录与推理中对患者就诊无关信息的敏感度。在 576 段医患对话中,前沿模型把闲聊内容写入 35% 的病历,五分量表上的平均质量分变化最多 0.20 分;3.7% 的前沿模型病历出现对旁白的错误归属或临床误用。在 57 段模拟录音问诊中,来自另一场就诊的背景语音以 -10 dB 混入,48.2% 的转写文本受到污染,四个开放权重模型生成的后续病历中有 5.3% 检出污染。作者提出临床推理与干扰的双重编码假说,初步证据显示易受无关信息干扰的 LLM 组件同时也支撑临床推理,并建议在临床使用前评测模型对无关信息的抵抗能力。