研究在 11 个开源 LLM 潜空间中发现临床概念中心
Clinical Concept Centers in LLMs
AI 导读
研究将临床决策支持中的模型行为评测从文本输出延伸到潜空间,检验临床概念是否作为可定位、被因果使用的表征存在于开源权重 LLM 内部。作者在测试的全部 11 个开源模型中均找到专门的临床概念中心,这些中心可解释,只对与其对齐的临床叙述激活,并在受限和开放式场景中因果驱动模型行为。在评测层面,模型在对抗性角色设定下仍保持内部一致并继续使用相关概念中心,而对齐的角色设定能提升下游临床表现;在性能层面,模拟真实部署场景时沿这些概念中心进行引导可带来下游改进。研究还进行了盲法临床医生验证,发现这些概念中心的激活与使用能预测临床医生的偏好。