跳到正文
原文
论文追踪· arXiv:2609.20684· Albattra, Hassan Saeed Hassan; Bahgat, Mazen Mohammed; Ferdousi, Rahatara; Amrya, Hana Essam Sayed Ahmed; Mousa, Mariam·本站收录 · 原文发表

HerHealthEval:评测大语言模型对多语言女性健康沟通的理解

HerHealthEval: Evaluating Multilingual and Register-Sensitive Understanding of Women's Health Communication

AI 导读

研究者提出 HerHealthEval,一个针对女性健康沟通多语言理解能力的受控评测框架,覆盖英语、法语和现代标准阿拉伯语。每个临床案例提供六种沟通形式:规范、临床、外行、间接或含糊、情绪担忧以及刻意信息不足,前五种保留相同临床信息,最后一种故意省略细节以测试模型是否意识到需要追问。研究评测了一个多语言指令模型及 QLoRA 适配变体,考察关切分类、风险校准、追问行为、解析合规和跨形式一致性。结果显示聚合准确率和一致性会掩盖与安全相关的失败:在语言不对称风险监督下,多语言适配模型在法语和阿拉伯语上的分诊不足率达到 0.994;改用源自数据、语言不变的风险标签重新适配后,分诊不足率分别降至 0.572 和 0.558。论文认为稳健的多语言医疗评测需要显式测试语域变化、不确定性处理以及适配标签的来源与不变性。

阅读原文arxiv.org