Scale AI 发布 DistressBench,评测大模型在自杀与自伤危机对话中的支持能力
DistressBench: Evaluating Multi-Dimensional Crisis Support in Large Language Models
AI 导读
Scale AI 的研究团队发布 DistressBench,用执业临床医生撰写的评分标准衡量大模型在自杀与自伤对话中是否真正提供了所需支持,而不是只看模型是否拒答。该基准包含 718 段由临床医生撰写的对话,覆盖 23 个自杀与自伤子类别,每段对话配有加权评分标准,共 6,901 条,涵盖危机支持的七个维度。在 25 个前沿模型上,表现最好的模型满足 88.4% 的加权标准,中位数模型为 71.4%,临床医生参考回答为 98.7%。最大差距出现在识别危机与采取行动之间:在模型完全识别出危机的对话中,仍有 35.3% 没有把用户引向人类帮助。模型在避免有害内容上中位数得分达 94.5%,但在缓和情绪上中位数仅 46.0%,最强模型为 74.6%,作者认为这一差距主要来自产品选择,因为至少已有一个部署中的模型表现明显更好。
推荐理由
DistressBench 用临床医生撰写的评分标准衡量模型在自杀与自伤对话中的实际支持质量,而非只看是否拒答,并给出 25 个前沿模型的差距分布。
阅读原文