跳到正文
事件持续更新

Scale AI发布DistressBench危机对话评测基准

2 篇报道2 个报道来源11 小时前更新

先了解这件事

AI 综述

Scale AI 发布 DistressBench,用 718 段由执业临床医生或危机咨询师撰写的英文心理危机对话,评估通用聊天机器人在自杀与自伤场景中是否真正提供帮助,而非只看拒绝与否。基准覆盖 23 个自杀与自伤子类别,299 段为单轮、419 段为多轮,每段对话配 6 至 20 条由临床医生撰写并按重要性加权(1 至 20)的二元标准,共 6901 条,分属识别、共情投入、降温、可操作资源、免责声明、道德评判、无害回应七个维度。在 25 个前沿模型上,表现最好的模型满足 88.4% 的加权标准,中位数模型为 71.4%,临床医生参考回答为 98.7%。

AI 根据报道生成 · 11 小时前更新

后续时间线

10月9日
  1. Scale AI Research / SEAL精选
    Scale AI 发布 DistressBench,评测大模型在自杀与自伤危机对话中的支持能力

    Scale AI 的研究团队发布 DistressBench,用执业临床医生撰写的评分标准衡量大模型在自杀与自伤对话中是否真正提供了所需支持,而不是只看模型是否拒答。该基准包含 718 段由临床医生撰写的对话,覆盖 23 个自杀与自伤子类别,每段对话配有加权评分标准,共 6,901 条,涵盖危机支持的七个维度。在 25 个前沿模型上,表现最好的模型满足 88.4% 的加权标准,中位数模型为 71.4%,临床医生参考回答为 98.7%。最大差距出现在识别危机与采取行动之间:在模型完全识别出危机的对话中,仍有 35.3% 没有把用户引向人类帮助。模型在避免有害内容上中位数得分达 94.5%,但在缓和情绪上中位数仅 46.0%,最强模型为 74.6%,作者认为这一差距主要来自产品选择,因为至少已有一个部署中的模型表现明显更好。

  2. Scale AI Research Blog精选
    Scale AI 发布 DistressBench:面向危机求助场景的临床医生撰写基准

    Scale AI 发布 DistressBench,用 718 段由执业临床医生或危机咨询师撰写的英文心理危机对话,评估通用聊天机器人在自杀与自伤场景中提供的帮助而非仅看拒绝与否。基准覆盖 23 个自杀与自伤子类别,299 段为单轮、419 段为多轮,每段对话配 6 至 20 条由临床医生撰写并按重要性加权(1 至 20)的二元标准,共 6901 条,分属识别、共情投入、降温、可操作资源、免责声明、道德评判、无害回应七个维度,得分即回复满足的加权标准比例。25 个前沿模型中,最好模型约满足 88% 的加权标准,中位数约 71%,而临床医生参考答案约达 99%。作者称最突出的失败是识别到危机却不提供帮助:在模型通过全部识别标准的对话中,约 35% 未通过至少一项可操作资源标准;中位模型在降温维度约 46%、免责声明约 8%,最好模型分别约 75% 和 85%。

相关讨论

本站还没有收集到这件事的讨论链接。

关注度走势

每天新增来源

2 天共 2 个·最多 2(10月9日)·今天 0

  • 10月9日 新增 2 个来源(2 家媒体、0 个账号)
  • 10月10日 新增 0 个来源(0 家媒体、0 个账号)

每小时关注度

当前关注度 65·可比范围峰值 67(10月9日 22:00)·近 24 小时可比范围变化 –

02040608010月9日22:0010月10日01:0010月10日05:0010月10日08:00