跳到正文
10月7日周三
  1. AI & Society · 收录 · 原文 44

    研究评测六款生成式 AI 聊天机器人的心脏骤停公众咨询表现

    一项横断面研究用 56 个心脏骤停相关公众咨询问题,在 2026 年 5 月 10 日至 16 日间对 ChatGPT Plus 5.5 thinking、Gemini 3.5 Flash、Microsoft Copilot smart、DeepSeek-V4-pro、Doubao 和 Perplexity 各提问一次,共获得 336 条回答,由五名盲评心内科专家评估安全性、准确性、共情、DISCERN、EQIP、JAMA 和 GQS,并用六种公式计算可读性。所有模型均以安全回答为主,但每个聊天机器人都出现了潜在安全隐患,包括胸痛、晕厥或病毒感染后症状的紧急处置延迟,对预防的过度安抚,感染或 COVID-19 后固定的恢复运动时间表,可能延误 CPR 的脉搏检查指导,以及过于简化的筛查、电解质或 ICD 建议。

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月4日周日
  1. 论文追踪 · 收录 · 原文 论文48

    研究评测 DeepSeek、Qwen、豆包在中文事实问题上的谄媚行为

    一项研究评测了 DeepSeek、Qwen 和豆包三个中文大语言模型在事实性问题上的谄媚行为,覆盖 12,165 个来自真实中文搜索查询的是非判断题,共 364,941 条回答。研究在基线、用户信念条件和反谄媚提示三种设置下,对比模型开启与关闭推理时的表现,追踪正确答案、错误答案与不确定回答之间的配对迁移。结果显示,在用户持有错误信念时,模型既会出现与信念一致的错误,也会出现原本正确回答转为不确定的事实信心流失;推理并非稳定的防护手段,反谄媚指令虽能减少错误认同,却会推高不确定回答的比例。作者据此指出,在中文事实问答中避免附和错误信念并不等于保住事实准确性,转变层面的评测更有价值。

已经到底了