分享意愿问题为 LLM 虚假信息调查评分增加了什么?一项审计研究
What Does a Sharing Question Add? Auditing LLM Survey Scores for Misinformation
AI 导读
研究审计了 8 个模型版本在 290 篇合成虚假信息文章上的评分,使用 1,256 份配对调查回答和 317 个参与者标识作为外部效度标准。可信度评分可解释模型分享评分 30.8-72.5% 的变异,但将模型分享评分加入人类与模型可信度评分后,误差仅减少 -0.25% 至 +0.69%,所有探索性区间均跨零。分享回答包含可信度评分之外的结构化变异,但在该数据中未确立对人类分享行为的增量效度。