跳到正文
原文
Google DeepMind·本站收录 · 原文发表 精选关注度45

Google DeepMind 与 Kaggle 推出 FACTS Benchmark Suite,系统评估大语言模型事实性

FACTS Benchmark Suite: Systematically evaluating the factuality of large language models

AI 导读

Google DeepMind 与 Kaggle 推出 FACTS Benchmark Suite,在原有 FACTS Grounding 之外新增参数知识、搜索和多模态三项事实性基准,共 3,513 个公开样例。四个基准各设公开集与私有留出集,FACTS Score 取四个基准公开与私有集的平均准确率,由 Kaggle 管理私有集、测试模型并维护公开排行榜。评测的 15 个领先模型中 Gemini 3 Pro 总分最高,为 68.8%;从 Gemini 2.5 Pro 到 Gemini 3 Pro,FACTS Search 错误率下降 55%,FACTS Parametric 下降 35%。所有受测模型的总体准确率均低于 70%,多模态基准得分普遍最低。

推荐理由

FACTS 套件把事实性拆成四类基准并公布 15 个模型的得分,便于横向比较不同模型的知识可靠性。

阅读原文deepmind.google