Google DeepMind 与 Kaggle 推出 FACTS Benchmark Suite,系统评估大语言模型事实性
FACTS Benchmark Suite: Systematically evaluating the factuality of large language models
AI 导读
Google DeepMind 与 Kaggle 推出 FACTS Benchmark Suite,在原有 FACTS Grounding 之外新增参数知识、搜索和多模态三项事实性基准,共 3,513 个公开样例。四个基准各设公开集与私有留出集,FACTS Score 取四个基准公开与私有集的平均准确率,由 Kaggle 管理私有集、测试模型并维护公开排行榜。评测的 15 个领先模型中 Gemini 3 Pro 总分最高,为 68.8%;从 Gemini 2.5 Pro 到 Gemini 3 Pro,FACTS Search 错误率下降 55%,FACTS Parametric 下降 35%。所有受测模型的总体准确率均低于 70%,多模态基准得分普遍最低。
推荐理由
FACTS 套件把事实性拆成四类基准并公布 15 个模型的得分,便于横向比较不同模型的知识可靠性。