跳到正文
原文
Failure-First·· 2026-08-20

HoloCount:面向 MLLM 的整体视觉计数基准

[Daily Paper] HoloCount: A Holistic Visual Counting Benchmark for MLLMs

AI 导读

Deng 等人提出 HoloCount——一个针对多模态大语言模型的整体视觉计数基准,覆盖 1481 个独特视觉概念,并按语义计数、解析计数、鲁棒性测试三层分类诊断数值幻觉。高密度场景下性能崩塌明显:宏平均超 75% 的 Qwen3.5-27B 准确率跌至 20%,Gemini-3.1-Pro-Preview 仅 49.0%(MAE 10.46)。空目标提示子集中还出现反向悖论,轻量模型优于大型专有引擎,反映其不愿输出计数为零的过度自信倾向。

阅读原文failurefirst.org