HoloCount:面向 MLLM 的整体视觉计数基准
[Daily Paper] HoloCount: A Holistic Visual Counting Benchmark for MLLMs
AI 导读
Deng 等人提出 HoloCount——一个针对多模态大语言模型的整体视觉计数基准,覆盖 1481 个独特视觉概念,并按语义计数、解析计数、鲁棒性测试三层分类诊断数值幻觉。高密度场景下性能崩塌明显:宏平均超 75% 的 Qwen3.5-27B 准确率跌至 20%,Gemini-3.1-Pro-Preview 仅 49.0%(MAE 10.46)。空目标提示子集中还出现反向悖论,轻量模型优于大型专有引擎,反映其不愿输出计数为零的过度自信倾向。