ChartHal:评估大型视觉语言模型图表理解幻觉的细粒度基准
ChartHal: A Fine-grained Framework Evaluating Hallucination of Large Vision Language Models in Chart Understanding
作者用CHART HAL评测15个LVLM,Table 2中Qwen2.5-VL-72B总分54.24%。
- 图表理解要求答案与图严格一致,但作者称既有幻觉评测多停在物体和场景,图表基准又多只看最终正确率,二者交叉几乎未被系统研究。
- CHART HAL把任务做成自由作答的图表问答,按描述/推理/开放与无关/不存在/矛盾/正常交叉成12类。图从CharXiv抽1或2个子图,o4-mini生成问答,人工校验后共1,062条;无幻觉记1。
- 15个LVLM由GPT-4o评分。Table 2:Qwen2.5-VL-72B总分54.24%,o4-mini(high)矛盾题3.33%,多家开源模型该列0.00%。作者称不可答时更易编造。
- 作者指出图主要来自CharXiv的arXiv科学图,分类未必覆盖真实提问,且未系统比较缓解方法。实验为15个LVLM、1,062条、GPT-4o自动评分;论文未报告评分与人工的一致性。
- 被测模型
- Gemini-2.5-ProGPT-5GPT-5-miniGPT-5-nanoo4-miniGPT-4o-2024-11-20Llama 3.2-11B-Vision-InstructInternVL2.5-4BInternVL2.5-8BInternVL2.5-38BInternVL2.5-78BQwen2.5-VL-3B-InstructQwen2.5-VL-7B-InstructQwen2.5-VL-32B-InstructQwen2.5-VL-72B-Instruct
- 基准
- CHART HALCharXiv
- 指标
- accuracy无幻觉二分(1/0,Table 2归一化到[0,100])
研究者提出 ChartHal,一个针对大型视觉语言模型图表理解幻觉的细粒度评测基准,包含幻觉场景分类体系和 1062 条经人工校验的样本。评测显示当前先进模型在该基准上幻觉严重,GPT-5 和 o4-mini 的准确率分别只有 34.46% 和 22.79%。分析还发现,涉及图表中不存在或与图表矛盾的信息的问题尤其容易触发幻觉。代码和数据已公开。
深度解读
这篇论文试图解决什么问题?
图表问答里的幻觉还缺少按触发情景划分的评测。
图表问答里的幻觉还缺少按触发情景划分的评测。
- 场景:作者认为图表信息密、元素关系复杂,模型既要精确感知也要做认知推理,并且必须与视觉输入严格一致。幻觉被作者定义为生成现实中不存在或与输入不一致的信息,在图表任务里尤其成问题。
- 现有不足:作者称此前幻觉研究与图表理解被分开做,交叉几乎未被探索。幻觉评测多限于物体和场景;图表基准多报告答题正确率,很少说明幻觉是否出现、怎样出现。
- 作者的判断:问到图中没有的信息,或问题前提与图矛盾时,更易诱发幻觉。作者给出的理由是,LVLM倾向于不论问题能否根据图回答都生成答案。
- 本文提出:作者提出基准CHART HAL,用图表问答把图-问对分成12类幻觉触发情景,并给出经人工校验的1,062条样本。引言称据其所知这是首个面向该任务的细粒度基准;结论又称它是首个系统基准。
有哪些相关研究?
幻觉评测多看物体与场景,图表基准多看正确率,交叉处作者称几乎未探索。
作者把相关工作分成幻觉评测和图表理解两条线,并称交叉几乎未被探索。
幻觉定义与已有评测
- 定义:作者引用Huang et al. (2025),把幻觉说成生成输入中没有或事实不正确的信息;LVLM一侧强调与视觉输入不一致(Bai et al., 2024)。作者称自LLM出现以来这一现象就被广泛观察到,并引用Hurst et al. (2024)、OpenAI (2025a,b)、Comanici et al. (2025)。
- 物体与属性:Rohrbach et al. (2018)、Li et al. (2023)、Zhang et al. (2023)、Fu et al. (2023)、Zhang et al. (2024)、Sun et al. (2024)、Qiu et al. (2024)。论文把它们归为关注输入图像中物体与属性的工作。
- 场景级:Zhou et al. (2023)、Wang et al. (2023)、Liu et al. (2023a)、Jiang et al. (2024)。作者称这些工作整体上留下了图表幻觉评测的主要空白。
涉及图表的幻觉基准
- HallusionBench(Guan et al., 2023):作者称据其所知这是唯一涉及LVLM图表幻觉的基准,但问题限于Yes/No,把图表理解情景简化了。
图表理解基准
- 正确率导向:FigureQA(Kahou et al., 2017)、DVQA(Kafle et al., 2018)、PlotQA(Methani et al., 2020)、ChartQA(Masry et al., 2022)、ChartBench(Xu et al., 2023)、MMC(Liu et al., 2024)、CharXiv(Wang et al., 2024c)、ChartX与ChartVLM(Xia et al., 2024)、ChartQAPro(Masry et al., 2025)、ChartMuseum(Tang et al., 2025)、InfoChartQA(Lin et al., 2025)。作者称其中多数看答案对不对,而不是分析幻觉。
- 不可答子集:CharXiv与ChartQAPro。作者称这使有限的幻觉评测成为可能,但子集仍然小,且没有幻觉触发问题类型的细粒度分类。
- ChartCap(Lim et al., 2025):作者称它研究图表理解中的幻觉,但限于captioning,不覆盖交互式问答。
基线与数据
- 对照对象:论文没有把其他系统当作要超越的方法基线。实验比较的是15个LVLM在CHART HAL上的分数;图从CharXiv抽样。是否幻觉由GPT-4o按第3.3节标准判定。
作者把本文放在上述空档上:用自由作答,并按问题类型和图表-问题关系做细分类,而不只报告图表问答的最终正确率。
论文如何解决这个问题?
自由作答的图表问答,按问题类型与图表-问题关系分成12类并人工校验。
CHART HAL把评测做成自由作答的图表问答,再按问题类型和图表-问题关系把每题放进12类。
任务形式
- 输入输出:给定图表图像c和问题q,LVLM生成答案a。实验只给这两项,不附加“不可答则输出固定短语”一类指令;作者称这与CharXiv不同(附录B)。
- 为何自由作答:作者不用Yes/No或选择题,称自由作答更能反映真实图表理解中的幻觉行为,并引用Li et al. (2024)。
- 两维:Figure 1上半是构建流程,下半用例子示意分类。论文称两个维度相互独立。
12类情景
- 问题类型:descriptive,直接抽取图中信息;reasoning,基于图做计算或逻辑推断;open-ended,分析或预测,没有确定正确答案。
- 图表-问题关系:irrelevant,与图无关;inexistent,询问图中缺失的信息;contradictory,前提与图中数据不一致;normal,与图一致的有效问题。前三类定为不可答。
- 使用假设:作者认为不可答题更易诱发幻觉,因为模型偏向不论可否作答都给出答案(Kalai et al., 2025)。
- 样本量:Table 1中irrelevant 269、inexistent 344、contradictory 210、normal 239;descriptive 383、reasoning 322、open-ended 357;合计1,062。最少的交叉格是reasoning×contradictory,54条。
数据构建
- 抽图:从CharXiv validation set分层抽样(附录A.1)。原数据子图数从1到120;只保留1或2个子图,比例3:2。再按学科比例抽,并覆盖条形图、折线图等类型。论文未给出最终图表张数。
- 生成问答:o4-mini为每张入选图生成覆盖12子类的问题与参考答案。附录Table 3–14给出各类生成提示词。
- 人工校验:正文称expert annotators;附录写明为本科学历标注员。对照图丢弃明显不符合设计的对,并改正事实错误、重标类别、修改标准答案(只能近似读数时给出可接受区间)。论文未报告标注人数、丢弃数量或一致性。
无幻觉如何判定
- 记分:无幻觉记1,否则记0。Table 2把汇总分数归一化到[0,100]。摘要把这类分数称为accuracy。
- 总规则:与给定标准答案一致,或明确指出问题不可答。
- 分类细则(附录A.2):无关题必须指出无关且不编造答案。描述与推理的inexistent题须说明信息缺失且不猜测。开放式inexistent题可以声明不可答,或在明确不确定的前提下做推测。矛盾题须指出矛盾,然后声明不可答,或忽略错误前提后作答;描述与推理题的数值若给了可接受区间,落在区间内即算对。开放式矛盾题的回答须保持不确定,过于肯定判错。正常题中,未给区间的数值必须数值相等,允许不同写法;类别答案须指向同一项;开放式正常题看不确定表达和合理推理,不按事实对错判;其余看语义是否与标准答案对齐,不能遗漏或加入无关信息。
- 评审提示:实验由GPT-4o执行上述标准。附录Table 15–21给出评分提示词。Table 17的说明允许开放式inexistent题做带不确定语气的推测,记分句又写成避免猜测、编造记0。
论文做了哪些实验?
Table 2总分最高54.24%,多家开源模型在矛盾题上为0.00%。
作者在15个LVLM上报告CHART HAL的分类分数,并称不可答情形更容易诱发幻觉。
实验设置
- 被测模型:15个。闭源为Gemini-2.5-Pro、GPT-5、GPT-5-mini、GPT-5-nano、o4-mini、GPT-4o-2024-11-20。开源为Llama 3.2-11B-Vision-Instruct、InternVL2.5-4B/8B/38B/78B、Qwen2.5-VL-3B/7B/32B/72B-Instruct。Table 2的high行是把reasoning effort设为high,论文仍按15个模型计数。
- 数据:CHART HAL全部1,062条,分布见Table 1。图从CharXiv抽样。问答由o4-mini生成,该模型也在被测之列。
- 输入与解码:只给图和问题。温度0;附录B写明o4-mini等推理模型不能设温度。生成长度用各模型默认上限。论文未报告重复次数。
- 指标:每条无幻觉记1、否则记0,再归一化到[0,100]。它不是单一的事实正确率:开放式正常题看不确定语气和合理推理(附录A.2)。
- 评审:GPT-4o-2024-11-20,温度0。它同时是Table 2中的被测行。附录称用GPT-4o评分在其他基准中常见,并称与人类判断对齐、且更高效可扩展;论文未给出本基准上的人工一致性数字。
- 对照:无单独方法基线,各模型在同一套题上比较。
主结果
表格较宽,可左右滑动
模型 Overall Irrel. Inexist. Contra. Normal Qwen2.5-VL-72B-Instruct 54.24 65.06 69.77 19.05 50.63 Gemini-2.5-Pro 49.34 36.80 52.62 49.52 58.58 GPT-5 (high) 34.46 20.82 29.07 19.52 70.71 GPT-4o-2024-11-20 32.49 27.88 36.92 6.67 53.97 Qwen2.5-VL-7B-Instruct 25.71 25.65 25.29 1.90 47.28 Llama-3.2-11B-Vision-Instruct 24.95 29.37 28.49 0.00 36.82 o4-mini (high) 22.79 10.78 14.53 3.33 65.27 Qwen2.5-VL-3B-Instruct 8.57 0.74 0.87 0.00 35.98 据Table 2,数值为归一化到[0,100]的分数。省略的行有GPT-5(34.37)、GPT-5-mini(high,26.74)、GPT-5-mini(27.02)、GPT-5-nano(high,24.95)、GPT-5-nano(23.07)、o4-mini(22.41)、InternVL2.5-78B(21.47)、InternVL2.5-38B(19.40)、InternVL2.5-4B(12.71)、InternVL2.5-8B(12.34)、Qwen2.5-VL-32B-Instruct(23.92)。InternVL2.5四个规模的Contra.也是0.00。
- 总分:作者把Qwen2.5-VL-72B标为总分最高,并称大约高出Gemini-2.5-Pro 5个点。同表中Gemini的Contra.与Normal更高,Qwen的Irrel.与Inexist.更高。作者称o4-mini出乎意料地差,落后于GPT-4o,只与Qwen2.5-VL-7B这类更小模型相当。
- 不可答:作者报告o4-mini仅有14.53%的inexistent题被正确认出不可答,矛盾题降到3.33%,并与Qwen2.5-VL-72B的69.77%对照。这组数字与Table 2的o4-mini(high)行相同,正文未写明是否专指high。作者认为这像是偏向生成答案、而不是判断可否作答。Inexist.列按附录规则并不全是“承认不可答”:开放式inexistent题可以带不确定语气做推测。
- 摘要:摘要称GPT-5与o4-mini的总体准确率仅34.46%与22.79%。该二数分别与Table 2的GPT-5(high)、o4-mini(high)行相同。
问题类型与图表-问题关系
- 问题类型:作者称难度分层是描述题最高(顶尖模型高于60%)、推理居中、开放题最易错,最强模型也难以超过45%。Table 2中描述题超过60的是Gemini-2.5-Pro的60.31;Qwen2.5-VL-72B描述题为58.49。开放题最高是该72B模型的44.82。
- 与分层不完全一致的格子:Qwen2.5-VL-72B的Reason为59.63,高于其Desc.的58.49。InternVL2.5-8B的Open为10.64,高于其Reason的8.39。Gemini-2.5-Pro是Desc. 60.31、Reason 50.31、Open 36.69,与作者描述的顺序一致。
- 关系:作者称模型在normal题上尚可,一旦涉及可否作答就大量幻觉;矛盾题尤其难,许多开源模型为0%。矛盾题共210条(Table 1)。Contra.为0.00的有Llama-3.2-11B-Vision-Instruct、InternVL2.5四个规模、Qwen2.5-VL-3B-Instruct。作者认为标准题尚能处理,不可答情景仍易幻觉,并指出需要对抗训练等策略。
规模、推理强度与案例
- 规模:作者称更大模型总体更好(Qwen2.5-VL与GPT-5系列),并认为规模可以增强对幻觉的稳健性。同表并非处处更大更高:Qwen2.5-VL-32B总分23.92,7B为25.71;InternVL2.5-8B为12.34,4B为12.71。第5节称更大模型通常更好,但更小模型偶尔可在特定子类超过更大模型。Table 2中GPT-5-mini的Normal为79.92,高于表内GPT-5(high)的Normal列。
- 推理强度:作者称提高reasoning effort只有小且不稳定的收益,甚至可能变差;理由是正确推理依赖准确的视觉感知,看错图时额外推理往往会放大错误。Table 2总分:GPT-5(high)34.46、GPT-5 34.37;GPT-5-mini(high)26.74、GPT-5-mini 27.02;o4-mini(high)22.79、o4-mini 22.41。
- 案例:Figure 2给三列,图注称绿字为正确部分、红字为错误或幻觉部分。三列分别标为描述+不存在、开放+矛盾、推理+正常。作者称:提高推理强度收益不大(左、中列的GPT-5);GPT-5系列在不可答情形易幻觉;GPT-5-mini可在特定子类超过GPT-5。作者称这些观察与Table 2一致。转换文本看不到颜色,具体哪一句被标红以图注和作者描述为准。
其他消融与分析
论文没有单独的消融表。上文未逐项列出的Table 2对照:
- GPT-5-nano(high)总分24.95,GPT-5-nano为23.07;二者Contra.都是5.24。
- o4-mini(high)Contra. 3.33,o4-mini为1.90;Inexist.分别为14.53与12.21。
- Qwen2.5-VL矛盾题:72B为19.05,32B为1.43,7B为1.90,3B为0.00。
- InternVL2.5总分:78B 21.47,38B 19.40,8B 12.34,4B 12.71;四档Contra.均为0.00。
- GPT-4o-2024-11-20总分32.49,其Desc. 40.47、Open 20.73、Contra. 6.67。
- 开放题最低一档里,o4-mini(high)为9.52,Qwen2.5-VL-3B为7.84,InternVL2.5-4B为8.12。
有什么可以进一步探索的点?
作者指出科学图来源、分类覆盖和未评缓解方法三点。
作者在Limitations里写出三方面后续工作;实验本身停在15个模型的分类分数和定性案例。
作者指出的局限与后续方向
- 数据范围(Limitations):数据来自CharXiv中的科学图,主要出自arXiv论文。作者称不能覆盖商业、新闻或教育等领域的图表类型,因而限制可推广性。后续方向是用更广领域的图扩充数据。
- 分类覆盖(Limitations):作者称分类包含许多经验上会触发幻觉的情景,但未必涵盖真实使用中的全部情况;用户可能提出更多样、依赖上下文或对抗性的问题。后续可继续扩展分类。
- 未评缓解方法(Limitations):作者称本文主要诊断幻觉行为,没有系统纳入或比较缓解技术。后续可整合并评测对抗训练、calibration或abstention。
实验覆盖范围
- 被测模型为第4.1节列出的15个LVLM;Table 2另报告其中部分模型在reasoning effort设为high时的分数。
- 评测数据为CHART HAL的1,062条,12类分布见Table 1。图从CharXiv validation set抽取,只保留1或2个子图,比例3:2(附录A.1)。
- 模型输出由GPT-4o-2024-11-20按附录A.2二分打分。论文未报告重复次数,也未报告该自动评分与人工判断的一致性。
- 问答由o4-mini生成,再由附录所称本科学历标注员校验;正文3.2称这些标注员为expert annotators。论文未报告标注人数、丢弃比例。附录写了按学科比例抽样并覆盖多种图表类型,未报告各学科或各图表类型的条数。
- 生成时只输入图和问题,采样温度设为0;附录B写明o4-mini等推理模型不能配置温度,生成长度用各模型默认上限。Figure 2是定性案例。
总结一下论文的主要内容
1,062条样本评15个LVLM,作者称不可答时模型常编造答案。
CHART HAL是一个面向LVLM图表理解幻觉的细粒度基准。
- 问题:图表问答要求与图严格一致。作者称幻觉评测很少进入图表,图表基准又很少拆开幻觉怎样出现。
- 做法:自由作答。问题分描述、推理、开放,与图的关系分无关、不存在、矛盾、正常,共12类。图取自CharXiv,只留1或2个子图;o4-mini出问答,人工修订,共1,062条。无幻觉记1,由GPT-4o-2024-11-20评分。开放式正常题看的是不确定语气和合理推理,不是事实对错。
- 结果:Table 2中Qwen2.5-VL-72B-Instruct总分54.24%,Gemini-2.5-Pro为49.34%,GPT-5(high)34.46%,o4-mini(high)22.79%,Qwen2.5-VL-3B-Instruct 8.57%。摘要把34.46%与22.79%记在GPT-5与o4-mini名下,这二数与high行相同。多家开源模型在210条矛盾题上为0.00%。Gemini在Contra.与Normal上高于总分最高的Qwen72B。
- 作者结论:可答题尚能处理;问到图中没有或与图矛盾的内容时,模型常编造,而不是承认不可答。作者认为提高推理强度收益不稳定,因为看错图时额外推理会放大错误。作者同时指出数据主要来自arXiv科学图,分类和缓解方法评测都还可扩展。