Mandela-Bench:36 个多模态模型更依赖记忆而非观察图像
Mandela-Bench: Multimodal Models Remember Canonical Images Instead of Seeing Them
测试36个模型,发现识别经典图像引发记忆重构偏见,提示下仅Gemini-3.8-Flash的KGR达55.1%。
- 经典历史照片等图像经指令无痕编辑后,破绽仅在于违背了事实记录。现有基准依赖像素伪影、跨模态冲突或图外检索,未测试多模态模型能否自主调用世界知识验证识别出的图像。
- 构建含1507张篡改图的Mandela-Bench,每项仅违背一条可核实事实,并配对无事实矛盾的无锚点对照与原图。通过证据阶梯将解释分级为E0至E4,以识别篡改实体为基准评测知识溯源率(KGR),并设计裁剪去识别等探针。
- 评测36个模型发现,识别经典图像会引发向记忆偏向的验证失败。模型常叫出被擦除的名人,且能在孤立人脸通过辨识时仍认定整图真实;提示验证下仅Gemini-3.8-Flash的KGR达55.1%(Table 2),其余多低于25%。
- 作者指出的局限包括评估依赖Qwen3.8-27B裁判模型、编辑图像基于单一商业编辑器GPT Image 2生成,且人工标定样本规模有限(206条)。实验覆盖范围包括36个多模态模型、6个知识家族与6个图像领域,未报告多轮交互下的表现。
- 模型
- Gemini-3.8-FlashGPT-5.6GLM-5.3-FlashKimi-K3Kimi-K2.6Qwen3.5-122B-A10BQwen3-VL-235B-A22BQwen3.6-27BQwen3.5-27BQwen3.8-27BQwen3.6-35B-A3BGemma-4-31BQwen3.5-9BMiniMax-M3InternVL3.5-30B-A3B
- 基准
- Mandela-Bench
- 指标
- KGRDetAuthBalE4Elicitation gapRecognition penalty
研究者提出 Mandela-Bench,一个以事实矛盾为唯一伪造证据的单图基准,包含 1507 张无缝编辑的经典图像(其中 1359 张知识型伪造、148 张无锚点对照)和 474 张未修改原图,覆盖人物、物体、地点、可见文字、事件属性和艺术作品六类知识。在 36 个多模态模型(0.8B 到前沿规模)上,当从熟悉照片中抹去公众人物后,模型仍在最高 72.7% 的回答中说出该人物;部分模型单独看替换人脸时能区分,却仍判定整张编辑照片为真。给出真实事件与日期并不能提升知识型检测,而裁掉可识别构图后再给同样信息则能提升。在显式验证提示下,36 个模型中只有一个在至少一半伪造图上达到 KGR 标准,最佳模型 KGR 为 55.1,次优为 36.0。作者将这一模式称为从记忆重建,认为瓶颈在于识别之后是否触发验证。
推荐理由36 个多模态模型在 1507 张知识型伪造图上的表现,为图像取证与多模态可信评测提供了可复用的基准和失败模式。
深度解读
这篇论文试图解决什么问题?
论文探究多模态模型能否凭借内部世界知识识别无痕事实篡改,还是会被记忆偏置导致验证失效。
多模态大语言模型在面对无明显像素痕迹的经典图像事实性篡改时,能否自主调用世界知识完成鉴别,还是会被记忆中的经典图像所偏置。
- 问题场景与重要性:现代基于指令的图像编辑技术能够在时代特征、材质与风格上实现无痕修改,唯一的矛盾仅在于所描绘实体与外部真实历史事实相悖,可能改变公众共同记忆的记录(Section 1)。
- 现有方法的不足:现有检测基准主要依赖生成器底层特征、图文跨模态不匹配、视觉明显异常或依赖外部数据库检索比对,未能测试模型仅凭单张图像及其自身参数化知识进行事实核验的能力(Section 1、2)。
- 核心观察与假设:作者假设当模型识别出经典图像的全局构图时,识别可能不会触发严格验证,反而会激活记忆表征并覆盖实际观察到的视觉编辑,导致模型依记忆重构场景并接受伪造图像(Section 1、3)。
- 提出的基准与方案:作者构建了包含1,507张经典图像篡改样本的 Mandela-Bench 基准,设立无事实冲突的无锚点对照和未经修改的原图,并结合证据阶梯与多种去识别探针定位模型失效机制(Section 3、4)。
有哪些相关研究?
论文梳理了底层取证、跨模态/语义异常、外挂检索及先验冲突四类研究,强调本文聚焦无外挂参考的内在知识核验。
作者梳理了与图像伪造检测、多模态事实核验及视觉先验相关的四类研究:
生成痕迹与底层取证检测:NPR(Tan et al., 2024)与 UniversalFakeDetect(Ojha et al., 2023)利用上采样规律或冻结 CLIP 空间特征检测生成痕迹;作者指出这类底层取证方法在 Mandela-Bench 上接近随机猜测(AUC 0.577 与 0.538)。DailyBench(Jiang et al., 2026)与 UniAIDet(Zhang & Wan, 2025)引入对象级与指令编辑评测;作者指出在生成痕迹消除后,依赖底层特征的分类器准确率会出现下降。
跨模态与语义异常检测:DGM4(Shao et al., 2023)与 MiRAGeNews(Huang et al., 2024)通过配对图文并定位不匹配的区域或词元来检测伪造;作者指出其依赖显式提供的多模态文本输入。AnomReason(Tan et al., 2025a)、ManipShield(Xu et al., 2025d)与 EditSleuth(Nguyen et al., 2026)标注物理违背、常识异常或生成推理链;作者指出这些方法依赖可见的语义异常或边缘取证残留,而 Mandela-Bench 的编辑在视觉和常识上保持内在合理。
基于外部检索的核验系统:LookupForensics(Cui et al., 2024)与 REVEAL(Zhou et al., 2026)通过检索参考数据库中的真实图文配对并比对差异来判定伪造;作者指出其将知识存放在外部检索库中,而 Mandela-Bench 不提供外部参考库,测试模型自身的参数化知识。
参数化先验与视觉感知的冲突:HallusionBench(Guan et al., 2024)、Pixels Versus Priors(Golovanevsky et al., 2025)与 MLLMs Know Where to Look(Zhang et al., 2025)研究语言先验压制视觉输入、受控视觉反事实或小目标感知失败现象;作者指出这些工作多使用合成图表或局部反事实,而本文针对真实经典图像,并在保持篡改区域不变的同时操控构图识别性。
基线方法与基准:实验选取的底层基准为 NPR 与 UniversalFakeDetect;被测对象为 36 个开源与专有多模态模型;测试基准为 Mandela-Bench。
作者对本文区别的定位:作者指出,以往工作依赖像素伪影、图文矛盾或外挂数据库,而 Mandela-Bench 面向无图注、无外挂知识库的单图场景,核验的关键证据完全依赖模型已掌握的参数化世界知识(Section 2)。
论文如何解决这个问题?
构建单事实违背的无痕篡改数据集,设置无锚点与去识别对照,通过E0–E4证据阶梯与KGR指标度量知识核验能力。
作者提出了包含图像构建管线、去识别实验控制与证据分级协议的 Mandela-Bench 评测框架。
知识伪造的形式化与设计属性
- 单事实矛盾定义:设经典原图为 s,其在知识库中的条目为 k(s),命题集合为 F(s);伪造项由三元组构成,满足 ŝ = e(s),其中命题 ϕ ∈ ℱ(s) 在原图 s 上为真,而在篡改图 ŝ 上为假,且其余命题真值不变(Appendix B)。
- 六大知识家族:伪造错误涵盖人物(K1)、物体(K2)、地点(K3)、可见文字(K4)、事件属性(K5)和艺术作品内容(K6)(Section 3.1、Table 1)。
- 无锚点对照设计:每类伪造均配对无锚点对照 (s, e′, ⊥)(K0),即在相同母本图像上采用相同编辑器执行同类操作,但替换为不含特定历史事实的普通元素,用于剥离生成痕迹影响(Section 3.1、Appendix B)。
- 缺席名人反向构建:针对人物家族特别设计了缺席名人项,通过局部椭圆掩码将原图中的公众人物替换为人造面孔,使唯一异常变为“原本的人物缺失”(Section 3.1)。
数据生成与三阶段质控管线
- 种子收集与事实校验:图像母本来自 Wikimedia Commons(1,555件)、film-grab.com(320件)等公有档案;由多模态模型提出编辑规格并经由 Wikidata 与事实表核对,仅当探测模型(Kimi-K3)能在无上下文条件下识别人脸时方可选用该人物(Section 3.2、Appendix C)。
- 图像渲染与面部匹配:采用单一商用编辑器(GPT Image 2)渲染伪造图与 K0 对照;使用 InsightFace buffalo_l 校验面部特征,人脸余弦相似度低于 0.35 的候选被丢弃;对缺席名人项则反向要求相似度低于 0.30 且无人造身份残留(Appendix C)。
- 人工审核与像素审计:包含对最大生成批次中99项的双盲抽检(87项通过,12项不合格及其关联项全部剔除),对194项缺席名人项全检(剔除35项);图像统一重编码为质量92、长边1280像素的JPEG(Section 3.2、Appendix C)。
评测探针与去识别实验条件
- 多维度评测探针:设置默认提示 L0(判定真伪及原因)、提示验证 L1(要求对照历史事实核查人事物与年代)、身份探针 L2(指出图中有谁)、孤立人脸探针 FACE、对抗建议 L-adv、自述识别 RECOG 以及纯文本问答 TEXT 等七项探针(Section 4.1、Figure 3)。
- 去识别实验变体:针对边缘位置篡改设计了完整图像 Full、加注真实事件与日期的 Full+Caption、裁切掉主构图保留篡改区域的 Crop、在裁切图上加注真图注的 Crop+Caption,以及水平翻转的 Mirror 对照(Section 4.2、Figure 3)。
证据阶梯与评价指标
- E0至E4证据阶梯:评测裁判(Qwen3.8-27B)依据规则将解释评级:E0为未判定为假;E1为仅泛泛提及伪影;E2为定位到异常区域但未识别出实体;E3为正确指出被插入、移除或替换的实体;E4为在E3基础上准确陈述与事件违背的事实矛盾(Section 4.3、Figure 3)。
- 核心指标定义:知识溯源率(KGR)定义为1,507个伪造样本中获得 E3 及以上评级的比例;提示引发的增益 ΔKGR = L1 − L0 定义为启发差距(Elicitation gap);Crop+Caption 相比 Full 的平衡准确率增量定义为识别惩罚(Recognition penalty)(Section 4.3)。
论文做了哪些实验?
评测36个模型在1507张篡改图上的表现,仅1个模型提示下KGR达55.1%,实验表明去构图能缓解识别偏置。
实验设置
- 被测模型:评测覆盖36个多模态模型,包括2个专有模型(GPT-5.6、Gemini-3.8-Flash)和34个开源模型(GLM-5.3-Flash、Kimi-K3、Kimi-K2.6、Qwen3.5-122B-A10B、Qwen3-VL-235B-A22B及其think版本、Qwen3.6-27B、Qwen3.5-27B、Qwen3.8-27B、Qwen3.5-35B-A3B、Qwen3.6-35B-A3B、Qwen3-VL-32B及其think版本、Qwen3-VL-8B、Qwen3-Omni-30B-A3B及其think版本、Gemma-4-31B、Gemma-3-12B、Qwen3.5-9B、Qwen3.5-4B、MiniMax-M3、Qwen2.5-Omni-7B、Qwen2.5-VL-7B、InternVL3.5-30B-A3B、InternVL3.5-8B、Qwen2.5-VL-3B、Qwen2-VL-2B、Cosmos-Reason1-7B、MiniCPM-o 4.5、Qwen3-VL-2B、BAGEL-7B-MoT、Janus-Pro-7B、Qwen3.5-2B、Qwen3.5-0.8B)(Section 5、Appendix G)。
- 数据集规模:测试集包含1,507张篡改图像(1,359张单事实伪造,148张K0无锚点对照)和474张未经修改的真实原图,涵盖6个知识家族与6个图像领域;子实验包含145张边缘人物篡改图和132张经确认的缺席名人样本(Section 3.1、Table 5、Appendix C)。
- 取证基线:选取2个底层像素取证检测器 NPR 与 UniversalFakeDetect(Section 3.2)。
- 指标定义:伪造检测率(Det)、真实图像准确率(Auth)、二者算术平均的平衡准确率(Bal)、知识溯源率(KGR,达到E3或E4的比例)、事实矛盾陈述率(E4),以及启发差距(ΔKGR = L1 - L0)和识别惩罚(Bal(Crop+Caption) - Bal(Full))(Section 4.3)。
- 评审与采样方式:采用 Qwen3.8-27B 充当 LLM 裁判模型,依据固定规则对模型回复进行 E0–E4 评级;所有模型推理温度设为 0;在 206 份人工标注样本上校准,裁判与人工完全一致率为 82.5%,在 KGR 阈值判定一致率为 95.2%(Section 4.3、Appendix F)。
- 重复与实验设置:去识别实验在边缘样本上进行;各探针均采用确定性解码(temperature 0);论文未报告多次重复采样的方差(Appendix E、G)。
主结果
表格较宽,可左右滑动
模型 L0 KGR L0 Bal L1 KGR L1 Bal ΔKGR Gemini-3.8-Flash 46.6 80.5 55.1 84.3 +8.5 GPT-5.6 19.8 68.3 36.0 76.3 +16.2 GLM-5.3-Flash 29.7 73.2 34.8 73.2 +5.1 Kimi-K3 24.4 70.5 34.1 77.0 +9.7 Qwen3.8-27B† 13.3 60.1 22.3 64.0 +9.0 InternVL3.5-30B-A3B 5.5 53.5 10.5 58.2 +5.0 Qwen3.5-0.8B 0.0 52.7 0.0 50.1 0.0 注:数据据 Table 2,†表示该模型亦作为评测裁判模型;因篇幅限制,表中省略了其余 29 个模型(包括 Kimi-K2.6、Qwen3.5-122B、Gemma-4-31B 等),完整结果见附录 Table 5。
- 仅单一模型提示下KGR过半:在默认提示(L0)下,仅 Gemini-3.8-Flash 的 KGR 达到 46.6%,GLM-5.3-Flash 为 29.7%;在提示验证(L1)下,Gemini-3.8-Flash 升至 55.1%,其余35个模型中仅6个达到30%,28个低于25%(Section 5、Table 2)。
- 提示验证增加检出多于知识溯源:显式提示促使29个模型的 KGR 提升 3.1 至 16.2 个百分点,但在29个高于基底的模型中,有26个模型的伪造检出率增幅大于 KGR 增幅,且27个模型的真实图像准确率下降(Section 5、Figure 4a)。
- 知识驱动检出高于无锚点对照:所有模型在无锚点对照(K0)上的 KGR 仅为 0.0%–2.0%,而同编辑器生成但包含事实矛盾的物体类篡改(K2)KGR 最高达 79.2%(Section 5、Table 2)。
去识别与真实图注实验
- 测了什么:在145张边缘人物篡改图上测试保留全图(Full)、全图加真实图注(Full+Caption)、局部裁切(Crop)及裁切加真实图注(Crop+Caption)四种条件,评估去除构图识别性与提供事件信息对鉴别的影响(Section 5、Table 3)。
- 实验结果:在Full下能识别出至少一半图像且检出率不低于10%的21个模型中,所有模型的识别惩罚(Recognition penalty)均为正值(+0.2至+18.7百分点);Crop+Caption 相比 Full+Caption 的 KGR 达到其 1.3 至 8.9 倍;相反,在 Full 下加入真实图注(Full+Caption)时,没有模型在超过 2 张样本上提升 KGR,反而有 15 个模型的检出率下降(Section 5、Table 3)。
- 作者的解读:作者认为向模型提供真实事件图注并不能直接促进知识核验,反而可能被模型用于佐证记忆中的经典原图;只有裁切破坏了经典构图带来的识别偏置后,知识核验才得以恢复(Section 5)。
缺席名人与孤立人脸感知实验
- 测了什么:在132项缺席名人样本(将名人替换为人造脸)上测试默认判定与身份询问,并在119对孤立人脸图像上测试模型能否辨别人脸差异(Section 5、Table 3、Table 8)。
- 实验结果:当仅询问真伪时,Gemini-3.8-Flash 在 74.2% 的回答中主动叫出被擦除的名人名字;在仅询问图中有谁(L2)时,Kimi-K2.6 和 Kimi-K3 分别在 72.7% 和 62.1% 的样本中报出被擦除者;在孤立人脸测试中,Kimi-K3 能正确辨别 55 对人脸,但在整图测试中对这 55 项仍有 63.6% 判定为真(Section 5、Table 3、Table 8)。
- 作者的解读:作者认为模型对缺席名人的误判不能归因于缺失面部感知能力或事实知识,而是经典图像全局构图诱发了记忆重构,主动脑补并合理化了被擦除的人物(Section 5、6)。
知识类别与置乱对照实验
- 测了什么:对比类别级事实(物体K2、文字K4)与个体级事实(人物K1)的 KGR 差异,并在两款专有模型上测试提供错误事件图注的对照实验(Section 5、Appendix J、Table 11)。
- 实验结果:在默认探针 KGR 大于 10 的 19 个模型中,所有模型在类别级 K2 和 K4 上的 KGR 均高于个体级 K1(Table 2);在错误图注对照中,Gemini-3.8-Flash 和 GPT-5.6 对伪造图的检出率升至 93.8% 和 91.0%,但对真实图像的判定准确率降至 19.4% 和 16.1%(Table 11)。
- 作者的解读:作者认为模型运用通识类别知识比识别具体人脸更可靠;错误图注导致的检出率上升反映出模型是在比对图注与记忆场景的差异,而非真正检验图像像素与事实的吻合度(Section 5、Appendix J)。
其他消融与分析
- 编辑显著度消融:主要人物替换(C1)比背景插入(C3)检出率更高,Kimi-K3 提示下为 62.5% 对 58.4%,Gemini-3.8-Flash 为 81.5% 对 78.2%(Table 14)。
- 严格事实矛盾(E4)比例:提示验证下仅 Gemini-3.8-Flash(37.2%)、Kimi-K3(29.7%)和 GPT-5.6(26.3%)达到 25% 以上,其余模型均较低(Table 15)。
- 面部相似度阈值敏感性:剔除阈值边缘±0.05的41项样本后,各模型人物家族检出率变化不超过1.7个百分点,KGR变化不超过0.5个百分点(Table 15)。
- 镜像水平翻转扰动:镜像翻转使识别率和检出率维持在 Full 条件的 11.2 个百分点以内(Table 7、19)。
- 足迹协变量回归:在控制编辑面积与检测器分数后,17个模型中16个在替换与擦除间的检出差异在统计学上均有意义(p < 0.05)(Table 20)。
有什么可以进一步探索的点?
作者指出了人物范围、单一编辑器、LLM裁判标定规模及缺乏人类受试等局限,后续需探索更广的核验机制。
作者指出的局限与后续方向
- 公众人物选入范围限制:基准仅收录公开人物,排除了现任国家元首或政府首脑,以及当代在世的歌手和演员;同时排除了具有政治色彩的迷因模板(Ethics Statement)。
- 生成工具来源单一:基准中的所有知识篡改与无锚点对照图像均由单一商用图像编辑器(GPT Image 2)渲染生成(AI Use Statement、Section 3.2)。
- 解释评级依赖自动化评测裁判:模型回复的证据等级评级由自动化大语言模型裁判(Qwen3.8-27B)完成,人工标定校验集仅为 206 条样本,未开展大规模人类受试者研究(AI Use Statement、Ethics Statement、Appendix F)。
- 部分人脸基准缺乏独立参考肖像:在 435 项命名人物插入中,有 39.1%(170项)未能检测到可用的独立参考人脸肖像,需依赖基于探针模型的识别过滤(Appendix C)。
- 艺术作品类别无法进行边缘裁切分析:由于艺术作品(K6)构图整体性,依设计没有边缘篡改样本,因而未纳入去识别条件下的识别惩罚对比(Appendix J)。
实验覆盖范围
- 被测模型范围:涵盖2个商业API模型(GPT-5.6、Gemini-3.8-Flash)和34个开源模型,参数量分布在 0.8B 至 2.8T 之间(Section 5、Appendix G)。
- 样本规模与分类:评测集包含 1,507 张编辑图像(含 148 张无事实矛盾对照)和 474 张原图,覆盖历史照片、体育、艺术品、影视剧照、政治新闻和网络迷因等 6 个领域(Section 3.1、Figure 5)。
- 评测条件设置:包含 7 种文本/多模态探针,并在 145 张边缘人物篡改图上设置了 4 种去识别条件(Section 4.1、4.2、Table 3)。
- 取证检测器基准:对比了 NPR 与 UniversalFakeDetect 两款底层取证检测器在去重图像上的 AUC 与真阳性率(Section 3.2)。
- 未报告信息:论文未报告多次重复采样的随机种子方差,亦未测试多轮对话或交互式工具调用下的核验表现(Section 4.1、Appendix E)。
总结一下论文的主要内容
论文构建Mandela-Bench发现模型对经典图像存在记忆重构偏见,过度依赖先验导致无法有效利用知识核验事实篡改。
该研究系统评估了多模态大语言模型在面对无痕事实性编辑时,能否利用自身内在世界知识核验被识别出的经典图像。
- 核心问题:现有图像伪造检测多依赖底层生成痕迹或外部参考库,研究旨在探究当图像仅存在单一外部可验证事实冲突时,模型究竟是在验证视觉输入,还是依赖记忆重构。
- 基准构建:构建了涵盖6类知识和6个领域的 Mandela-Bench(含1,507张篡改图与474张原图),每项伪造配对无事实矛盾的无锚点对照(K0),并建立严格的 E0–E4 证据阶梯来评定知识溯源率(KGR)。
- 主要发现:在36个被测模型中,仅 Gemini-3.8-Flash 在提示验证下的 KGR 达到 55.1%,其余模型大多低于 25%(Table 2);在缺席名人测试中,Kimi-K2.6 和 Kimi-K3 分别在 72.7% 和 62.1% 的情况下主动叫出被擦除者的名字(Table 8);Kimi-K3 虽能在孤立人脸测试中准确区分替换面孔(55/119),但在完整照片中仍有 63.6% 判定为真(Table 8)。
- 去识别实验:对边缘人物伪造进行局部裁切后,21个识别模型的 KGR 提升至全图加图注条件的 1.3 至 8.9 倍,证实消除经典构图识别性能降低“记忆重构”带来的判断干扰(Section 5)。
- 结论与启示:作者认为模型的核验瓶颈并非缺乏知识或视觉感知不足,而是全局识别激活了经典图像记忆先验并抑制了后续验证;构建高可信多模态系统必须妥善调和先验知识与视觉观测之间的冲突。