评测与基准arXiv 2609.32763
Mandela-Bench:36 个多模态模型更依赖记忆而非观察图像
构建 Mandela-Bench,评测多模态模型是否凭记忆接受篡改图像
- arXiv
- 2609.32763
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gemini-3.8-Flash、GPT-5.6、GLM-5.3-Flash 等 15 个
摘要论文构建 Mandela-Bench 发现模型对经典图像存在记忆重构偏见,过度依赖先验导致无法有效利用知识核验事实篡改。
该研究系统评估了多模态大语言模型在面对无痕事实性编辑时,能否利用自身内在世界知识核验被识别出的经典图像。