跳到正文
原文
Microsoft Research· Yunfei Ge, Anbang Liu, Qineng Wang, Johnalbert Garnica, Zihan Wang, Reuben Tan, Jianfeng Gao, Ruohan Zhang, Yining Hong, Jiajun Wu, Manling Li·本站收录 · 原文发表

Microsoft Research 发布 MindTopo 基准,评测多模态模型的拓扑空间推理能力

MindTopo reveals VLMs’ spatial reasoning abilities

AI 导读

Microsoft Research 提出 MindTopo,一个评测多模态大语言模型拓扑推理能力的基准,覆盖连通性、分离、顺序、包围和绳结五类拓扑关系。基准分两个认知层次:推理任务让模型判断静态场景中的拓扑结构,规划任务让模型在模拟环境中通过一系列动作创建、保持或移除某种关系,环境会拒绝违反物理约束的动作。在多种闭源与开源权重模型上,静态推理表现一致优于交互规划,两者都远低于人类水平;静态错误多源于感知遗漏,规划错误则出现在场景已被理解之后,模型会采取局部可行但未追踪后续后果的动作,或在多轮中丢失任务目标。研究还测试了图像与视频生成能否帮助维持拓扑理解,图像生成仅在单帧可见关系时偶尔有用,视频推演常改变拓扑或违反任务动态。

阅读原文microsoft.com