Anthropic 发布 Embody 基准:测试语言模型控制机器人的能力
Claude plays robotics
AI 导读
Anthropic 用自建基准 Embody 测试了 12 款模型控制多种机器人本体的能力,涵盖经典控制玩具、仿真四足与人形、机械臂以及真实的 Unitree Go2。结果显示模型表现高度依赖控制接口:直接输出电机扭矩时大多失败,而监督预训练策略或使用简单方向工具时能完成真实的导航与操作任务。在 7-DoF Franka Panda 机械臂的 LIBERO 任务上,直接控制下完整任务成功率仅 0 到 5.5%,配合 MolmoAct VLA 后大幅提升,但所有模型仍明显弱于 VLA 单独运行。视觉辅助中光标工具和罗盘最有效,深度图与分割叠加基本中性;额外推理预算对多数结果影响不大。研究指出,模型无需自己驱动关节,只要接入一个称职的控制器就能在物理世界有效行动,因此能力评估需把工具与控制权限视为系统的一部分。
推荐理由
Anthropic 用自建 Embody 基准测试多款模型控制真实与仿真机器人,量化了控制接口对能力的影响,为具身智能体的能力评估提供参照。