跳到正文
事件持续更新

Scale AI 发布 HSS 直觉视觉推理基准

1 篇报道1 个报道来源22 小时前更新

先了解这件事

AI 综述

Scale AI 与 Elorian 联合发布 Humanity's Sixth Sense(HSS)基准,用于评测直觉视觉推理,包含 288 张图片和 234 段视频(共 17.6 小时)上的 522 道开放式任务。人类参与者准确率 93.1%,最强模型 GPT-6-astra 仅 53.6%,中位模型 30.9%;移除图像或视频后 GPT-6-astra 降至 6.6%。评测覆盖 8 家厂商的 25 个多模态模型。

AI 根据报道生成 · 4 小时前更新

后续时间线

10月7日
  1. Scale AI Research Blog
    Scale AI 与 Elorian 发布 HSS 基准,测出多模态模型直觉视觉推理远低于人类

    Scale AI 与 Elorian 联合发布 Humanity's Sixth Sense(HSS)基准,用于评测直觉视觉推理,包含 288 张图片和 234 段视频(共 17.6 小时)上的 522 道开放式任务。人类参与者准确率 93.1%,最强模型 GPT-6-astra 仅 53.6%,中位模型 30.9%;移除图像或视频后 GPT-6-astra 降至 6.6%。评测覆盖 8 家厂商的 25 个多模态模型,模型平均每题消耗 4046 个推理 token,提高推理强度在部分子领域反而下降,如 GPT-6-astra 在 retrodiction 上从 high 到 xhigh 掉 14 分。8573 次失败中 94% 源于感知或潜在推断,仅 5% 源于逻辑错误,最主要原因是漏掉关键视觉线索(21%)和误认对象、人物或角色(20%)。

相关讨论

本站还没有收集到这件事的讨论链接。

关注度走势

每天新增来源

2 天共 1 个·最多 1(10月7日)·今天 0

  • 10月7日 新增 1 个来源(1 家媒体、0 个账号)
  • 10月8日 新增 0 个来源(0 家媒体、0 个账号)

每小时关注度

当前关注度 44·可比范围峰值 44(10月8日 02:00)·近 24 小时可比范围变化 –

020406010月8日02:0010月8日03:0010月8日05:0010月8日06:00