跳到正文
原文
VulcanBench·本站收录 · 原文发表

VulcanBench 评测 Grok 4.7 在 Cursor 各 effort 档位的代码与安全表现

Grok 4.7 across effort levels — VulcanBench Safety v1 results

AI 导读

VulcanBench 用 Cursor 的 agent CLI 对 Grok 4.7 的四个 effort 档位各跑 23 个任务,共 92 次运行,综合得分从 Low 的 89.42 升到 Extra-high 的 93.15,Extra-high 通过全部 23 个任务。由于 Grok 4.6 是 xAI 模型,本次第二评审换成 GPT-6.1 Sol,其打分比 Muse Spark 1.3 高约 5.4 至 6.3 分,因此该列的综合得分与其他列不完全可比;仅按 Muse Spark 1.3 重新计分后,Grok 4.7 在 Medium、High、Extra-high 仍居首,Low 落后 Claude Fable 5.1。Routine v1 的 12 个常规任务在四个档位全部通过,综合得分 97.14 至 97.37,但每任务耗时从 1.1 分钟增至 4.0 分钟。

阅读原文vulcanbench.com