跳到正文
原文
arXiv· arXiv:2409.13373· Karthik Valmeekam·· 2024-09-20

PlanBench 评测:o1 规划能力大幅提升但仍未饱和

LLMs Still Can't Plan; Can LRMs? A Preliminary Evaluation of OpenAI's o1 on PlanBench

AI 导读

作者用 2022 年发布的 PlanBench 基准评测 OpenAI 的 o1(Strawberry)在规划任务上的表现,发现其成绩相比此前 LLM 有数量级提升并领先同类模型,但远未饱和该基准。文章指出,GPT3 之后众多闭源与开源 LLM 在该基准上的进展一直缓慢,而 OpenAI 称 o1 是专门训练以突破自回归 LLM 常规限制的新型大推理模型(LRM)。作者认为这一提升同时引出准确率、效率与保证等问题,需要在部署此类系统前加以考虑。

阅读原文arxiv.org