跳到正文
原文
Redwood Research· Dylan Xu·· 9 天前精选关注度78

Redwood 评测:GPT-6-Astra 用填充 token 推理的能力远超此前模型

Astra is much better at reasoning with filler tokens than previous models

AI 导读

Redwood Research 测量 GPT-6-Astra 在提示词被无意义填充 token 占位、且被要求不推理时直接作答的表现,发现它在需要大量串行认知的任务上明显优于无填充 token 的情况,例如 4-hop 自然事实推理从约 10-20% 提升到约 50%,旧 AIME 题从约 60-70% 提升到约 90%。

推荐理由

Redwood 用填充 token 测出 Astra 存在大量未言明的推理,为思维链监控的可靠性提供了可复现的评测方法。

阅读原文blog.redwoodresearch.org