AgentTime 评测:GPT-6 Astra 按时结束率高,但 158 次转录中 14 次做完后显式 sleep
AgentTime 用 222 个任务(18 个来源,含编码、computer use、agentic 工作、自动化研究)评测 agent 的时长自控能力,请求时长从约 1 分钟到 60 小时。在原生 harness 里,Fable 5.1(Claude Code)与请求时长的典型偏差约 2.9 倍,GPT-6 Astra(Codex)约 1.2 倍;达到请求时长(≥0.95×)的比例分别为 Fable 45%、Sol 87%、Astra 97%,换 harness 后差距仍在,作者认为主要来自模型本身。作者阅读准时结束的转录后发现,Astra 49 次中只有 11 次符合持续工作标准,其余 38 次里 24 次在复查旧工作、14 次在看起来做完后显式 sleep;158 次可分类的 Astra 转录中共有 14 次显式 sleep,Sol 13 次中 3 次以 sleep 结束。