跳到正文
原文
论文追踪· arXiv:2610.09944·本站收录 · 原文发表 日期未标

AgentTime 基准测试智能体时长遵循能力,GPT-6 Astra 出现 14 次做完后休眠

AgentTime:让 agent 按要求干满时长,GPT-6 Astra 准时但 14/158 次「做完后直接 sleep 等时间」

AI 导读

研究者提出 AgentTime 基准,用于测试 AI 智能体能否按要求工作指定时长、预测自身运行时间并事后估算已用时间。该基准包含来自 18 个来源的 222 项任务,覆盖编码、计算机操作、智能体工作和自动化研究。时长遵循实验中,任务被追加一条指定工作时长的指令,时长从约一分钟到数天不等;Claude Code 中的 Fable 5.1 实际运行时长与要求的典型偏差为 2.9 倍,而 Codex 中的 GPT-6 Astra 仅为 1.2 倍。但符合要求时长本身并不代表持续在任务上工作:在 158 次可分类记录的 Astra 运行中,有 14 次在看似完成后显式休眠等待时间。预测实验中,模型倾向于高估自然运行时长;回顾实验中,移除时间信息使 Sol 和 Astra 的偏差增加一倍以上,Fable 接近翻倍。

阅读原文arxiv.org