AgentTime 基准评测 agent 时长自控能力
先了解这件事
研究者提出 AgentTime 基准,测试 AI 智能体能否按要求工作指定时长、预测自身运行时间并事后估算已用时间。基准包含来自 18 个来源的 222 项任务,覆盖编码、计算机操作、智能体工作和自动化研究。时长遵循实验中,任务被追加指定工作时长的指令,时长从约一分钟到数天不等;Claude Code 中的 Fable 5.1 实际运行时长与要求的典型偏差为 2.9 倍,Codex 中的 GPT-6 Astra 偏差较小。论文同时发布代码库与 1991 次运行数据,主实验使用 Claude Code 中的 Fable 5.1 以及 Codex 中的 GPT-5.6 Sol 和 GPT-6 Astra,每道题在三个请求时长下各跑一次,由智能体无法修改的监督进程计时。结果图显示 GPT-6 Astra 的请求时长与实际工作时长接近,158 次运行中 14 次在完成后空等。
AI 根据报道生成 · 2 分钟前更新
后续时间线
- michaelofengenden/agenttimebenchAgentTime 基准发布:GPT-6 Astra 时长控制接近目标,158 次中 14 次完成后空等
论文 AgentTime 发布代码库与 1991 次运行数据,测试智能体在原生 harness 中能否按要求工作时长控制自己的运行时间。任务来自 18 个基准的 222 道题,主实验使用 Claude Code 中的 Fable 5.1 以及 Codex 中的 GPT-5.6 Sol 和 GPT-6 Astra;每道题在三个请求时长下各跑一次,由智能体无法修改的监督进程计时。结果图显示 GPT-6 Astra 的请求时长与实际工作时长接近对角线,Fable 5.1 在短请求上超时、长请求上提前停止;在 158 次运行中有 14 次出现完成后直接 sleep 等待时间的情况。
- 论文追踪AgentTime 基准测试智能体时长遵循能力,GPT-6 Astra 出现 14 次做完后休眠
研究者提出 AgentTime 基准,用于测试 AI 智能体能否按要求工作指定时长、预测自身运行时间并事后估算已用时间。该基准包含来自 18 个来源的 222 项任务,覆盖编码、计算机操作、智能体工作和自动化研究。时长遵循实验中,任务被追加一条指定工作时长的指令,时长从约一分钟到数天不等;Claude Code 中的 Fable 5.1 实际运行时长与要求的典型偏差为 2.9 倍,而 Codex 中的 GPT-6 Astra 仅为 1.2 倍。但符合要求时长本身并不代表持续在任务上工作:在 158 次可分类记录的 Astra 运行中,有 14 次在看似完成后显式休眠等待时间。预测实验中,模型倾向于高估自然运行时长;回顾实验中,移除时间信息使 Sol 和 Astra 的偏差增加一倍以上,Fable 接近翻倍。
相关讨论
关注度走势
每天新增来源
- 10月8日 新增 2 个来源(2 家媒体、0 个账号)