METR 提出“支出视界”指标衡量 AI 智能体优化能力,并以 NanoGPT 为例
Expenditure Horizon: Measuring Optimization Ability, with an Application to NanoGPT
AI 导读
METR 提出用“支出视界”衡量 AI 智能体的优化能力,即人类与 AI 成本效益曲线相交的预算点。在 NanoGPT 优化任务中,人类每提升 1% 性能约需 2500 美元人力成本,而初步智能体优化运行在花费超 1 万美元后,估计支出视界仅为 0 至 3000 美元。该方法可连续评分并纳入实验算力成本,适用于 RE-bench、MLE-bench 等 AI R&D 基准。