Scale AI 发布 HarnessOpt-Bench,评测 LLM 的 Agent 框架优化能力
Scale AI 研究团队发布 HarnessOpt-Bench,用于在评估成本高且结果随机的条件下衡量前沿 LLM 端到端优化 Agent 框架(harness)的能力。优化器由一个 LLM 搭配编码框架组成,接收目标 Agent 的初始框架、带评分的评估反馈和固定的目标评估预算,通过修改框架并提交最终候选方案,其得分由在搜索全程不可见的留出测试集上相对初始框架的归一化增益决定。可信执行环境负责执行评估边界、计量目标 Agent 的资源消耗并保留候选版本以供审计。研究在 4 个下游任务上以共享编码框架和各自原生框架两种方式评测 5 个前沿 LLM 作为优化器,共完成 111 次计分运行。结果显示,优化器模型之间的差异大于它们所用编码框架之间的差异,原生框架并不总是更优,增益在不同任务和初始框架条件下波动明显。