微软 FARA 7B 在 WebVoyager 上的成功率从 74% 降至约 38%
Microsoft's FARA 7B: The Web Agent That Scored 74% — Until a Better Judge Looked Closer
AI 导读
微软研究员 Corby Rosset 与 Browserbase 的 Miguel González Fernández 指出,微软 FARA 7B 网页智能体在 WebVoyager 基准上由官方 GPT-4o 判分得到 74% 成功率,改用经人工标注校准的通用验证器后降至约 38%。他们认为现有 LLM 判分器存在系统性缺陷:使用较弱模型、跳过评分细则、忽略或过量摄入截图导致上下文溢出,甚至不看最终答案与操作历史。通用验证器按固定流程工作,先生成评分细则,再对每条细则排序最相关的截图证据,输出可给部分分的 process score 与结果布尔值,并区分智能体可控与不可控的失败。团队用 3000 和 9000 条轨迹做监督微调,按该验证器筛选的数据训练出的模型质量高于基线验证器筛选的数据;验证器将假阳性从接近一半降至零,与人类标注的 Cohen's Kappa 为 0.58。
推荐理由
同一模型同一基准,官方 GPT-4o 判分给出 74%,经人工校准的通用验证器只有约 38%,差距来自判分器设计而非模型本身。