跳到正文
原文
Hugging Face Daily Papers· arXiv:2610.03036·本站收录 · 原文发表

WebFovea 提出视觉网页智能体四阶段加固框架,WebRetriever 挑战赛得分从 31.0 升至 57.0

WebFovea: When the Model Is Right but the Click Is Wrong -- Reliable Round Trips for Vision-Based Web Agents on Live Websites

AI 导读

WebFovea 是一个视觉网页智能体,在 WebRetriever Challenge 2026 中以 57.0 分(满分 100)获得第二名。该挑战基于 WebRetriever 基准的 Protocol III,要求智能体从实时网站入口 URL 出发,操作网站自身界面并返回可验证答案。作者认为多模态大语言模型是必要条件但不充分,模型决策需经 harness 传递到浏览器,每一步有四个环节必须正确:模型回复被解析为预期动作、动作在页面上生效、结果被准确回报、模型看到所需信息。在真实网站上观察到的许多失败发生在这些环节而非模型推理,例如坐标空间不匹配导致每次点击落在目标坐标的 3/4 处,原生下拉框、iframe 内和文本框中的操作静默失败,自生成的 chat-template token 污染了 4.9% 的任务回合。代码已开源。

阅读原文huggingface.co