研究者开源 Universal Verifier 与 CUAVerifierBench,用于验证计算机使用 Agent 轨迹
The Art of Building Verifiers for Computer Use Agents
作者构建Universal Verifier,Internal上outcome的κ为0.64、FPR为0.01。
- 计算机使用轨迹长、截图密、成败含糊,核验出错会污染评测与训练。作者要构造能同时判断过程与结果、并对照人类的验证器。
- Universal Verifier只凭任务生成互不重叠准则,再按准则取相关截图,分开过程分与二元结果,并区分可控与不可控失败。截图与声称冲突时截图优先;未请求副作用单独检查。
- Table 2中UV(GPT-5.2)的outcome κ为0.64(Internal)与0.58(Browserbase),FPR为0.01与0.08。作者称与人类彼此一致程度相当;空白auto-research达专家质量的70%。
- 论文未专门讨论局限。人工标签为Internal 140条与Browserbase 106条;三基准重评分以UV为参考,不是人类标签。论文未报告主实验的top-k与多数票次数。
- 被测模型
- GPT-5.2GPT-4oo4-minio3GPT-5GPT-5.1GPT-5.4Fara-7B
- 基准
- CUAVerifierBenchWebTailBenchOnline-Mind2WebWebVoyagerAgentRewardBench
- 指标
- Cohen's κAccuracyF1FNRFPRSuccess rate
研究者提出面向计算机使用 Agent(CUA)轨迹的验证器 Universal Verifier,并开源该系统与配套基准 CUAVerifierBench。该验证器基于四项设计原则:用互不重叠的评分标准构建 rubric 以降低噪声;区分过程奖励与结果奖励以捕捉步骤正确但被阻断或走非预期路径成功的情况;区分可控与不可控失败并采用无级联错误策略评分;用分治式上下文管理关注轨迹中的全部截图以提升长任务可靠性。在带有人工过程与结果标注的 CUAVerifierBench 上,其与人类的一致程度达到人类彼此一致的水平,误报率相比 WebVoyager(≥45%)和 WebJudge(≥22%)降至接近零。作者还发现自动研究 Agent 能在 5% 时间内达到专家 70% 的质量,但未能发现复现该验证器所需的全部策略。
深度解读
这篇论文试图解决什么问题?
CUA轨迹成败难核验,作者用四条原则做Universal Verifier与基准。
计算机使用智能体轨迹是否真的成功,缺少可信任的自动核验,评测和训练信号都会被带偏。
- 场景:作者称智能体已能浏览、填表和操作界面,但轨迹长、画面密、成败含糊:可以部分完成,可以走意外路径成功,失败也可能只出现在深层截图里。人工标注又难又贵,核验出错会同时污染基准和训练数据。
- 现有不足:作者称依赖最终答案会被幻觉带偏,把全部截图放进一个窗口又会过载;过程与结果混在一起时,信号要么过宽要么过严。摘要写假阳性相对 WebVoyager(≥45%)和 WebJudge(≥22%)降到近零;引言写从 30%+ 降到 1–8%。
- 设计观察:作者认为准则要具体且互不重叠,过程奖励与结果奖励应分开,可控失败与不可控失败应分开,并看到轨迹中的全部截图证据。作者称 Figure 1 里,较好的 rubric 设计单独约占 Cohen's κ 增益的一半。
- 本文做法:作者提出四条原则和 Universal Verifier,并发布带过程、结果人工标签的 CUAVerifierBench。作者称据他们所知,这是首个专门衡量两类奖励下验证器质量的基准;摘要称开源该系统与基准,脚注写代码与数据将可用。
有哪些相关研究?
作者把本文放在轨迹裁判与过程/结果奖励文献之间,并用双标签基准衡量验证器。
作者按验证器吃哪些输入、以及过程奖励还是结果奖励来组织相关工作,并把 WebVoyager 与 WebJudge 当作本文实验基线。
轨迹自动评测
- WebVoyager(He et al., 2024b):GPT-4V 接收全部轨迹截图(不含全部动作历史)和智能体最终答案,给出二元结果。作者引用其在 300 个任务上与人类一致率 85.3%(κ=0.70),并称与人工标注者间一致率相当。
- WebJudge(Xue et al., 2025):先从任务描述抽要点,再给截图打相关性,只用 top-k 截图和完整动作历史判断,以避开幻觉最终答案和截图过载。作者引用同设置下 o4-mini 的人类一致率 85.7%,对照文中给出的 WebVoyager 78.7%。
- AgentRx(Barke et al., 2026):找出关键失败步,并从九类原因中指定根因。论文只作描述。
奖励基准与裁判
- AgentRewardBench(Lù et al., 2025):1302 条专家标注轨迹,覆盖 WebArena、VisualWebArena、AssistantBench、WorkArena、WorkArena++,智能体为 GPT-4o、Claude 3.7 Sonnet、Llama-3.3-70B、Qwen2.5-VL。Simplified Judge 一次补全预测任务成功、副作用和重复循环。作者转述其发现:没有基于 LLM 的裁判精度超过 70%,其中包括 NNetNav 与 AER;人工标注者间一致率 89.3%。
过程奖励与结果奖励
- Lightman et al.(2023)与 Uesato et al.(2022)讨论数学题上过程反馈与结果反馈;Wang et al.(2024)训练过程奖励模型;Zhang et al.(2025b)总结数学过程验证器的经验;Zhang et al.(2025a)扩展到 agentic RAG。作者还指向综述 Zheng et al.(2025)与 Stuhlmüller and Byun(2022)。论文未报告与这些工作的定量对比。
基线与本文定位
- 基线方法:实验中的 WebVoyager(GPT-4o,并换为 GPT-5.2)与 WebJudge(o4-mini,并换为 GPT-5.2)。Table 1:前者不用 rubric、不用动作历史,用截图和最终答案,截图超限时保留最后 N 张(默认 N=30);后者不用 rubric 和最终答案,截图按 1–5 分、达阈值才保留、最多 5 张,并使用完整动作历史;UV 用按任务的成功准则、每准则 top-k 截图、完整动作历史和最终答案,骨干写为 gpt-5.2。
- 基准:自建 CUAVerifierBench;规模对照用 WebVoyager、Online-Mind2Web、WebTailBench;附录另抽样 AgentRewardBench。
- 作者把本文定位为 CUA 验证器的设计原则,并用同时含过程与结果标签的基准,以 Cohen's κ 迭代对照人类。作者称该基准据他们所知是首个专门衡量这两类奖励下验证器质量的基准。
论文如何解决这个问题?
先只凭任务出互不重叠准则,再按准则取截图,分开过程分、结果与失败诊断。
作者把核验做成 Universal Verifier:只凭任务生成互不重叠准则,按准则检索截图,再分别给出过程分、二元结果和失败诊断。
问题设定
- 任务:元组 (g, E)。g 是自然语言目标,E 是带图形界面的计算机环境。轨迹含截图与点击、输入、滚动等动作,T 从填表的数步到多阶段流程的数百步。
- 输出:验证器把目标和轨迹映到过程分、结果分和诊断报告。过程分在 0 到 1,结果分为 0 或 1。质量定义为与人类 oracle 的 precision、recall 和 Cohen's κ。
- 作者称只看最后一帧或固定子集是对完整验证器的严格近似,T 大时会系统性变差。
Rubric 与两种分数
- 准则只从任务生成,不看轨迹,以免迁就智能体行为。作者写识别了四类系统性失败,随后列出五项及改法:臆造任务未要求的准则、准则不独立导致级联扣分、生成与打分必须分开、用有无截图的两遍打分暴露幻觉、条件准则在条件不满足时从分子分母都剔除。
- 适用准则集合 A 上的过程分定义为 rproc=∑i∈ A earnedi/∑i∈ A maxi,即实得分之和除以满分之和。评分后可更新条件准则,或为未请求副作用追加准则。
- 结果标签问合理用户是否认为任务已完成。作者假定聚焦主意图,对把 5.95 美元四舍五入到 6 美元一类 nitpick 宽容,对未请求副作用和幻觉不宽容。Table 6 中二者只在环境阻挡一行分叉:智能体已清楚报告且未改走替代路径时,过程可满分,结果仍失败;若替代来源给出正确结果,结果为 SUCCESS。
- 不可控且过程不罚:CAPTCHA、无凭证登录墙、实体不存在、缺货或售罄、检索无法同时满足全部条件。可控且过程要罚:意图不匹配、推理错误、幻觉、一次失败就放弃、不用可用过滤器或跳过必要步骤。
截图证据与副作用
- 每张截图对每条准则打分,形成相关性矩阵,每条准则只送 top-k。附录 A.3.1:可按截图并行,共 M 次调用,作者写可用更小模型如 o4-mini;某准则已有高于 7 的截图时,可丢掉时间上更早且低于 5 的截图;并列时取更后的截图。作者称 Figure 6 的矩阵呈楼梯形,多数轨迹较线性。
- 截图与声称冲突时截图优先。Table 7:矛盾、捏造、遗漏判失败;由全页缺失得到的有支持推断,以及截图已视觉确认但未明说,判成功。
- 未请求且有实质副作用的动作,生成 rubric 时通常预料不到,需单独扫一遍。作者称这类情况几乎总导致结果失败,过程分只按副作用轻重部分扣分。
流程与诊断
- Algorithm 1 共十步:生成准则、相关性矩阵、top-k、抽证据、消解条件冲突、reality check 并给出仅动作历史的分、用截图整体重打分、副作用检测、结果核验、失败诊断。步骤 7–9 可并行多份,过程分取中位数,结果取多数票。论文未写主实验的投票次数和 k;代价示例取 K=5。
- 作者称错误分类为手工的 7 类、24 个子码(Table 10),覆盖选择错误、幻觉、执行与策略、关键点、任务歧义、副作用和工具交互。作者以一条日志为例:M=47、N=3、K=5、S=10 时,无多数票共 65 次 LLM 调用(Table 8)。
论文做了哪些实验?
UV(GPT-5.2)在Internal上outcome κ为0.64、FPR为0.01,高于两基线。
实验设置
- 验证器骨干:主对比为 UV 的 GPT-5.2、WebVoyager 的 GPT-4o、WebJudge 的 o4-mini,并把后两者换到 GPT-5.2。消融另用 o3、GPT-5、GPT-5.1、GPT-5.4(附录 B.1,仅 Internal)。
- 轨迹模型:人工集来自 Fara-7B。规模重评分另用 GPT-5 作为 Set-of-Marks 智能体。Auto-research 用 Claude Code v2.1.87 与 Claude Opus 4.6(1M context)。
- 数据:Internal 为 WebTailBench 上 Fara-7B 的 140 条,内部专家按第 3 节标注过程与结果。Browserbase 为 Online-Mind2Web 上 Fara-7B 的 106 条,每条 2 人,先用 10 条金标练习校准;UV-blind 不见 UV 输出,UV-informed 再看 UV 的结论与分数。规模集为 WebVoyager、Online-Mind2Web、WebTailBench。
- 聚合与指标:结果为多数票,过程为 rubric 中位数再按 ≥0.8 二值化,平票由第三人打破。指标为 Accuracy、F1、Cohen's κ、FNR、FPR。Table 15 为 3 次独立运行的均值和标准差。Table 3 以 UV 为参考标签,其 FPR/FNR 不是相对人类。
- 未写明的运行参数:主实验的 top-k、多数票次数,以及相关性打分实际调用的模型。Table 1 只写 WebVoyager 默认 N=30、WebJudge 截图最多 5 张。
主结果
下表为对照人类的 outcome Cohen's κ 与 FPR(Table 2)。Table 15 图注把 Browserbase 列的人类标签写成 UV-informed 聚合;Internal 正文未这样写。
表格较宽,可左右滑动
验证器 Internal κ Internal FPR Browserbase κ Browserbase FPR WebVoyager (GPT-4o) 0.31 0.45 0.13 0.60 WebVoyager (GPT-5.2) 0.43 0.10 0.36 0.28 WebJudge (o4-mini) 0.44 0.22 0.26 0.40 WebJudge (GPT-5.2) 0.33 0.07 0.31 0.26 UV (GPT-5.2) 0.64 0.01 0.58 0.08 - 作者称 UV 在两个数据集、几乎全部指标上高于两基线,并把 outcome 假阳性压到近零。过程 κ 不在上表:Internal 0.59、Browserbase 0.43,均低于对应 outcome κ;Browserbase 过程 FPR 为 0.20。
- 作者称换成 GPT-5.2 后基线 FPR 下降,但 FNR 上升。WebVoyager 的 Internal outcome FNR 从 0.24 到 0.44,κ 从 0.31 到 0.43。表中 WebJudge 换骨干后 Internal κ 下降,不同于这一“小幅上升”的例子。
- 作者据此称增益来自截图评分等结构,而不是单纯换更强模型,并称增益是上述设计选择的累积效果。
与基准自带验证器的规模对比
- 在 WebVoyager、Online-Mind2Web、WebTailBench 上重打 Fara-7B 与 GPT-5 Set-of-Marks 轨迹,N 为 276–599(Table 3)。对照的是各基准自带验证器,UV 为参考标签;作者只点名 WebVoyager 一侧为 GPT-4o。
- 作者称相对 UV outcome 的 FPR 均高于 20%。Table 3 的六组 outcome FPR 为 0.60、0.72、0.23、0.49、0.25、0.49;最高为 WebVoyager 上 GPT-5,κ 为 0.33。六组原生成功率都高于 UV outcome 成功率,例如 WebVoyager 上 Fara-7B 为 74.6% 对 37.9%,GPT-5 为 90.6% 对 71.0%。
- 相对 UV process 并非一律更低:OM2W 的 GPT-5 为 64.9% 对原生 62.0%,WebTailBench 的 GPT-5 为 63.5% 对 62.5%。未终止比例在 WebTailBench 的 Fara-7B 上为 17.0%。Table 9 按轨迹归一化后,幻觉与执行/策略类高于关键点类;OM2W 上 Fara-7B 的执行与策略为 1.456,关键点为 0.007。
Browserbase 两阶段与标注者间一致
- Table 13:outcome κ 从 UV-blind 的 0.39 到 UV-informed 的 0.63,FNR 从 0.62 到 0.35,FPR 从 0.05 到 0.04;过程 FNR 从 0.32 到 0.09。这与 Table 2 的 Browserbase outcome κ 0.58 不同,论文未说明差异来自哪一种聚合。
- 标注者级 outcome 判断有 16.6% 翻转;34 次中 31 次从成功改为失败。正文写 UV-blind outcome 分歧 22 条,后又写 disagreements 从 21 到 18。
- Table 14(103 条双人):UV-blind outcome κ 0.57、一致率 79.6%;UV-informed 为 0.53 与 82.5%。过程二元 κ 为 0.45 与 0.40,连续分按 0.8 二值化后 κ 0.36;连续过程分 Pearson r=0.62,MAE=0.21。正文称 UV 的 0.58 与 0.43 落在标注者间区间 0.53–0.57 和 0.36–0.45 内;附录 B.2 又写 0.58 略高于该 outcome 区间。Figure 11 的 215 对上,Pearson r=0.61(p<10^{-22}),Spearman ρ=0.58(p<10^{-20})。
骨干消融
- Table 11:同一模型既生成 rubric 又打分。作者称 GPT-5.2 的 FPR 最低(过程/结果 0.03/0.00),但其 outcome FNR 为 0.28,高于 GPT-4o 的 0.12。GPT-5 的过程 Accuracy 为 0.84,outcome κ 与 o3 同为 0.72。
- Table 12:rubric 固定由 GPT-5.2 生成,只换打分模型。作者称 GPT-5.2 最保守(FPR 0.03/0.00),GPT-5.1 的 outcome F1 与 κ 最高(0.89 与 0.74)。
其他消融与分析
- 引言称专家从接近 0 到实验 32 的 κ≈0.7;空白 auto-research 的 κ 平台约 0.55,约为专家质量的 70%。摘要与结论写 70% 质量、5% 时间。图注写专家 32 次实验、约三周,auto-research 约一天;正文又写 Figure 1 覆盖 96 次实验,横轴标到 64。
- 从专家最佳配置继续、且不提高 FPR 时,作者称可超过专家峰值;论文未给出该峰值的精确 κ。相同提示下 outcome κ 可从 0.64 到 0.71;附录把 run 6 的 κ=0.6407 视为运气。
- AgentRewardBench 的 1302 条中,超预算 707 条成功率 6.2%,终止的 595 条为 52.4%(Table 16)。作者对 30 条预算内终止且原标注为成功的轨迹,按自己的结果准则判 8 条为假阳性,FPR≈0.27。
- Table 9 中关键点类多为 0.000,副作用多在 0.002–0.020。附录 C.1 的 auto-research 迭代有提交也有因 FPR 升高而回滚的轮次。
有什么可以进一步探索的点?
论文未专门讨论局限或后续工作。
作者指出的局限与后续方向
论文未专门讨论局限。结论把 auto-research 未能独立发现结构性设计写成实验结果,并称构造验证器同时是工程问题和编码评价判断的问题,没有单独列出局限或后续工作清单。
实验覆盖范围
- 人工标签为 Internal 140 条(WebTailBench,Fara-7B,内部专家)与 Browserbase 106 条(Online-Mind2Web,Fara-7B,每条 2 名标注者,10 条练习校准);过程二值化阈值为 ≥0.8(第 5 节、Table 2)。
- 主对比为 UV(GPT-5.2)、WebVoyager(GPT-4o 与 GPT-5.2)、WebJudge(o4-mini 与 GPT-5.2);Table 15 给出 3 次运行的标准差。Browserbase 主表数字在 Table 15 图注中对应 UV-informed 标签。
- 规模重评分覆盖 WebVoyager、Online-Mind2Web、WebTailBench 上的 Fara-7B 与 GPT-5 Set-of-Marks 轨迹,N 见 Table 3;对照的是基准自带验证器,UV 为参考标签,不是人类标签。
- 消融在 Internal 上更换生成或打分骨干,模型为 GPT-4o、o4-mini、o3、GPT-5、GPT-5.1、GPT-5.2、GPT-5.4(Tables 11–12)。Auto-research 使用 Claude Opus 4.6,设置为空白提示和续写专家配置,约束为不提高 FPR(第 5–6 节)。
- 论文未报告主实验的 top-k、多数票次数,以及相关性打分实际调用的模型。AgentRewardBench 复核为 1 名专家对 30 条样本(附录 B.4)。
总结一下论文的主要内容
四条设计原则叠成Universal Verifier,作者称其与人类一致程度相当且假阳性近零。
Universal Verifier 给计算机使用轨迹打过程分和结果分,并定位失败;CUAVerifierBench 用人工标签衡量这种验证器。
- 作者要解决的是:轨迹长、截图密、成败含糊,核验一错,基准和训练数据一起被污染。设计收成四条:互不重叠的 rubric、过程与结果分开、可控与不可控失败分开、按准则从全部截图中取证据。
- 流程只凭任务出准则,建立截图–准则相关性矩阵并取每条准则的 top-k,再对照动作历史与截图。过程分只在适用准则上按得分比归一化;环境阻挡且已清楚报告时,过程可满分而结果仍失败。截图优先于智能体声称。
- 在 CUAVerifierBench 上,UV(GPT-5.2)相对人类的 outcome κ 为 Internal 0.64、Browserbase 0.58,FPR 为 0.01 与 0.08(Table 2)。同表 WebVoyager(GPT-4o)的 Internal outcome FPR 为 0.45,WebJudge(o4-mini)为 0.22。作者称换成同一 GPT-5.2 后,基线 κ 只小幅变化,并称增益来自结构。Table 15 图注把 Browserbase 主结果的人类标签写成 UV-informed;Table 13 的 UV-blind outcome κ 为 0.39。
- 正文称 UV 与人类的一致程度和人类彼此相当:Browserbase 标注者间 outcome κ 为 0.53–0.57,过程为 0.36–0.45。三基准上,自带验证器相对 UV 的 outcome FPR 都高于 0.20(Table 3)。
- 作者称空白起步的 auto-research 用约 5% 时间达到专家质量的 70%,改动偏保守,未发现专家那些结构性决定;从专家最佳配置继续,则可在不提高 FPR 的约束下再提高。作者的结论是:构造验证器既是工程问题,也是把评价判断写进设计的问题。