跳到正文
原文
arXiv:对齐、欺骗与监督· arXiv:2610.11123· Xiaolong Li, Xiaohan Xu, Jinyang Li, Xinnuo Xu, Ge Qu, Nan Huo, Jack Williams, Reynold Cheng·本站收录 · 原文发表

GenUI-Harness:面向主动交互的数据感知生成式 UI 框架

When Interfaces Speak: Data-Aware Generative UI Harness for Active Interaction

论文速读

其他

据论文 PDF 整理(AI 生成),以原文为准

GENUI-Harness在UI-TAU Lite上将4B的Pass@3从9.33%提到58.00%。

问题
复杂服务任务里,纯文本容易含糊、信息散乱,并要多轮澄清。作者要让智能体按数据库证据生成界面,收集缺失输入,并完成可核验的数据库更新。
方法
Tool Agent先做只读检索,GUI Coder再生成React/TypeScript界面收集输入,然后执行一次动作。Dynamic UX负责隔离渲染;Reward Auditor按数据库状态修订训练奖励。
实验与结果
Lite上GENUI-Harness比smolagents的宏平均Pass@3高4.48个百分点。训练后的4B Pass@3为58.00%,同为生成界面设置的Claude Opus 5为46.67%。生成界面把评审对话从3.4降到1.2。
局限与可以继续做的
作者指出模拟用户能看到源码和参考目标,调查只覆盖始终可交互的界面,严格状态相等会拒绝标识符、顺序或自由文本不同的等价结果。Full四套对比只用开源骨干,且每任务一轮。
实验设置GENUI-4B、Qwen3.5-4B 等 · UI-TAU Bench · Pass@3、Avg@3 等
被测模型
GENUI-4BQwen3.5-4BQwen3.6-27BQwen3.6-35B-A3Bgpt-oss-120bDeepSeek V4 FlashQwen3.5-397B-A17BGPT-5.4Claude Sonnet 4.6Claude Opus 5
基准
UI-TAU Bench
指标
Pass@3Avg@3state exact-matchPass@1
AI 导读GenUI-Harness 是一个多智能体框架,由负责信息检索与任务执行的 Tool Agent 和生成结构化界面前端代码的 GUI Coder Agent 组成,用于替代纯文本的人机交互。它用 Dynamic UX 在单一沙箱内收集交互奖励,并用 Reward Auditor 元奖励机制抑制 LLM-as-a-Judge 的奖励作弊。在基于 Tau-Bench 工具使用设置、含 10 个真实领域数据库的 UI-TAU Bench 上,Lite 分片(300 任务)Pass@3 平均比 smolagents 高 4.48 个百分点,4B 骨干模型经训练从 9.33% 提升至 58.00%,超过 Claude Opus 5 的 46.67%;评审调查中生成式 UI 将平均对话轮次从 3.4 降至 1.2。

GenUI-Harness 是一个多智能体框架,由负责信息检索与任务执行的 Tool Agent 和生成结构化界面前端代码的 GUI Coder Agent 组成,用于替代纯文本的人机交互。它用 Dynamic UX 在单一沙箱内收集交互奖励,并用 Reward Auditor 元奖励机制抑制 LLM-as-a-Judge 的奖励作弊。在基于 Tau-Bench 工具使用设置、含 10 个真实领域数据库的 UI-TAU Bench 上,Lite 分片(300 任务)Pass@3 平均比 smolagents 高 4.48 个百分点,4B 骨干模型经训练从 9.33% 提升至 58.00%,超过 Claude Opus 5 的 46.67%;评审调查中生成式 UI 将平均对话轮次从 3.4 降至 1.2。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    GENUI-Harness用检索证据生成界面,收集输入并完成数据库动作。

    如何在数据库服务任务中生成界面,收集用户未说清的输入,并使数据库到达目标状态。

    • 场景:作者认为复杂目标任务不适合纯文本:需求要写成句子,又常常说不全,记录也散。Figure 1 中,文本逐轮追问,生成界面把检索选项和未决字段放进同一次提交。
    • 现有不足:作者称现有工具智能体和 Tau-Bench 仍以文本澄清为主。Section 7 称澄清与生成界面工作通常把界面生成和数据库动作执行分开。
    • 假设:作者认为应展示已接地的候选记录,并把控件限制在未决字段,以减少多轮追问和接地错误。
    • 本文提出:该任务、GENUI-Harness、Dynamic UX、Reward Auditor,以及 UI-TAU Bench(10 个领域;Lite 300 条,Full 1,000 条)。
  2. 有哪些相关研究?

    论文将本文放在工具智能体、澄清界面与可执行UI代码之间,并用终态核验。

    作者把相关工作分成工具智能体、澄清式界面和可执行 UI 代码,并把三者接到同一次数据库更新上。

    工具使用与交互评测

    • ReAct 等:ReAct(Yao et al., 2023)、Toolformer(Schick et al., 2023)、API-Bank(Li et al., 2023)和 ToolLLM(Qin et al., 2024)把语言推理与 API 调用用于检索和执行。
    • Tau-Bench:Yao et al.(2025)用模拟用户、领域工具和数据库状态评测,澄清走文本。附录 B 对比:本文仍做数据库执行,但改由生成的可执行界面收集选择。
    • 已有界面上的智能体:WebShop、Mind2Web、WebArena、ToolSandbox、AppWorld、WebLINX 等评测网页、应用或对话中的工具使用。论文此处只作描述。

    澄清与生成式界面

    • 混合主动与澄清:Horvitz(1999)、Rao and Daumé III(2018)、Aliannejadi et al.(2019)等用提问或选项补全意图。Section 7 称这类工作通常把界面生成和数据库动作执行分开。
    • 结构化澄清界面:MIMICS(Zamani et al., 2020)用问题与选项窗格;AmbigChat(Ma et al., 2025)用控件做层级消歧。
    • 按任务合成界面:Supple(Gajos et al., 2010)、DynaVis(Vaithilingam et al., 2024)、Chen et al.(2026)等按任务或数据生成界面。EvoGenUI-Bench(Peng et al., 2026)评测同一界面跨五轮修订;附录 B 对比:UI-TAU 评测引出未决意图并完成终端数据库动作。

    UI 代码与奖励反馈

    • 执行反馈改代码:UICoder(Wu et al., 2024)、CodeT(Chen et al., 2023)和 CodeRL(Le et al., 2022)用编译、渲染或测试改进代码。Section 7 称它们把代码生成当作终点,而不是智能体循环的一环。
    • 评审与奖励投机:论文引用 LLM-as-a-Judge(Zheng et al., 2023)以及奖励过优化和 reward gaming(Gao et al., 2023; Skalse et al., 2022),说明语言模型打分可能给用起来会失败的界面高分。

    基线方法与基准

    • 对照框架:smolagents、mini-swe-agent、Pi,保留各自文本交互。基准是 UI-TAU Bench,工具设定来自 Tau-Bench,任务落在 10 个由公开数据建成的领域库。

    作者把检索记录、可执行交互和终端状态评测放进同一任务,并把数据库接地、动作执行与按任务生成界面分开(Section 7、Section 8)。

  3. 论文如何解决这个问题?

    Tool Agent检索并执行,GUI Coder生成界面,奖励再按任务终态修订。

    GENUI-Harness 用 Tool Agent 做检索和最终动作,用 GUI Coder Agent 把未决参数变成用户直接操作的界面。评测任务由 UI-TAU Bench 提供。

    任务设定

    • 实例:每个任务有用户请求、初始数据库、查询/动作工具和领域规则,工具设定沿用 Tau-Bench。请求可以只表达目标的一部分。
    • 可见信息:智能体看到请求、工具 schema、检索记录和后续用户输入。只读查询收集证据,界面取得输入,一次终端动作更新数据库。
    • 目标状态:参考动作从初始状态执行后得到目标数据库状态。成功要求执行成功,且结果状态与目标状态精确一致。附录 A.1 给形式定义。

    三阶段交互

    • 检索:Tool Agent 按 ReAct 调用只读工具,最多 5 轮,取出记录和用户资料,并把查询与探索历史交给 GUI Coder。
    • 生成界面:Coder 区分已定参数、候选值和只能由用户决定的参数,为后者选控件,输出单个 Material UI 的 React/TypeScript 组件。已解决项作为上下文或预填。提交是 JSON,键为动作参数名。
    • 执行:Tool Agent 结合查询、探索历史和提交值,最多再查 5 轮,然后调用一次动作工具。
    • 模拟用户:固定为 DeepSeek-V4-Flash-0731。它收到 TSX、初始 ARIA 快照和编码成参考动作的完整目标,用 Playwright 操作界面,不能直接改库。参考动作不输入给两个智能体。附录 H 给出角色模板。

    基准构建

    • 领域库:四名博士研究者把公开数据整理成 10 个领域库,每库含面向用户的实体表、资源表和事务表。附录 C 记录来源与许可。
    • 工具:先写领域规则,再定义只读查询和动作工具。查询须无错、非空且与参数一致;动作须符合规则并到达目标状态。失败最多修两次,第二名标注者复核,仍不一致则丢弃。
    • 任务:合成代理用 Claude Opus 5。除用户标识外的内部标识被掩去;中等歧义再掩 2–3 个参数,高歧义再掩 4–5 个。请求不写出被掩值。须过执行、对齐和两人评审。Table 1 的初评一致率为 Lite 94.1%、Full 94.3%。

    训练

    • 数据:Claude Sonnet 4.6 合成 40 个数据库,与评测的 10 个领域不相交。DeepSeek V4 Flash 在框架内生成轨迹,只保留终态匹配且 ARIA 快照有效的成功轨迹。25 个库做 SFT,15 个库做 RL。
    • 初始化:Tool Agent 与 GUI Coder 都从 Qwen3.5-4B 全参数微调。随后固定 Tool Agent 的 SFT 检查点,只对 GUI Coder 做 GRPO。
    • GRPO:1,500 条训练提示、41 条验证提示,500 次更新,每提示 8 条 rollout,过采样系数 2.0,序列上限 16,384,KL 系数为 0,LoRA rank 16、alpha 32,温度 1.0。Direct RL 与两轮审计各自从同一 SFT 初始化独立训练。

    渲染与奖励

    • Dynamic UX:单个沙箱共享渲染运行时和浏览器进程,每个 rollout 用隔离的浏览器上下文,返回执行状态和初始 ARIA 快照。
    • 初始奖励:DeepSeek V4 Flash(温度 0)对功能等价、特征完整、实现正确、任务对齐打 0–5 分。记四项为 qife、qifc、qiic、qita,前置检查通过与否为 gi,则 ji=(0.35qife+0.35qifc+0.15qiic+0.15qta)/5, ri=gi ji。即加权平均后再除以 5;检查失败则为 0。
    • Reward Auditor:Claude Opus 5 在 15 个 RL 库的内部 rollout 上,把终态精确匹配标签与预测 ẑi = I[ri ≥ 0.5] 对照,修订标准与计分,并在固定代码上重放后才接受。共两轮。最终奖励按失败阶段给不同低分,再对通过项做质量分和可访问性系数。附录 D.8–D.9 给完整规格。
  4. 论文做了哪些实验?

    Lite上9个骨干中有7个的Pass@3以GENUI-Harness为四套最高。

    主比较是同一任务上四套 harness 的数据库状态精确匹配;另有 4B 训练、失败解剖、渠道调查和 GUI-Coder 替换。

    实验设置

    • 被测骨干:Qwen3.5-4B、Qwen3.6-27B、Qwen3.6-35B-A3B、gpt-oss-120b、DeepSeek V4 Flash、Qwen3.5-397B-A17B、GPT-5.4、Claude Sonnet 4.6、Claude Opus 5,以及由 Qwen3.5-4B 训出的 GENUI-4B。
    • 框架:GENUI-Harness 走生成界面;smolagents、mini-swe-agent、Pi 保留各自文本循环。任务、数据库、工具、用户模拟器和终态评测器相同。
    • 数据:UI-TAU Bench,10 个领域。Lite 300 条(中等歧义 161、高歧义 139),Full 1,000 条(523、477)。每领域 Lite 30 条、Full 100 条。
    • 协议:Lite 每条 3 个 session,温度 0.7,输出预算 32K token。Full 的四套对比每条 1 个 session,且只含上述 6 个开源骨干。
    • 指标:执行成功且数据库状态与参考状态精确一致记为 1。Pass@3 是三轮至少一轮成功的百分数,Avg@3 是三轮成功率的平均。Full 的单轮成功率也称 Pass@1。
    • 模拟用户:DeepSeek-V4-Flash-0731,跨框架固定。生成界面时它看到 TSX、初始 ARIA 和参考动作,但必须通过渲染后的界面操作。成功不由模拟器判定,也不是 LLM 评审分。

    主结果

    据 Table 2,Lite,300 条,三 session,温度 0.7,Pass@3(%)。

    表格较宽,可左右滑动

    模型GENUI-Harnesssmolagentsmini-swe-agentPi
    Qwen3.5-4B9.3310.6711.6713.67
    Qwen3.6-27B54.3351.6743.3343.33
    gpt-oss-120b47.6730.0050.0040.33
    DeepSeek V4 Flash49.6749.3342.0040.67
    Qwen3.5-397B-A17B56.0048.3343.3342.33
    GPT-5.440.0035.6735.6735.67
    Claude Sonnet 4.651.3348.0047.6740.67
    Claude Opus 546.6744.6740.0043.33
    • 行内最高:作者称九个骨干里有七个以 GENUI-Harness 的 Pass@3 最高;例外是 Qwen3.5-4B 与 gpt-oss-120b。相对三个文本框架更高的骨干数分别为 8、7、8。
    • 宏平均:作者报告相对 smolagents 的 Pass@3 高 4.48 个百分点,任务配对 bootstrap 95% 区间为 [2.37, 6.59](Table 10,10,000 次重抽样)。作者称该对比衡量完整系统,而不是单独的界面通道。
    • 省略行:Qwen3.6-35B-A3B 的 Pass@3 为 47.33 / 43.67 / 36.33 / 38.00(顺序同表)。未经训练的 4B 在本框架中低于三个文本框架。

    训练与奖励审计

    • 测了什么:固定 SFT 后的 Tool Agent,只训练 GUI Coder。正文称 Direct RL 与两轮审计各自从同一 SFT 初始化独立训练,不是一条连续轨迹。
    • 结果:SFT 将 Avg@3 从 3.22% 提到 27.67%。最终审计奖励下 GENUI-4B 为 Pass@3 58.00%、Avg@3 36.00%。Figure 6 还标有 30.67 与 32.67;文本抽取不能确认它们对应 RL 还是 Audit 1。论文未报告中间检查点的 Pass@3。
    • 作者解读:作者称最终奖励先区分代码抽取、结构、渲染和空界面失败,再做质量与可访问性计分,并称 58.00% 与 36.00% 高于 Table 2 中最强基线的两项。Table 2 的 GENUI-Harness 列中,Pass@3 最大格为 56.00%(Qwen3.5-397B-A17B),Avg@3 最大格为 35.67%(Claude Sonnet 4.6);三个文本框架的 Pass@3 最大格为 51.67%(Qwen3.6-27B,smolagents)。

    失败类型与沟通渠道

    • 失败构成:DeepSeek V4 Flash、Claude Sonnet 4.6、Claude Opus 5、GENUI-4B 各 300 条、单 session,与 Table 2 的三 session 不同。800 次失败中,无有效 UI 交互 52.0%,参数或结果状态不匹配 44.5%,执行被拒 3.5%。Table 15 的错误工具列均为 0。
    • 轨迹抽样:每模型两类各 8 条,共 64 条,种子 42;作者称频率不外推。机制包括控件表达不了所需选择,以及提交值与目标不符。单 session 成功数为 108、101、98、93(顺序同前,分母各 300)。
    • 渠道调查:100 条在三个 session 都能执行并完成模拟器交互的任务(不是状态精确匹配),6 名评审者分看文本或生成界面。平均对话轮数从 3.4 降到 1.2。延迟被至少两名 UI 评审者接受的任务为 85/100(Appendix F)。

    GUI-Coder 替换与无歧义请求

    据 Table 3,Lite,Avg@3(%)。预检索输出固定,只替换界面生成,后段仍用原模型。

    模型原界面换入 GUI-Coder
    Qwen3.6-35B-A3B26.8929.33
    DeepSeek V4 Flash30.2238.67
    GPT-5.425.2230.00
    Claude Sonnet 4.635.6742.33
    Claude Opus 531.5640.33
    • 作者解读:作者称五项都更高;因上游轨迹和后段模型固定,变化只来自界面生成,故认为 GUI-Coder 不依赖某一个上游模型。
    • 无歧义变体:揭开原请求里被掩码的面向用户参数,工具、数据库、模拟器和评测协议不变。作者称 Figure 7 中 GENUI-4B 在有歧义和无歧义下都最强,界面还可用来组织检索结果并确认动作。图中柱值与模型的对应在文本抽取里对不齐,故不转写柱高。

    其他消融与分析

    • Full(1,000 条、单轮、6 个开源骨干):GENUI-4B Success Rate 40.90%;Table 11 中 Qwen3.5-4B 的四套 Pass@1 为 4.11 / 3.80 / 4.70 / 5.30,GENUI-Harness 低于 Pi 和 mini-swe-agent。
    • Table 10:相对 mini-swe-agent 的宏平均 Pass@3 差为 +5.81 个百分点(95% 区间 [3.37, 8.26]),相对 Pi 为 +7.15([4.30, 9.96]);Avg@3 差分别为 +3.00 与 +4.04。
    • 作者称成功回合中,GENUI-Harness 的智能体轮数少 36–43%,且 Avg@3 更高(Section 6.2、Figure 5)。正文未给原始轮数。
    • Dynamic UX 相对每轮新开浏览器:吞吐平均高 18.2%,中位延迟低 15.3%,峰值 RSS 低 35.2%,Chromium 进程数低 59.4%(Section 5.1,1,100 个已验证组件)。
    • 并发 16 时作者称吞吐高 37.5%,中位与 P95 延迟低 29.2% 和 41.3%,峰值 RSS 低 48.1%,Chromium 进程少 76.0%(Appendix D.7)。
    • 1,000 个带标记 session 在并发 32 下完成;作者称无超时、失败或内容泄漏。
  5. 有什么可以进一步探索的点?

    作者指出模拟用户能看到源码和参考目标,严格状态匹配会拒绝等价结果。

    作者把模拟用户所见信息、调查子集、视觉证据和严格状态匹配写成局限,并把 source-blind 评测与自适应重生界面写成后续方向。

    作者指出的局限与后续方向

    • 模拟用户所见:模拟器能看到生成源码和参考目标,可能比只看界面的用户更能操作;作者把基于人可观察状态的 source-blind 评测列为后续方向(Appendix G)。
    • 调查子集:评审者调查只覆盖一批始终可用的界面,而不是全部任务(Appendix G)。
    • 视觉可用性:作者称代码执行和可访问性树未必覆盖重叠布局或难于辨认的排布(Appendix G)。
    • 状态相等:严格的数据库状态相等会把标识符、顺序或自由文本不同、但语义等价的结果判为失败(Appendix G)。
    • 再生成界面:作者把进一步澄清之后再自适应重生界面列为后续方向(Appendix G)。

    实验覆盖范围

    • Lite 为 9 个骨干、4 个 harness、300 条任务、每条 3 个 session、温度 0.7(Table 2、Section 6.1)。
    • Full 的四套对比为 6 个开源骨干、1,000 条、每条 1 个 session;同协议下 GENUI-4B 的 Success Rate 为 40.90%(Table 11、Appendix D.6)。
    • 领域为航班、酒店、银行账户、餐厅预订、电商、电影票、活动票务、医疗预约、零售、租车,各 30/100 条(Table 6)。
    • 成功由终态精确匹配判定;用户模拟器为 DeepSeek-V4-Flash-0731。渠道调查为 6 人、100 条三个 session 都可交互的任务(Section 6.3、Appendix F)。
    • GUI Coder 的 GRPO 从 Qwen3.5-4B 出发,Tool Agent 固定在 SFT。论文给出宏平均差的 95% bootstrap 区间(Table 10),未报告各骨干的原始查询次数;成功回合只报告少 36–43% 的智能体轮数(Section 6.2)。
  6. 总结一下论文的主要内容

    数据感知界面加奖励审计;训练后4B在Lite上Pass@3为58.00%。

    GENUI-Harness 把数据库服务任务的交互,从纯文本改成按当前请求和检索记录生成的界面。

    • 要完成的事:请求往往说不全。智能体要只读检索记录,向用户收集缺失参数,并执行一次使数据库到达参考状态的动作。
    • 做法:Tool Agent 最多查 5 轮,GUI Coder 生成单个 React/TypeScript 界面,提交后再最多查 5 轮并执行动作。Coder 从 Qwen3.5-4B 做 SFT 和 GRPO;Dynamic UX 隔离渲染,Reward Auditor 用终态是否精确匹配来改奖励。
    • 基准:UI-TAU Bench 有 10 个领域,Lite 300 条、Full 1,000 条。指标是状态精确匹配的 Pass@3 与 Avg@3。对照框架保留文本交互。
    • 主结果:九个骨干的宏平均上,该框架比 smolagents 的 Pass@3 高 4.48 个百分点(95% 区间 [2.37, 6.59])。未经训练的 Qwen3.5-4B 在该框架中 Pass@3 为 9.33%,低于三个文本框架;gpt-oss-120b 也不是四套中的最高。训练后的 GENUI-4B 为 58.00% Pass@3、36.00% Avg@3。Table 2 里 Claude Opus 5 的生成界面 Pass@3 为 46.67%。
    • 其他结果:Table 3 中换上 GUI-Coder 后五个模型的 Avg@3 都上升。评审调查里对话轮数从 3.4 降到 1.2。Full 单轮下 GENUI-4B 的 Success Rate 为 40.90%。作者称在目标已经写明时,GENUI-4B 仍是 Figure 7 两种设置里最强的。
    • 作者结论:作者称可执行、以数据为据的界面可以作为数据库智能体的交互层;同时指出模拟用户能看到源码和参考目标,严格状态相等会拒绝一些语义等价结果。
阅读原文arxiv.org