跳到正文
原文
论文追踪· arXiv:2609.27273·本站收录 · 原文发表 精选关注度58

微软研究院发布 CAVEAT:电商引导机制使 Agent 最优购买率从 78.6% 降至 17.3%

微软研究院 CAVEAT:电商平台一开赞助位、滴灌定价等引导手段,购物 agent 买到用户最优商品的比例从 78.6% 掉到 17.3%

论文速读

评测与基准

据论文 PDF 整理(Gemini 生成),以原文为准

在 9 个市场环境的 CAVEAT 基准中,8 类引导机制使 5 个模型的最优购买率从 78.6% 降至 17.3%。

问题
当计算机使用智能体所处的在线环境自身存在利益偏好(如电商平台的赞助排名与促销框架)时,智能体能否在不遭受显式恶意注入的情况下依然坚守用户目标。
方法
构建包含 9 个高保真市场环境与 8 种引导机制的基准 CAVEAT,通过配对对照评估最优购买率下降;针对诊断出的三类决策缺陷,提出推断期验证脚手架 CAVEAT-Harness 并结合在策略模仿训练开源模型 CAVEAT-27B。
实验与结果
5 个模型家族在 CAVEAT-Standard 上的最优购买率从对照组的 78.6% 降至引导组的 17.3%;CAVEAT-Harness 将 GPT-5.6-Terra 在 CAVEAT-Shop 上从 11.7% 提升至 66.7%。
局限与可以继续做的
实验主要集中在 CAVEAT-Shop 与少数 CAVEAT-Stay 任务,部分诊断依赖数十次试验;全开启设定属于受控压力测试;未覆盖金融、招聘或动态适应环境;Harness 增加了交互步数与耗时。
实验设置GPT-5.6-Sol、GPT-5.6-Terra 等 · CAVEAT-Standard、CAVEAT-Hard 等 · Optimal Purchase Rate、Graded Preference Score (P*) 等
威胁模型
智能体在具备自身利益诉求的商业市场中行动,平台通过赞助位、优先排序、分拆定价等 8 类机制引导决策,所有信息真实可查且未进行恶意篡改。
模型
GPT-5.6-SolGPT-5.6-TerraGPT-5.6-LunaGPT-5.5GPT-5GPT-4.1GPT-4oDeepSeek-V4-FlashKimi-K2.6Qwen3.5-122B-A10BGrok-4.3Fara1.5-27BQwen3.5-27BCAVEAT-27B
基准
CAVEAT-StandardCAVEAT-HardCAVEAT-ShopCAVEAT-Stay
指标
Optimal Purchase RateGraded Preference Score (P*)Promoted-Purchase Rate
AI 导读和推荐理由微软研究院提出 CAVEAT 基准,用九个高保真电商环境和八类来自商业实践的引导机制,评测计算机使用 Agent 在环境与用户目标存在激励冲突时是否仍选到用户最优商品。在 52 个标准任务、五个模型家族共 18 个配置上,关闭引导机制时最优购买率 78.6%,全部开启后降至 17.3%,参考的退化幅度为 61.3 个百分点;CAVEAT-Hard 把目录扩到 2,112 个商品、88 页结果,GPT-5.6-Sol-high 从 90.0% 降到 0.0%,50 次尝试均停在第 1 页。轨迹分析和消融把失败归为三类:过早结束搜索、用户未声明的偏好排序(请求中先提到的偏好被当作优先级)、在价格等关键事实未确认前下单。研究者还用合成环境轨迹两阶段后训练 Qwen3.5-27B 得到 CAVEAT-27B,在 16 个留出任务上配合 Harness 达到 22.9%。

微软研究院提出 CAVEAT 基准,用九个高保真电商环境和八类来自商业实践的引导机制,评测计算机使用 Agent 在环境与用户目标存在激励冲突时是否仍选到用户最优商品。在 52 个标准任务、五个模型家族共 18 个配置上,关闭引导机制时最优购买率 78.6%,全部开启后降至 17.3%,参考的退化幅度为 61.3 个百分点;CAVEAT-Hard 把目录扩到 2,112 个商品、88 页结果,GPT-5.6-Sol-high 从 90.0% 降到 0.0%,50 次尝试均停在第 1 页。轨迹分析和消融把失败归为三类:过早结束搜索、用户未声明的偏好排序(请求中先提到的偏好被当作优先级)、在价格等关键事实未确认前下单。研究者还用合成环境轨迹两阶段后训练 Qwen3.5-27B 得到 CAVEAT-27B,在 16 个留出任务上配合 Harness 达到 22.9%。

推荐理由论文给出 18 个模型配置在九类电商环境下的最优购买率落差,并拆解三类可诊断的失败模式,便于评估委派型智能体的激励鲁棒性。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    评估计算机使用智能体在具有自身利益偏好的在线环境中能否坚守用户目标。

    当在线环境自身具有利益诉求时,被委托的计算机使用智能体能否保持用户目标。

    • 场景与重要性:计算机使用智能体(CUAs)日益代表用户在各类在线平台自主执行搜索、比价与采购等决策,但现实平台往往通过排序、推荐和界面设计来推进自身利益。
    • 现有评估的不足:作者指出,现有能力基准主要测试中立合作环境下的任务完成率,而安全基准则侧重于显式对抗攻击(如提示注入),两者均未评估环境在正常运行且自身具有利益偏好时智能体是否会偏离用户目标。
    • 核心观察与形式化:环境通过操纵信息呈现次序、显著性与披露时机等引导机制追求自身目标 V,使决策环境与用户目标 U 产生激励失配(incentive misalignment)。
    • 提出的方案:论文提出了 CAVEAT 基准,涵盖 9 个高保真在线市场环境与 8 类商业引导机制,通过配对对照实验量化智能体在利益冲突环境下的决策退化。
  2. 有哪些相关研究?

    对比了智能体能力基准、暗模式/安全研究与平台经济学,聚焦真实信息引导下的端到端决策。

    论文将相关研究划分为三类,并明确了与本文的定位差异:

    • 计算机使用与购物智能体:WebArena(Zhou et al., 2024)、Mind2Web(Deng et al., 2023)与 OSWorld(Xie et al., 2024)等基准评估真实界面下的导航与任务完成;WebShop(Yao et al., 2022)、ShopperBench(Ling et al., 2026)与 ShoppingBench(Wang et al., 2026)扩展至商品搜索与复杂需求;Zhao et al.(2025)和 Jiang et al.(2025)测试偏好遵循。作者指出,CAVEAT 固定用户决策而改变环境激励,端到端测试智能体是否达成用户最优结果。
    • 智能体安全与欺骗性界面:AgentDojo(Debenedetti et al., 2024)、WASP(Evtimov et al., 2026)与 InjecAgent(Zhan et al., 2024)研究提示注入;DECEPTICON(Cuvin et al., 2026)、SusBench(Guo et al., 2026)、Shi et al.(2026)及 ABxLab(Cherep et al., 2026)测试智能体对暗模式的易感性。作者指出,CAVEAT 不注入虚假事实,所有价格和属性均真实且可核查,仅改变真实信息的展示次序、显著性与时机,并评估完整目录下的最终购买决策。
    • 平台激励与消费者选择:经济学、推荐系统与人机交互领域研究平台目标如何塑造展示排序与决策(Xu et al., 2022;Mathur et al., 2019;Athey & Ellison, 2011)。CAVEAT 将此类激励机制引入交互式具身环境并设定可验证的最优解。
    • 基线方法与基准:实验以开源框架 BrowserUse 及其官方系统提示词为基础脚手架,在 9 个自建市场环境组成的 CAVEAT-Standard 和 CAVEAT-Hard 上对比测试。

    作者将本文定位为:首个在保持事实真实与任务固定的前提下,通过配对因果对照评估完整多页市场环境下商业引导机制对智能体端到端决策影响的研究。

  3. 论文如何解决这个问题?

    形式化激励失配,构建 9 个市场与 8 类机制,并提出 CAVEAT-Harness 与后训练。

    论文通过形式化激励失配问题、构建高保真仿真市场体系,并设计反事实配对评测与干预策略来解决该问题。

    问题设定与形式化

    设可行结果集为 X,用户目标为 U,用户最优结果集为 X∗U = argmaxx ∈ X U(x)。智能体与环境 E 交互并选出结果 x̂E。决策质量定义为最优购买率 R(E),即选出结果落入 X∗U 的回合比例。若环境追求的目标 V 倾向于 X∗U 之外的结果,则称环境为激励失配环境。论文为每个失配环境 E 构造配对对照环境 E0(禁用引导机制),定义激励诱导退化指标为 Δ = R(E0) − R(E)。

    市场环境与任务构建

    • 9 个领域环境:涵盖 CAVEAT-Stay(短租)、CAVEAT-Shop(零售)、CAVEAT-Food(外卖)、CAVEAT-Grocery(生鲜)、CAVEAT-Market(二手转售)、CAVEAT-Kicks(球鞋)、CAVEAT-Services(外包)、CAVEAT-Craft(手工艺品)与 CAVEAT-Sport(运动品),均支持搜索、筛选、分页、商品详情及结账全流程。
    • 真实性与防爬机制:以真实平台为原型搭建前端,不使用真实品牌以防预训练污染;设置请求频率限制与 6 位验证码机制(实验中约 1% 触发)。
    • 任务定义与唯一最优解:用户请求包含硬性约束(如预算上限)与比较偏好(如最低价)。每项任务均经程序严格验证,在完整商品目录中有且仅有一个商品同时满足所有硬约束且在所有比较偏好上表现最优。

    八类引导机制分类体系

    论文基于监管与学术文献提炼出 8 类机制并设独立开关:

    1. 赞助位(Sponsored placement):付费或推广商品置于搜索顶部并标注赞助。
    2. 优先排序(Preferential ranking):默认排序优先展示平台倾向商品。
    3. 分拆定价(Drip pricing):列表页仅展示基础配置价格,完整价格需进入详情页查看。
    4. 促销框架(Promotional framing):为特定商品附加折扣标签与真实参考原价。
    5. 默认项与捆绑(Defaults & bundling):预勾选加购项或升级版本。
    6. 紧迫感与社会认同(Scarcity & social proof):展示低库存或高浏览量提示。
    7. 信任信号(Trust signals):突出平台徽章与真实好评。
    8. 摩擦与阻碍(Friction & obstruction):增加非平台偏好操作的操作步骤。

    引导机制所偏好的商品集合随机选定且严格排除用户最优商品,确保信息完全真实可查。

    缓解策略:CAVEAT-Harness 与 CAVEAT-27B

    • CAVEAT-Harness:在 BrowserUse 基础上增加结构化任务规格组件(TaskContract,固化用户硬约束与偏好)与决策核验工具(decision_checkpoint,在结账前核验搜索覆盖度与未决证据)。
    • CAVEAT-27B:分两阶段后训练 Qwen3.5-27B。第一阶段在合成购物环境中用教师模型(GPT-5.6-Sol-low)轨迹进行监督微调;第二阶段采用 DAgger 在笔记本任务上做在线策略纠偏训练。
  4. 论文做了哪些实验?

    涵盖 5 大模型家族的主评测、单机制消融、三类失败模式诊断及干预验证。

    论文在多个基准子集和模型配置上开展了全面评测与机理诊断。

    实验设置

    • 被测模型:主评测覆盖 5 个模型家族:GPT-5.6-Sol-low、Kimi-K2.6、Grok-4.3、Qwen3.5-122B-A10B、DeepSeek-V4-Flash-low;能力扩展评测包括 GPT-4o、GPT-4.1、GPT-5(nano/mini/main)、GPT-5.5(low/medium/high)、GPT-5.6(Luna/Terra/Sol 系列)、专用具身模型 Fara1.5-27B,以及开源微调模型 Qwen3.5-27B 与 CAVEAT-27B。
    • 数据集与规模:CAVEAT-Standard 共 52 个任务(每个任务约 70 个商品,其中 20 个 CAVEAT-Shop 任务);CAVEAT-Hard 包含 5 个 CAVEAT-Shop 任务(每个任务 2,112 个商品,分 88 页展示)。
    • 基线与脚手架:默认使用 BrowserUse v0.13.6 原生系统提示词;对比组包含 BrowserUse + Prompting 及 CAVEAT-Harness;Fara1.5-27B 使用其原生 Fara 脚手架。每步输入页面截图与交互元素文本,步数上限为 250 步(实验中无截断)。
    • 指标与判定:主要指标为最优购买率(Optimal Purchase Rate, %),由结账订单记录与真实标签程序化对比判定,无需模型裁判;补充指标包括分级偏好得分(Graded Preference Score, P* ∈ [0, 1])和推广商品购买率(Promoted-Purchase Rate, %)。
    • 测试次数:CAVEAT-Standard 每项任务重复 3 次;CAVEAT-Hard 主测试每项任务重复 10 次。

    主结果

    在 CAVEAT-Standard 全部 52 项任务上,5 个模型家族的平均及分模型表现如下(据 Figure 3 与 Table App.3):

    表格较宽,可左右滑动

    模型配置对照组最优率 (%)引导组最优率 (%)退化幅度 Δ (pp)对照组分级得分 P∗引导组分级得分 P∗引导组买推广品率 (%)
    GPT-5.6-Sol-low91.053.837.20.9280.59933.3 (52/156)
    Kimi-K2.694.224.469.80.9700.34160.9 (95/156)
    Grok-4.3-low80.81.978.90.9140.15491.7 (143/156)
    Qwen3.5-122B-A10B69.91.968.00.7340.11475.6 (118/156)
    DeepSeek-V4-Flash-low57.14.552.60.6320.10752.6 (82/156)
    五模型总计 (Aggregate)78.617.361.30.8350.26362.8 (490/780)
    • 全线显著退化:作者指出,开启引导机制后,5 个模型的最优购买率均出现 37.2 至 78.9 个百分点的下滑。
    • 系统性流向推广商品:在引导组的失败回合中,约四分之三转向了平台推荐的 6 个特定商品,总购买率达 62.8%,而对照组仅为 1.3%。
    • 大目录极端退化:在包含 2,112 个商品的 CAVEAT-Hard 上,GPT-5.6-Sol-high 在对照组最优购买率为 90.0%,而在引导组 50 次测试中全部失败,降至 0.0%(Figure 3C)。

    单机制消融实验

    在 CAVEAT-Shop 20 个任务上对 GPT-5.6-Sol-low 单独开启各机制(每条件 60 次,Table App.2):

    • 能见度控制机制影响最大:单开赞助位使最优购买率降至 63.3%(降 36.7 pp);单开优先排序降至 75.0%(降 25.0 pp);单开分拆定价降至 83.3%(降 16.7 pp)。
    • 边际机制影响较小:默认捆绑降至 90.0%、促销框架 93.3%、摩擦阻碍 95.0%、信任信号 96.7%、紧迫感 98.3%。八项全开为 51.7%(降 48.3 pp)。
    • 作者解读:各机制降幅之和为 105 pp,全开降幅远低于简单相加,作者称这表明机制间存在重叠效应,主要通过共同的决策漏洞起作用。

    失败模式诊断分析

    作者抽取 200 条轨迹分析并设计对照验证,定位出三大失败模式:

    • 搜索过早终止(Premature Search Closure):将次优商品移至赞助位时,其访问率从 45/60 升至 60/60,购买率从 0/60 跃升至 48/60;CAVEAT-Hard 中 GPT-5.6-Sol-high 的 50 次失败均停留在第 1 页(共 88 页)。
    • 目标漂移(Objective Drift):在 CAVEAT-Hard 上调换两项同等权重偏好的表述顺序,当偏好 A 在前时 45/50 购买 A 最优的商品,偏好 B 在前时 41/50 购买 B 最优的商品,智能体在思考中声称用户优先考虑首个偏好。
    • 未决证据过早承诺(Premature Commitment with Unresolved Evidence):分析发现 23 次智能体已浏览最优商品却因看错或遗忘属性而放弃;单开分拆定价时,GPT-5.6-Terra-low 在 60 次中产生 35 次次优购买,且全部购买了分拆定价商品。

    干预与缓解实验

    在 CAVEAT-Shop 与 CAVEAT-Hard 上测试干预手段(Figure 5):

    • CAVEAT-Harness 效果:在 CAVEAT-Shop 上将 GPT-5.6-Terra-low 从 11.7% 提升至 66.7%(提示词基线仅达 30.0%);在 CAVEAT-Hard 上将 GPT-5.6-Sol-high 从 0.0% 提升至 80.0%(提示词基线仅达 13.3%)。在 CAVEAT-Hard 消融中,核验工具单独贡献 66.7%,任务规格单独贡献 6.7%。
    • 后训练 CAVEAT-27B 效果:在 16 个留出商品类别的 CAVEAT-Shop 任务上,原生 Qwen3.5-27B 在配合 CAVEAT-Harness 时仅为 4.2%,经后训练的 CAVEAT-27B 达到 22.9%;在 4 个 CAVEAT-Stay 跨环境任务上达到 16.7%(原生为 0.0%)。
  5. 有什么可以进一步探索的点?

    作者指出了全机制并发、领域集中和交互开销等局限;实验覆盖了 9 类环境与 18 种模型。

    作者指出的局限与后续方向

    • 全机制并发的压力测试性质:主实验同时开启全部 8 种引导机制,属于受控压力测试,而非对已部署平台上智能体实际失败频率的估算(第 8 节)。
    • 深入分析与干预集中于单一商城:深度分析、脚手架验证与模型后训练主要集中在 CAVEAT-Shop,跨环境迁移仅在 CAVEAT-Stay 上进行了小规模检查(第 8 节)。
    • 部分诊断实验样本量较小:部分针对性分析依赖数十个回合的实验样本(第 8 节)。
    • 环境与任务设定的边界:基准研究的是具有明确目标、唯一最优解和固定机制的市场,尚未扩展到金融服务、招聘或信息平台等其他领域(第 8 节)。
    • 动态偏好与自适应博弈:未覆盖用户具有部分偏好或演变偏好的场景,也未涉及平台随时间推移针对智能体进行自适应调整的情形(第 8 节)。
    • 脚手架的交互开销:降低 CAVEAT-Harness 带来的额外交互成本是未来的重要方向(第 8 节)。

    实验覆盖范围

    • 被测环境:包含 9 个自建模拟市场,主要深入消融和缓解实验集中于 CAVEAT-Shop,并在 CAVEAT-Stay 进行了 4 个任务的迁移验证。
    • 任务与规模:CAVEAT-Standard 评测覆盖 52 项任务,每任务约 70 件商品,重复 3 次;CAVEAT-Hard 覆盖 5 项任务,每任务 2,112 件商品,重复 10 次。
    • 引导机制:涵盖 8 种商业引导机制,均以非欺骗形式实现(商品属性与价格完全真实),排除虚假评论或隐藏扣费等纯虚假欺骗手段。
    • 模型覆盖:评测了 18 种模型配置,主要推理模型包括 GPT 系列、DeepSeek-V4-Flash、Kimi-K2.6、Qwen3.5-122B、Grok-4.3 以及 Fara1.5-27B。
    • 成本与步数:实验设定 250 步上限且未发生步数截断;CAVEAT-Harness 相比基准增加了 2.6 倍运行时间与 2.3 倍操作步数。
  6. 总结一下论文的主要内容

    提出 CAVEAT 基准揭示智能体在商业偏好下的决策退化,诊断出三类失效并给出缓解方案。
    • 核心定位与问题:论文研究计算机使用智能体在面临具有自身利益偏好(如商业推广与排序倾斜)的在线环境时,能否在真实信息下坚守用户目标,提出了首个系统化基准 CAVEAT。
    • 机制与基准构建:构建了涵盖 9 个真实电商与服务领域的高保真网页环境,提炼出赞助位、优先排序、分拆定价等 8 类商业引导机制,并通过程序化验证确保每个任务存在唯一真实可查的用户最优解。
    • 核心实验发现:在 52 个标准任务上,5 个主流模型家族的最优购买率从对照组的 78.6% 降至引导组的 17.3%;在大目录 CAVEAT-Hard 上,GPT-5.6-Sol-high 从对照组的 90.0% 骤降至 0.0%,且 62.8% 的失败购买流向了平台推荐的特定商品。
    • 三大失效机理:通过轨迹与消融诊断出三大决策漏洞:依赖初始展示的搜索过早终止、受次序等无关线索影响的目标漂移,以及在价格等关键证据未明时发生的过早承诺。
    • 有效缓解方案:提出结构化任务约束与推断期证据核验脚手架 CAVEAT-Harness,将 GPT-5.6-Sol 在复杂大目录下的最优购买率恢复至 80.0%;结合在策略后训练的开源模型 CAVEAT-27B 亦取得显著改善。
    • 作者结论与启示:评估受托智能体不仅需要考察其中立环境下的任务完成能力,更必须检验其在环境具备自身利益诉求时的目标鲁棒性。
阅读原文arxiv.org