跳到正文
原文
arXiv· arXiv:2610.00328· Miaobo Hu, Shuhao Hu, Xiaobo Guo, Xin Wang, Bokun Wang, Yina Sa, Daren Zha, Jun Xiao·本站收录 · 原文发表

ContractRL:面向可审计工具调用修复的屏蔽组相对策略优化

ContractRL: Shielded Group-Relative Policy Optimization for Auditable Tool-Call Repair

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

ContractRL 把失败工具调用的修复建模为带动作掩码的有界 CR-MDP;同信息五种子、每种子 192 例上语义成功率为 0.9362、生成 34.4 token。

威胁模型在线策略只见候选调用、类型化验证器反馈、JSON Pointer、不可变修复历史和剩余预算;规范目标与语义标签在 trace freeze 之后才加入。

问题
结构化工具调用常因少数字段违反 schema 或执行契约而失败。整对象重生成扩大动作空间,且重复修复难以审计。
方法
ContractRL 把验证器引导的 JSON 修复建成有界 CR-MDP:状态含候选、类型化反馈、JSON Pointer、不可变历史和剩余预算;契约动作掩码过滤畸形或禁止的 RFC-6902 操作后,确定性验证器做转移。目标含语义成功及附带修改、重试、token 与不安全动作代价,规范标签在账本冻结后才加入。
实验与结果
同信息、五种子、每种子 192 例时,ContractRL 语义成功率为 0.9362、生成 34.4 token,Patch-SFT 为 0.9076 与 44.9,全量重生成为 0.9148 与 137.2(Table 2)。策略优化从监督版 0.9186 升至 0.9375。三种子配对相对 Patch-SFT 的语义差为 +0.0396(95% CI [+0.0137, +0.0662],p=0.0039)。
局限与可以继续做的
机制屏只有 64 个单字段、预计算补丁。语义成功率从单字段 0.9502 降到嵌套/数组 0.8516、模糊/多字段 0.7935;八步多轮为 0.6457。作者称去掉掩码或历史可能允许不安全派发,且对变化中的外部服务和更长轨迹还需对应工具状态与失败代价。
实验设置2B rank-8 LoRA、0.8B rank-4 LoRA · BFCL 64-case mechanism screen、192 cases per seed same-information control 等 · semantic success、schema validity 等
威胁模型
在线策略只见候选调用、类型化验证器反馈、JSON Pointer、不可变修复历史和剩余预算;规范目标与语义标签在 trace freeze 之后才加入。动作经契约掩码过滤畸形或禁止的 RFC-6902 操作,确定性 fail-closed 验证器拒绝非法对象,使其不进入执行器。评测含错误指针、畸形反馈、提示注入工具文本和多字段损坏。
模型
2B rank-8 LoRA0.8B rank-4 LoRA
基准
BFCL 64-case mechanism screen192 cases per seed same-information controlthree-seed held-out sandboxnested/array cohortnine-case CPU auditJSONSchemaBench-derived 426 training recordsadversarial suiteeight-case complete-output diagnostic
指标
semantic successschema validityfinal-object matchexact-patch matchcollateral editsgenerated tokensmean retriesp95 latencyfirst-attempt validity
AI 导读全文 244 字

ContractRL 将校验器引导的 JSON 修复建模为受限决策过程,通过契约推导的动作掩码过滤违规的 RFC-6902 操作,并设计契约约束的组相对目标来优化修补、重试与弃权三类决策。在相同校验器信息下,该方法取得 0.9362 语义成功率和 34.4 个生成 token,优于 Patch-SFT 的 0.9076/44.9 以及完整重新生成的 0.9148/137.2(每种种子 192 个用例、共五个种子);策略优化还将语义成功率从监督版的 0.9186 提升至 0.9375。

深度解读

6 个问题,约 9,700 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    失败工具调用只需改少数字段,整对象重生成难审计;ContractRL 用有界契约修复。

    结构化工具调用常因少数字段违反 schema 或执行契约而失败,整对象重生成会扩大动作空间并让重复修复难以审计。

    • 场景:作者研究的是一次失败工具调用之后的决策:改哪个字段、剩余预算是否还值得再修、何时弃权(abstain)。作者认为宽范围重生成可以满足 schema,同时改动与意图无关的字段。
    • 现有做法的不足:按作者说法,多数结构化生成方法优化的是从头生成什么;语法或 schema 约束解码、事后处理与验证器引导修复彼此不同,但缺少在同一公开信息下、对补丁、重试和弃权同时施加局部性与资源约束的序列修复协议。
    • 核心设定:作者把修复定义为已经有意义的对象上的有界事务,即 Contract-Constrained Repair MDP(CR-MDP):公开状态、可采纳的局部动作、以及在任何工具执行之前的确定性转移。
    • 提出的方法:ContractRL 是契约约束的序列修复协议。策略观察候选、类型化验证器反馈、JSON Pointer、不可变修复历史和剩余预算;契约导出的动作掩码在确定性验证器转移之前过滤畸形或被禁止的 RFC-6902 操作。规范目标与语义标签在 trace freeze 之前不进入在线状态。
    • 威胁模型:
      • 目标:在显式局部性与资源约束下,对补丁、重试和弃权做决策,并以语义成功为主要项,附带修改、重试、token 和不安全动作作为受约束代价;要求零不安全派发。
      • 知识:在线策略只接收对应公开证据摘要中的字段。Oracle 标签、目标答案、hidden cards 和未来服务输出分开存放,只在轨迹决策冻结后加入。
      • 能力:动作是有界 RFC-6902 补丁或 ABSTAIN。模型评测最多两次补丁尝试;掩码去掉畸形操作、不可用路径、不可变路径编辑、非法 move/copy 源以及超出剩余操作预算的动作。非法动作返回类型化失败、消耗声明的尝试次数,且不到达执行器。
      • 受害系统:已失败的结构化工具调用及其执行契约。验证器是确定性且 fail-closed 的:补丁只有在 schema 与跨字段检查都通过时才被接受。语义端点在确定性工具沙箱中执行已接受对象。
  2. 有哪些相关研究?

    作者把 ContractRL 放在生成时约束、事后处理和验证器引导修复之间。

    结构化输出修复

    • ReAct(Yao et al., 2023)与 Toolformer(Schick et al., 2023):把工具调用显式化。
    • Reflexion(Shinn et al., 2023)与 Self-Refine(Madaan et al., 2023):用外部或自我生成的反馈做迭代修正。
    • ToolSandbox(Lu et al., 2024)与 SWE-bench(Jimenez et al., 2024):前者把有状态、多轮工具交互和环境侧验证写清楚;后者表明代码修复最终要由仓库级测试而不是仅由语法判定。

    局部验证与离线学习

    • Let’s Verify Step by Step(Lightman et al., 2024)、Math-Shepherd(Wang et al., 2024)与 ProcessBench(Zheng et al., 2024):检查中间结构,而不是只信任最终答案;过程级标签和留出的错误定位协议被作者当作暴露局部监督的先例。
    • CQL(Kumar et al., 2020)、IQL(Kostrikov et al., 2022)与 D4RL(Fu et al., 2020):强调分布偏移下的支持与划分完整性;作者据此把 BFCL 案例与适配器评测分开。
    • 语法与 schema 约束解码:作者将其作为 Section 4.2 匹配比较的直接对照。

    最接近的结构化输出与修复

    • VeriHarness(Ray & Goyal, 2026)与 PatchBoard(Zhang et al., 2026):前者用代码控制的验证器循环、有界调用和轨迹日志;后者在 schema 锚定的状态上做经过验证的 JSON Patch 变更,并使用确定性事务核。
    • Schema Reinforcement Learning(Lu et al., 2025)与 SLOT(Shen et al., 2025):前者用强化学习训练符合 schema 的生成;后者对无约束输出做后处理。
    • JSONSchemaBench(Geng et al., 2025)、XGrammar(Dong et al., 2024)与 BFCL(Patil et al., 2025):前两者评测生成时约束;BFCL 提供函数调用基准,作者称它不是修复算法。

    智能体评测语境

    • tau-bench(Yao et al., 2024)与 AgentDojo(Debenedetti et al., 2024):前者加入多轮用户模拟、领域策略和 passk 一致性;后者把不可信工具数据与提示注入鲁棒性纳入环境契约。
    • SWE-agent(Yang et al., 2024):受保护的智能体–计算机接口可以使编辑动作和执行反馈可审计。
    • 更广的策略优化与智能体评测:作者将 PPO、DPO、指令微调、AgentBench、选择性预测和奖励审计等列为训练目标、工具使用广度、选择性预测和奖励审计的互补基线,未逐项与本文对照。

    基线方法与基准:主比较的基线是 full regeneration、constrained decoding 和 Patch-SFT。结构机制锚使用 BFCL 的 64 个定义/答案对;训练记录来自 JSONSchemaBench 派生的 426 条;语义结果在匹配沙箱中执行,对抗套件覆盖错误指针、畸形反馈和提示注入工具数据。

    作者把本文定位为:在契约导出的动作空间上、以验证器为条件的序列修复策略,带有界重试/弃权、冻结后的 oracle 分离,以及可测量的策略优化比较;其目标在同信息对照和监督到策略的对照下评估。

  3. 论文如何解决这个问题?

    CR-MDP 用公开状态、契约掩码和冻结后计分,把修复限制为局部补丁或弃权。

    ContractRL 把验证器引导的 JSON 修复建成有界决策过程:每步只提出被契约允许的局部补丁或弃权,由确定性验证器完成转移,规范对象与语义标签在账本冻结之后才加入。

    问题设定与形式化

    • 回合起点:每个报告的机制回合从一个合法工具调用和一次确定性单字段损坏开始。在线输入含损坏调用和类型化验证器错误,不含目标对象。模型评测最多发出两次补丁尝试,每次可应用补丁后做验证。机制回放每例使用一个预计算补丁,因此不测量学到的重试策略。
    • 两种离线相等:精确补丁匹配 Mpatch(p)=1[p=p⋆],p⋆ 为规范有序操作列表;最终对象匹配 Mobject(p)=1[x ⊕ p = x⋆],x⋆ 为隐藏规范对象。作者写明:在相同起点和目标构造下,精确补丁匹配蕴含最终对象匹配,反之不必成立,因为不同补丁序列可以产生同一对象。
    • 信息边界:Gold 候选和目标补丁保持为离线计分字段。每次运行把配置、源修订、种子和有序轨迹绑定到 SHA-256 清单;序列化的策略输入只含公开状态。

    CR-MDP 与动作掩码

    • 状态:在修复步 t,状态为 st = (xt, et, qt, ht, bt, kt)。xt 是当前候选,et 与 qt 是类型化验证器代码和 JSON Pointer,ht 是先前补丁与验证器状态的不可变摘要,(bt, kt) 是剩余尝试次数和操作预算。
    • 动作与转移:动作集为 A(st) = Amask(st) 并上 {ABSTAIN}。补丁动作先检查 JSON 语法、路径可应用性、不可变路径、操作数量和 schema 声明的禁止项;只有可采纳补丁才被应用并交给确定性验证器。
    • 掩码:去掉畸形操作、不可用路径、不可变路径编辑、非法 move/copy 源,以及超出剩余操作预算的动作。相对 qt 的局部性是策略的软偏好,不是隐藏目标。
    • 补丁语义:评测器接受 RFC-6902 风格的 add、remove、replace、move、copy。报告的 screen 与适配器目标只用 add 或 replace。接受条件是 schema 检查与跨字段检查同时为 1。额外重试 r = a − 1,其中 a 为实际发出或回放的补丁尝试次数,1 ≤ a ≤ 2。初始损坏不算一次修复尝试。附带编辑定义为被改变、且不在已发出操作路径覆盖之内的叶路径。

    策略目标与在线流程

    • 目标:策略由补丁监督数据初始化,再以完整修复回合上的组相对目标优化。奖励为语义成功指示减去附带修改、重试、不安全动作和生成 token 的加权代价,并受零不安全派发、操作总数不超过 K、尝试次数至多 B 约束。U 计不可应用或被禁止的动作,T 为生成 token 代价。论文给出该目标的符号形式,未在正文给出 λ 的具体数值。
    • 一次回合:生成结果被解析为有界补丁或 ABSTAIN,经动作掩码过滤后送入确定性验证器。非法或不可应用的响应消耗一次尝试,并可暴露下一条类型化验证器报告;停止动作可以保留剩余预算。补丁、验证器响应、尝试次数、额外重试和附带编辑计数写入修复账本后,才加入 p⋆ 与 x⋆ 计算两种匹配;二者都不是在线修复输入。
    • 账本阶段:Table 4 的顺序为 Observe、Patch、Validate、Retry、Freeze、Score。前五阶段目标不可见;Score 在事后加入规范补丁和对象。Table 14 将候选 JSON、类型化验证器代码、JSON Pointer、schema 版本和补丁账本标为在线,将规范补丁、规范对象和语义工具结果标为离线。

    评测协议如何判定成功

    • 结构量:schema 合法性是应用补丁后 schema 检查与跨字段检查的确定性合取。最终对象匹配与精确补丁匹配分开报告。机制屏上附带编辑为零是构造所致:每个预计算操作都指向所报告的指针,且当前指标排除该路径。
    • 语义成功:修复后的调用在沙箱中执行,工具响应确定。一个案例成功仅当被执行的工具收到预期对象并返回预期任务结果。schema 合法性只作诊断,不代替语义成功。
    • 同信息与案例匹配是两种协议:Table 2 的四条臂都收到候选、schema、类型化错误码、JSON Pointer 和公开修复历史,只改变输出表示与解码规则。案例匹配比较使用相同案例标识、输出上限、重试记账、验证器实现和延迟测量,但公开验证器输入按臂不同(Appendix B),作者称这不是同信息干预。
  4. 论文做了哪些实验?

    同信息下 ContractRL 语义成功率 0.9362、34.4 token;单字段高于嵌套与模糊多字段。

    实验设置

    • 证据单元:机制屏是种子 13 上 64 个真实 BFCL 定义/答案对的确定性回放,32 个 missing_required 与 32 个 wrong_type 单字段损坏,每例一个预计算单操作补丁。新的 LoRA SFT 适配器在同一固定 64 例文件上评测:2B rank-8 四个种子,0.8B rank-4 八个种子。五种子实验每种子 192 例。另有九例 CPU 审计,以及八例完整输出诊断。
    • 被测系统:论文写明的适配器规模是 2B rank-8 与 0.8B rank-4。案例匹配与同信息比较中的基座模型名称,论文未在正文给出具体型号,只写各臂使用同一基座模型,模型规模与适配器秩随种子清单记录。
    • 基线:full regeneration 从损坏调用和 schema 生成完整对象;constrained decoding 在生成时强制语法或 schema;Patch-SFT 从类型化错误预测有界补丁。Context-only 对照去掉完整验证块、保留周围调用,作者称这是打包的信息块对照,不是类型化编码消融。
    • 指标:语义成功率、schema 合法性、最终对象匹配、精确补丁匹配、首次尝试合法性、附带编辑、平均重试、生成 token、平均延迟与 p95 延迟。延迟单位为秒;token 计生成输出,除非另行说明。n/a 表示该指标不在该臂的操作范围内。
    • 成功判定:结构检查由确定性验证器完成。语义端点在确定性工具沙箱中执行已接受对象,并检查任务结果与副作用。执行器在验证前不接收隐藏目标。论文未报告用 LLM 做评审或人工一致性系数;Table 38 的定性审计保留人工标签,未给出一致性数字。
    • 划分:426 条 JSONSchemaBench 派生训练记录与选定的 64 条评测记录在案例 ID、候选/目标指纹、schema 哈希、目标路径、操作序列、指针相关错误模板、语义等价簇、schema 形状、工具名和候选池上重叠均为 0(Table 8、Table 16)。Table 8 还列出训练侧 147 个 schema 哈希、26 个留出哈希、392 对 61 个指针/错误模板、118 对 23 个工具名。

    主结果

    同信息对照(Table 2;Figure 2 的条形与 Table 2 的合计一致):五种子、每种子 192 例,四条臂收到相同的候选、schema、类型化错误码、JSON Pointer 和公开修复历史。

    表格较宽,可左右滑动

    臂语义成功率 ↑生成 token ↓p95 延迟 (s) ↓附带编辑 ↓
    Full regeneration0.9148137.22.540.1876
    Constrained decoding0.8879146.12.800.1743
    Patch-SFT0.907644.91.490.0488
    ContractRL0.936234.41.300.0169

    据 Table 2。

    • 作者的解读:在该同信息设置下,ContractRL 的语义成功率高于另外三臂,生成 token、p95 延迟和附带编辑更低。作者把这些增益与局部修正联系起来,并称反馈、动作掩码、预算和 schema 偏移分析支撑这一联系。
    • 案例匹配是另一套分母:Table 3 为三种子、留出每种子 64 例,且各臂公开输入不同。ContractRL 的 schema 合法性 0.9768、语义成功率 0.9314、平均重试 0.0547、生成 token 34.6、平均延迟 0.83 s、附带编辑 0.0189;full regeneration 为 0.9392、0.9027、0、138.9、1.76、0.2214;constrained decoding 为 0.9901、0.8663、0、147.8、2.11、0.1986;Patch-SFT 为 0.9446、0.8918、0.1176、46.7、0.97、0.0618。Table 10 的 p95 延迟分别为 1.30、2.58、2.85、1.55 s。作者称这是案例匹配的资源比较,不是孤立的补丁表示效应。
    • 策略优化与配对:作者报告策略优化把语义成功率从监督 ContractRL 的 0.9186 提高到 0.9375(Table 5:每种子 192 例、五种子;同表 Patch-SFT 为 0.8927)。另一次三种子配对相对 Patch-SFT 的语义差为 +0.0396(95% CI [+0.0396 的区间为 +0.0137 到 +0.0662],p = 0.0039)。引言中的五种子 2B/r8 sweep 另报 ContractRL 语义成功率 0.9331、生成 token 34.8,所列 Patch-SFT、全量重生成和约束解码行为 0.8924–0.9041、token 为 46.9–148.1,且处于各自记录的信息条件下。

    结构屏与适配器

    • 测了什么 → 结果:Table 1 的 BFCL 机制回放在 64 例、一次预计算尝试上 schema 合法性与对象匹配均为 1.0000,尝试次数 1.00;账本为 32 个单操作 add 与 32 个单操作 replace,额外重试为零。作者写明这不是学到的策略达到 64/64 的证据。
    • 验证块:2B rank-8、四种子、验证块的 schema 合法性 0.9727、对象匹配 0.9141,context-only 为 0.0820 与 0.0742。0.8B rank-4、八种子分别为 0.9473 与 0.7441,context-only 两者均为 0.0000。类型化 2B 对象匹配的种子标准差为 0.0202(四种子),0.8B 为 0.0391(八种子)。作者称这些是种子摘要,不是置信区间;由于对照去掉整块验证信息,该对比不能指出是哪一个编码成分造成差异。Figure 3 的条形与这些种子均值一致。
    • 九例与八例审计:独立审计最终结构合法性 7/9,可修复案例接受 6/8;失败包括一次回滚、一次错误路径拒绝、一次不可变指针拒绝(Figure 4 右栏各记 1)。八例完整输出诊断为 8/8 可解析、6/8 schema 合法、6/8 精确最终对象匹配、token 上限命中 0/8(Figure 5)。

    案例族、转移与对抗

    • 按家族:Table 13 中 ContractRL 单字段 128 例:首次合法性 0.9716、语义成功率 0.9502、平均重试 0.0280、生成 token 31.8、p95 延迟 1.13 s、附带编辑 0.0096。嵌套/数组在 Table 3 为 schema 合法性 0.9187、语义成功率 0.8516、平均重试 0.1239、token 42.9、平均延迟 1.04 s、附带编辑 0.0297。模糊/多字段 192 例:首次合法性 0.7639、语义成功率 0.7935、平均重试 0.2361、token 48.6、p95 延迟 1.84 s、附带编辑 0.0432。作者称这些行描述操作边界,而不是孤立的方法效应,因为队列未跨方法合并。
    • 转移:Table 11 中 ContractRL 在 missing-required 上首次合法性 0.9815、最终合法性 0.9952、平均重试 0.0185、指针修正 0.9937、附带编辑 0.0054、语义成功率 0.9598;wrong-type 为 0.9618、0.9861、0.0382、0.9804、0.0137、0.9406。正文另报匹配运行中 ContractRL 首次合法性 0.9453、最终合法性 0.9768、平均重试 0.0547,Patch-SFT 为 0.8897、0.9446、0.1176。
    • 对抗与多轮:留出对抗套件中,注入工具文本一行的 schema 合法性 0.9453、语义成功率 0.8989;畸形反馈为 0.7846 与 0.7168;错误指针为 0.8172 与 0.7449。Table 9 对 “all” 或 “patch arms” 报告:单字段 0.9674 / 0.9128、多字段 0.8497 / 0.7892、嵌套数组 0.8985 / 0.8307、错误指针 0.8172 / 0.7449、畸形反馈 0.7846 / 0.7168、提示注入 0.9453 / 0.8989(前项为 schema 合法性,后项为语义成功率)。Limitations 写八步语义成功率为 0.6457。Table 38 的定性样本含单字段接受且成功、嵌套索引接受但语义失败、错误路径与畸形反馈被拒绝且未执行、多字段部分接受但语义失败、不可变字段被拒绝。

    其他消融与分析

    • 组件:结论称组件消融展示去掉动作掩码、修复历史、学到的停止或附带修改目标的代价;Limitations 称去掉掩码或历史可以允许不安全派发。Table 29 被标为组件表,正文未给出该表逐行数字。
    • 反馈与预算:作者称反馈、动作掩码、预算和 schema 偏移分析把增益与局部修正联系起来;Table 27、Table 28 被标为反馈与策略优化行,除摘要和 Table 5 已列的 0.9186 与 0.9375 外,正文未再列逐行数字。
    • 操作族重试:Table 15 报告 add 0.018、replace 0.038、remove 0.154、move/copy 0.124;错误路径与模糊报告的重试代价均为 1.000。64 例机制屏不含 remove、move、copy、嵌套、数组、多字段或模糊/噪声验证器案例。
    • 资源:Table 12 中 ContractRL 单字段提示 token 1111、输出 token 31.8、验证器调用 1.028、p95 延迟 1.13 s、语义成功率 0.9502;嵌套/数组为 1135、42.9、1.124、1.52、0.8516。
    • 盲审索引:Table 39 将独立审计记为每臂 120 个盲审案例并指向 Table 37;正文未给出 Table 37 的通过率。
    • 负面边界:约束解码在 Table 2 的语义成功率为 0.8879,低于 full regeneration 的 0.9148;在 Table 3 为 0.8663,低于 full regeneration 的 0.9027,尽管其 schema 合法性更高(Table 3 为 0.9901)。作者把结构增益伴随语义损失视为失败边界。
  5. 有什么可以进一步探索的点?

    作者指出单字段机制屏、多字段与八步下降,以及去掉掩码或历史时的不安全派发。

    作者指出的局限与后续方向

    • 机制屏范围:机制屏覆盖 64 个带预计算补丁的单字段损坏(Limitations)。
    • 学到的策略范围:学到的策略评测覆盖所指定的沙箱、模型规模、案例族和尝试预算(Limitations)。
    • 结构偏移下的语义成功率:语义成功率从单字段案例的 0.9502 降到嵌套/数组案例的 0.8516,以及模糊/多字段案例的 0.7935(Limitations)。
    • 多轮:多轮研究中八步语义成功率为 0.6457(Limitations)。
    • 外部服务与更长轨迹:作者写,推广到变化中的外部服务和更长修复轨迹,需要用相应的工具状态和失败代价做评测(Limitations)。
    • 契约完整性:消融还显示,去掉掩码或历史可以允许不安全派发,因此完整契约是被评测系统的一部分(Limitations)。结论另称错误指针、畸形反馈和多字段损坏仍是明确的失败边界。

    实验覆盖范围

    • 结构与适配器:机制回放为 64 例、一次预计算操作;适配器为 2B rank-8 四种子与 0.8B rank-4 八种子,各在验证块和 context-only 上报告 schema 合法性与对象匹配(Table 1)。另有九例事务审计和八例完整输出诊断(Figure 4、Figure 5)。
    • 策略比较的分母:同信息对照为五种子、每种子 192 例(Table 2)。案例匹配语义与效率表为三种子,留出行为每种子 64 例,嵌套/数组为单独案例族(Table 3、Table 10)。Table 13 的测量队列为 128 个单字段、192 个嵌套/数组、192 个模糊/多字段案例。
    • 对抗与转移:Table 9 报告单字段、多字段、嵌套数组、错误指针、畸形反馈和提示注入的 schema 合法性、语义成功率、平均重试和延迟。Table 11 报告 missing-required、wrong-type 以及混合家族上的首次/最终合法性。
    • 划分与冻结:训练 426 条与留出 64 条在 Table 8、Table 16 所列重叠检查上结果为 0。规范目标在轨迹冻结后加入(Table 4、Table 14)。
    • 论文未报告的项:正文给出组相对目标的符号,未报告 λc、λr、λu、λy 的取值,也未报告 K 与 B 的具体数值(仅写尝试次数至多为两次、1 ≤ a ≤ 2)。案例匹配与同信息实验未在正文写出基座模型的具体名称。Table 29 的逐项消融数字、Table 37 每臂 120 例盲审的通过率,以及多轮八步设置的案例数,论文未在所给正文中列出。论文未报告语义判定与人工标签的一致性。
  6. 总结一下论文的主要内容

    ContractRL 用掩码补丁和冻结账本做可审计修复,同信息下语义成功率 0.9362。

    ContractRL 是面向可审计工具调用修复的契约约束组相对策略优化:不整对象重写,而在公开验证器状态下做有界补丁、重试或弃权。

    • 问题:少数字段违反 schema 或执行契约就会让结构化工具调用失败。作者认为整对象重生成扩大动作空间,并可能改动无关字段,且重复修复难以审计。
    • 方法:CR-MDP 的状态包含当前候选、类型化错误与 JSON Pointer、不可变历史和剩余预算。契约掩码先去掉畸形或禁止操作,确定性 fail-closed 验证器再转移;非法对象不进入执行器。语义成功是主要项,附带修改、重试、不安全动作和 token 是代价。规范补丁、规范对象和语义标签在账本冻结后才加入。
    • 同信息结果:五种子、每种子 192 例,且各臂看到相同公开字段时,ContractRL 语义成功率 0.9362、生成 token 34.4、p95 延迟 1.30 s、附带编辑 0.0169;Patch-SFT 为 0.9076、44.9、1.49、0.0488;全量重生成为 0.9148、137.2、2.54、0.1876;约束解码为 0.8879、146.1、2.80、0.1743(Table 2)。
    • 其他测量:策略优化从监督 ContractRL 的 0.9186 到 0.9375。三种子配对相对 Patch-SFT 的语义差为 +0.0396(95% CI [+0.0137, +0.0662],p = 0.0039)。三种子案例匹配(公开输入按臂不同)中 ContractRL 语义成功率为 0.9314、34.6 token。64 例预计算回放的结构合法性为 64/64,作者称这不是学到的策略结果。2B 验证块对象匹配 0.9141,context-only 为 0.0742。
    • 作者的结论:作者认为该接口把机制、语义结果和资源成本分开记账。单字段语义成功率 0.9502,嵌套/数组 0.8516,模糊/多字段 0.7935,八步多轮 0.6457。作者称错误指针、畸形反馈和多字段损坏仍是失败边界,去掉掩码或历史可以允许不安全派发,完整契约属于被评测系统。
阅读原文arxiv.org