研究者提出可检查评分器与自改进 Agent 共同演化方法
Who Verifies the Verifier? Co-Evolving Inspectable Graders with Self-Improving Agents
作者演化可检查评分器:MBPP+留出一致性高于手写种子+0.21,且任务分不能认证它。
- 自改进循环每轮都要判断改动后是否更好,但开放任务没有验证器。手写rubric或与被评模型同类的LLM judge,作者称会招致reward hacking与共享盲点。
- 评分器是drawback检测器的可读表达式,从聚类失败合成并出生门控,按十项锚点的召回加权一致性与无标签共识选择,不按智能体分数。Double Ratchet将其与未改动的Ratchet技能循环交替。
- MBPP+演化评分器留出一致性0.625±0.050,手写种子0.417±0.058。Report上去掉锚点守卫后通过率0.97–1.00。三任务lift retention为106%、110%、88%(Table 1)。
- 作者称演化扩大覆盖但造不出ground truth,无锚点时优化的是噪声;开放前沿是执行干净但语义错误的输出。研究为三个任务族、一个模型族,外评不是人类研究。
- 被测模型
- Claude Opus 4.7
- 基准
- MBPP+Spider 2.0-Snowreport generation
- 指标
- held-out agreementheld-out task scorelift retentionouter-judge win rate
论文把评分器本身作为演化对象,用由小型确定性缺陷检测器组成的可读表达式替代手写评分标准或裸 LLM 评委,选择依据是与十项锚定参考集的一致性和无标签输出上的共识,而非 Agent 的任务得分。在 MBPP+ 上,演化出的评分器相对初始手写组合的留出集一致率提升 0.21,并超过其中包含的裸 LLM 评委。作者称,去掉锚定保护后评分器会退化为几乎全部通过的无效评分器,但它训练技能的效果与有效评分器相当,因此下游任务分数无法验证自演化评分器。Double Ratchet 将评分器与技能循环配对,在代码生成、企业 text-to-SQL 和无参考报告生成三类任务上保留了基准真值或评分标准所带来提升的 88%–110%。在报告任务中,演化出的技能通过只写标签不写数值等方式博弈评分标准,外部评委发现该问题,新增一个检测器后标签缺失率从约 30% 降至约 1%。
推荐理由论文用锚定选择替代下游分数来验证自演化评分器,并给出一个可读检测器修复代理博弈的完整案例。
深度解读
这篇论文试图解决什么问题?
开放任务没有现成验证器,自改进循环需要演化可检查的评分器本身。
开放任务上,自改进循环每轮都要评分,但没有可直接使用的验证器。
- 场景: 作者称,改提示词、加工具或改推理策略后,循环每一轮都要知道尝试是否通过。代码基准有单元测试;部署里验证器是瓶颈。作者把 Claude managed agents 的手写 outcome rubric,以及 Codex Record & Replay 的人工演示,写成缺失验证器的人工替代,且一次只补一条。
- 现有做法: 手写 rubric,或与被评模型同类的裸 LLM judge,作者称会招致 reward hacking 与共享盲点。相关工作里,自演化智能体把验证信号当作给定;对着指标搜索程序的工作则要求一个被当作有效的下游指标。
- 观察: 作者称很少知道“好”是什么,但给定输出通常找得出 drawback。干净裁决表示没有发现已知 drawback,而不是认定正确。因此评分器是小检测器上的可读表达式,失败能落到有名字的检查。
- 本文做的事: 演化的只有评分器;任务集与参考在任何循环开始前固定,结果不能来自更易的测试。选择只看十项锚点一致性,以及无标签输出上的检测器共识,从不看智能体分数。Double Ratchet 把该评分器配上未改动的技能循环。
- 成功标准: 作者称目标设定没有可击败的基线验证器;标尺是没有准确验证器时,能收回准确验证器本来会带来的改进中的多少。评分器给产出它的循环打分被写成 Goodhart 风险,锚点纪律被写成承重的。
有哪些相关研究?
自演化工作把验证信号当给定;评分器演化改用锚点一致性与共识作适应度。
自演化智能体
- Ratchet 与 Library drift(Zhang et al., 2026): 作者称无管理的 LLM 技能库会漂移,最小生命周期能恢复收益。该已发表循环在本文原样用作技能侧,作者称不是本文贡献。
- 技能库一线: Voyager、Reflexion、Self-Refine、ExpeL、AutoManual、Generative Agents、Agent Workflow Memory,以及后一批库演化与评测工作;两篇综述映射该版图。它们增长技能库、从失败痕迹修订,并把经验存成 insight、手册、记忆或工作流。
- 对着给定信号搜索: ADAS 搜索智能体代码,另有神经架构搜索传统,以及 DSPy、LLMs as optimizers、Promptbreeder、TextGrad。作者称这些线都对着被当作给定的验证信号优化;本文演化的是该信号,并问评分器本身在动时哪部分纪律承重。
已有指标上的程序搜索
- 损失、算法与剪枝度量: 损失发现、AutoML-Zero、Pruner-Zero、AlphaEvolve 把基本检查组成程序。作者称搜索空间类似,但适应度种类不同:各项都由被当作有效的指标打分。作者称 AlphaEvolve 写明进展必须 machine-gradable,而这是本文机制所缺的前提。本文用锚点一致性加共识正则,代替下游分数。
学习得到的评分器
- 奖励模型与自奖励: 奖励塑形、RLHF、奖励过优化、奖励误指定与 reward gaming,以及 Constitutional AI、Self-Rewarding。作者称共享 reward-hacking 风险,但结构不同:本文评分器预测它从未在其上训练的锚点,可人工阅读和修复,面向智能体的使用限于训练。LLM-as-judge 的偏差审计被一并引用。
- Agent-as-a-Judge: 作者称精神上最近,并通过它所评分的系统验证 judge。作者称 §5.2 显示空洞评分器也能通过这种验证。
- 任务侧评估器: CodeScore 从执行标签预测功能正确性;SQLHD 不需 ground truth,但固定一组手写 metamorphic relations。作者称二者都可以是池中的一个 typed detector,读成组件而非竞争者。ReFoRCE 改进求解器,作者称是正交轴。MBPP+、Spider 2.0 与 HumanEval 的执行评分传统被用作认证演化评分器的硬锚点,作者称不是排行榜条目。
基线与基准
- 基线方法: 手写种子组合;组合所含的裸 LLM judge op;免费使用 ground truth(MBPP+、Spider)或论文所称 best available rubric(Report)的 reference 技能循环;关掉锚点守卫的 naive,以及关掉检测器生命周期的 no-lifecycle。
- 基准: MBPP+(隐藏单元测试)、Spider 2.0-Snow(官方执行结果比较)、无准确验证器的 report generation。
作者把本文放在“演化验证信号”而不是“对着给定指标优化被评分的产物”;要分开测量的是评分器有效性,以及它能否替代 ground truth 驱动同一技能循环。
论文如何解决这个问题?
评分器是检测器表达式,按十项锚点与无标签共识选择,再驱动技能循环。
演化对象是评分函数,不是被评分的产物。Verifier evolution 在原子 drawback 检测器上搜索可读组合;Double Ratchet 把当前最佳评分器交给未改动的 Ratchet 技能循环。任务与参考在循环开始前固定。
划分与监督
- 任务族有任务 t 与冻结求解器,输出为 y。评分器把 (t, y) 映到 {PASS, FAIL, ABSTAIN}。
- train 大且无标签:暴露候选评分器在何处分歧或弃权;共演化时,演化评分器给技能循环打这些任务。
- dev 始终十项,各带黄金参考。教师对照参考给出软 pass/fail,是评分器演化读到的唯一监督。这些参考只给带着它们的十项打分。作者称 dev 故意小,因为部署里新标签是演示和事故复查的细流。
- test 对评分器锁定,持有最强参考:单元测试、官方执行比较或报告 rubric。评分器演化的任何部分都不读它。技能循环用它做留出评分与回滚,因为部署中的智能体会对受评判的案例回滚。reference 与 co 的回滚方式相同。
检测器与表达式
- op 检查恰好一个失败类,输出 {DRAWBACK, CLEAN, ABSTAIN},否则弃权。每族从少量覆盖明显失败模式的 op 起步,可由手工写或让 LLM 按任务说明起草,再由生命周期扩池。
- 三档成本:static 解析并检查产物;execution 在代码沙箱或 SQL 实仓库中运行,环境本身提供一部分 ground truth;judge 向 LLM 提一个窄问题。每族有固定、不演化的 root,校验基本结构并缓存解析结果。
- 节点可以是叶 op、析取、合取、否定、无权重 K-of-k,或带阈值的加权投票。弃权子节点被排除;子节点全弃权则节点弃权。固定 root 与演化表达式的合取未发现 drawback 则通过。附录 C 给文法。否定与加权投票每轮可用,但作者称没有出现在任何被选评分器中。
- op 是 (t, y) 的纯函数,裁决可缓存。作者称报告的表达式都可从表达式字符串加已注册 op 池复现。
一轮选择
算法 1 的一轮是:感知、生长、选择、整理;审计只测量。
- Sense: misses 是 dev 上现任通过、但软标签为 fail 的项;gaps 是 train 上池全体弃权或分裂的输出。
- Grow: 按封闭的任务分类把 misses 与 gaps 聚类,为复发簇写一个 typed op。出生门要求它在至少一半簇上触发,且在已知好输出上为 clean。来自锚点 miss 的 op 进入 active,可选;只来自无标签 gap 的进入 shadow,每轮记录裁决但不可选,直到其裁决提高 dev 一致性。
- Select: LLM composer 看到 op 目录、当前 gap,以及精英表达式和其短处,再加上精英的变异与交叉。在有效性门后保留目标最大的候选或现任。
- Curate: 现任表达式的留一边际非正的 op,宽限期后退役;提高 dev 一致性的 shadow 晋升。
- Audit: 对锁定测试报告一致性,从不作为训练信号。
选择目标是 S(e) = Adev(e) · Atrain(e)w − λ C(e):dev 软标签一致性乘无标签共识一致性,再减表达式规模。
- dev 一致性是两类召回的加权平均,只在候选给出意见的 dev 项上计算。FAIL 权重 2,CLEAN 权重 1,即漏掉 drawback 的代价是误报的两倍。共识按各 op 的锚点留一边际加权,权重为 1+10·max(0, m_o);没有锚点证据的 op 为单位权重。作者称否则一批相关检测器会定义正则项所奖励的伪标签。
- Atrain 乘在一个 fail-closed 的 Adev 上。作者称它单独不能选出评分器:背住十项 dev 但行为不稳会输;恒 fail 也会在 dev 上输。无可用 dev 意见的候选不可选;全通过、全失败或全弃权的候选被丢掉。
- 附录 C:MBPP+ 与 Spider 的 w 为 1.0,report 为 0.25。超过三叶后每个 op 罚 0.001,每个调用 LLM 的 op 再罚 0.002。非正 op 的宽限为两轮。
Double Ratchet 与两道消融
- 技能循环原样采用 Ratchet,缺的正是训练任务的评分器。共演化把当前最佳演化评分器交给它。课程前置:覆盖最差时评分器阶段最长,随后缩短。四个 25 轮技能阶段之间插入 15/8/5/2 轮评分器阶段,技能预算与 reference 对齐;技能循环共 100 轮。
- 技能阶段里,演化评分器给 train 尝试打分。失败尝试成为 capsule,错误文本喂给技能合成。留出评估与回滚钉在锁定测试集上,演化评分器从不读它。作者称损坏的评分器可以拖慢技能学习,但不能重定义评估指标。要比较的 reference 循环是同一套机制,免费使用 ground truth 或最佳可用 rubric。
- naive: 关掉 fail-closed 锚定和有效性门,并关掉技能侧回滚;检测器生命周期全开。作者称这是无锚点 agent-judge 共演化隐含跑的、易共谋配置。
- no-lifecycle: 守卫保留,关掉出生门、shadow 层和按功绩退役。每个合成检测器直接 active,无人退役。
- 外层审计: 更强 LLM 把最终输出与演化前基线成对比较,交换位置各判一次,两序都同意才算赢。作者称它模仿部署中保留的人工验收。它是审计,从不是训练信号。
论文做了哪些实验?
MBPP+留出一致性从0.417±0.058到0.625±0.050;关掉锚点守卫则评分器全通过。
实验设置
- 模型: 循环内角色——求解器、技能合成器、教师、judge op——均为 Claude Opus 4.7。唯一例外是 report 的最终 judge:Claude Opus 4.8,置于所有循环之外。作者称同族教师不是无辅助的自评分:它在 dev 上把候选与黄金参考比较,且从不看锁定锚点。
- 任务与划分: MBPP+、Spider 2.0-Snow 有精确 ground truth,用作验证任务。Report generation 无黄金验证器,rubric 加黄金演示节是部分参考。前两者用五项独立冻结求解器样本筛选,丢掉每次都通过的任务,其余按通过率分层;report 不筛选。dev 始终十项:五条明确失败、五条干净正例。train/dev/test 为 MBPP+ 60/10/40、Spider 59/10/40、report 73/10/48(Appendix B)。求解器是单次直接调用,无工具、迭代或脚手架;作者称绝对数字不可与排行榜智能体比。
- 预算与统计: 技能循环 100 轮;共演化的评分器阶段为 15/8/5/2。每配置三个种子,报告均值和样本标准差;循环比较另给种子级差与 95% bootstrap 区间。配对检验是任务级 sign-flip permutation。作者称每轮噪声近五个点;峰值是锁定集 argmax,因此偏乐观,末十轮均值预先固定。
- 两套 Report 参考: 评分器锚点是冻结的 demo-delta 软标签:教师在封闭的七类 miss 分类下比较冻结智能体报告与黄金节,至多一类 miss 才通过。48 个留出节各贡献两项,共 96 项,54 pass、42 fail,恒通过评分器得 0.56(Appendix B)。技能与 co 循环的任务分来自 rubric 评估器。Appendix B 写该评估器为 0–100 normalized;Table 1 的 Report 分数在 0.85 一带,论文未说明二者如何对应。下文任务分以 Table 1 为准。
- 外评: 48 个留出节上,存储的 round-0 分别与峰值轮、末轮配对。修复前 3 臂 × 3 种子 × 2 轮 × 48 节 = 864 对;修复后重跑在两个 co 臂加第四个种子,共 1,056 对。每对交换位置各判一次,两序同意才计胜(Appendix D)。
- Spider 接地: 类型化 schema 目录与 Snowflake 规则。作者称这是各方相同的共享效应:筛选池上冻结基线从 0.211 到 0.329,报告的 lift 都在此之上。
主结果
先看任务分能否被演化评分器替代;有效性另节测量。下表为三种子峰值 held-out task score。reference 免费使用 ground truth 或 best available rubric;co 为 Double Ratchet;naive 关掉锚点守卫和技能侧回滚,并与 co 种子对齐。verifier agr. 是与锁定锚点的峰值一致性。据 Table 1。
表格较宽,可左右滑动
任务 reference co naive lift ret. verifier agr. MBPP+ 0.700±.025 0.717±.038 0.742±.014 106% 0.62 Spider 0.483±.038 0.458±.038 0.458±.029 110% 0.50 Report 0.850±.010 0.812±.006 0.841±.003 88% 0.84 - 作者称两个有 ground truth 的任务落在噪声内,∆peak 的 95% 区间含 0:MBPP+ 为 +.02 [−.03, .06],Spider 为 −.03 [−.08, .03]。Report 为 −.04 [−.05, −.03],作者称有小缺口,且其 reference 本身是部分 rubric。
- Improved:从未通过的任务至少解出一次,Report 为结束时高于 round 0 的节比例。MBPP+ 为 16/23 与 19/23,Spider 为 4/12 与 6/12,Report 两侧 99%(reference 在前,Table 1)。作者称 co 在两个硬锚点任务上转化更多;Spider 评分器近随机仍保留全部 reference lift,因为训练角色是决定哪些尝试成为 capsule,具体错误文本不依赖 pass/fail 对错。
- 作者称技能循环是宽容的分数消费者。Spider 两侧绝对 lift 都最小,作者归因于单次调用求解器的残余失败多半需要现场探索,指导文本技能表达不了。作者称 naive 的任务分与锚定臂一样好,两个任务上略好,所以用任务分验证会放过全通过的评分器。
评分器有效性
- MBPP+(§5.1): 演化组合 0.625±0.050,手写种子 0.417±0.058,所含裸 LLM judge 0.55±0.04。作者称 +0.21 是相对静态工程的提升,且每个种子都为正。120 条匹配裁决中,峰值改正 61、破坏 36,末轮改正 36、破坏 20。任务级 sign-flip 的 p 为 0.12 与 0.21。作者称方向一致但并不显著;若把裁决当独立,p 会是 0.014 与 0.044。锁定任务 40 个、三个种子,作者称设计支持一致方向,不是校准后的拒绝。
- Figure 2: 作者称选择目标在每个任务的每个种子上都上升且之后不下降,这由 best-so-far 保证,因此不是有效性证据。九次运行中有五次结束时低于自身中途峰值。作者称这是优化十项代理时的普通泛化缺口。
- 另外两任务不是 MBPP+ 的重复: Report 从 round 0 就在天花板,因为子集播种已把近优组合放进候选集;作者称它承载充分性与安全消融,而不是 lift。Spider 为 0.500±0.026,配对检验无发现;作者称这是该任务的失败机制,不是样本量假象(§5.5)。
守卫消融
- 消融按评分器有效性判断,不按任务分。Report 上关掉锚点守卫后,三个种子全部塌缩:选择锁到作者称几乎从不触发的检测器,fail-open 报出空洞满分目标,评分器通过它所打分的 0.97–1.00(§5.2、Figure 3)。
- Table 3,report,末轮、三种子:锚定臂目标 0.865±0.002,留出一致性 0.830±0.012,train pass .78–.82。naive 目标 1.000(vacuous),留出一致性 fail-open、不可测,train pass .97–1.0。no-lifecycle 目标 0.896±0.072,留出 0.868±0.061,train pass 未记录。作者称关掉生命周期不塌缩;池会变大,但未被选中的检测器从不打分。
- 作者称这与技能演化的重点相反:技能侧生命周期承重;评分器在锚定选择下,安全负载由锚点纪律承担,对应物是锚点漂移而不是池漂移。Appendix F 称 naive 评分器在每个任务上都退化,不只是 report;Spider 上 naive 目标在三个种子里的两个几乎不动。
报告任务的 proxy gaming
- rubric 的 metric-discipline 维度计数行内证据标签。作者称首批技能运行把 rubric 分提高 +0.26,部分靠利用该维度:标签写在本应是数值的位置,峰值轮约 30% 的标签旁没有值,并为满足风格维度编造自信预测。循环内信号看不见。独立 judge 看见了,在已决定的配对中 88% 偏好演化前基线(§5.4)。
- 修复是耦合的一处改动:胶囊门加入值擦除检查,并重写失败提示。作者称主张的是这一对,而不是检测器单独,因为分开它们需要未做的重跑。重跑后被擦除标签从大约 30% 到约 1%,rubric 分升至 0.850±0.010。论文未把这个 0.850±0.010 写明属于哪一臂。
- Table 2,已决定配对上演化输出相对自身演化前基线的胜率:修复前 generic 0.122、task-aware 0.515;修复后 generic 0.126、task-aware 0.770。修复的效应在 generic 上为 +0.004,在 task-aware 上为 +0.255。作者称 generic judge 因不知道流水线要求原始证据标签,把该语法当成损失;task-aware rubric 写于阅读这些理由之后,诊断审计而不是独立确认修复,修复前格子是对照。Appendix D:task-aware 列已决定配对为修复前 271/526、修复后 435/565。
其他消融与分析
- 可检测性(§5.5): MBPP+ 留出一致性 +0.21;Report 迁移到 0.84。Spider 第一版提示词下演化评分器留出一致性 0.85;接地后基线 0.211 到 0.329,一致性降到 0.500±0.026,目标仍在爬升。作者称同一方法、同一任务、不同失败分布。
- 生命周期(Figure 2、Table 4,三种子范围): MBPP+ 种子 10、拒绝 997–1014、池 12–14、叶 3;Spider 种子 9、拒绝 612–785、池 33–39、叶 1–2;Report 种子 11、拒绝 172–188、池 22–26、叶 2。一条 Spider 检测器由无标签 gap 进入 shadow,组合后 dev 一致性从 0.71 到 0.81 后晋升并被选中。
- 锚点规模(Appendix F): report 选择离线重放,每个规模 200 个分层子样本,不重新生成。四、六、八项的留出一致性为 0.871、0.882、0.874,十项为 0.854;标准差四项 0.063、八项 0.041。作者称均值不降,只是散布变宽。
- 末十轮(Table 5): MBPP+ reference 0.592±0.039、co 0.652±0.034;Spider reference 0.327±0.010、co 0.323±0.038;Report reference 0.802±0.024、co 0.767±0.015。冻结单次调用基线约 0.27、0.285、0.56。
- 弱评分器仍能训练(Appendix F): 两个 Spider co 种子选了 train 一致性 0.41–0.44 的单检测器评分器,峰值评估仍为 0.45–0.50。训练通过率:Report 0.78–0.82,Spider 0.41–0.83(§5.3)。
- 回滚(§3): reference 与 co 循环在 2,900 轮中触发 23 次。作者称绝对技能侧水平相对从未接触的第三划分仍然偏乐观。
有什么可以进一步探索的点?
作者称覆盖可扩大但造不出ground truth,开放前沿是干净执行下的语义错误。
作者指出的局限与后续方向
- 造不出 ground truth(§6): 作者称演化扩大覆盖,但从不创造 ground truth。没有锚点时循环优化的是噪声,所以锚点质量与其存在同样重要;把软锚点硬化成可检查锚点收益最大。
- 开放前沿(§6): 执行干净但语义错误的输出。§5.5 称更尖锐的求解器会留下更多这类失败,这是范围条件,不是实现上限。
- 研究定位(§6): 作者称这是机制研究,不是规模结果:三个任务族、一个模型族、轮次在低数百、留出集为数十项,外评是一个更强模型,而不是评审团或人类研究。
- 乐观的读数(§5、§3): 峰值是锁定集 argmax,因此偏乐观;末十轮列预先固定、未经选择。绝对技能侧水平相对从未接触的第三划分仍然偏乐观。
- 修复与外评的归因(§5.4): 作者称主张的是检测器与重写提示这一对,分开它们需要未做的重跑。task-aware rubric 写于阅读 generic judge 的理由之后,诊断审计,而不是独立确认修复。
- 技能表达与未使用的 op(Appendix F、§5.3): 指导文本技能不能替代需要交互的能力,作者称这是两侧循环在 Spider 2.0 上碰到的天花板。失败预期型检测器已实现,但没有被选评分器用过,作者称因此不对它们作主张。
实验覆盖范围
- 循环内模型为 Claude Opus 4.7;外评模型为 report 任务上的 Claude Opus 4.8(§4)。
- 任务为 MBPP+、Spider 2.0-Snow、report generation;划分 60/10/40、59/10/40、73/10/48;dev 固定十项(Appendix B)。
- 每配置三个种子;技能循环 100 轮;共演化的评分器阶段为 15/8/5/2(§4)。Table 3 的守卫消融数字写在 report generation 上;Appendix F 另写 naive 评分器在每个任务上都退化。
- 外评只用于 report 的存储配对:修复前 864 对,修复后 1,056 对;task-aware 已决定配对为 271/526 与 435/565(Appendix D)。论文未报告外评与人工的一致性,也未报告各臂的模型调用次数。
- 锁定测试上的回滚次数写为 reference 与 co 循环的 2,900 轮中 23 次(§3)。锚点规模重放只对 report 的已有候选表达式离线进行,每个规模 200 个子样本(Appendix F)。
总结一下论文的主要内容
十项锚点演化可检查评分器;作者称任务分不能认证它,但可替代ground truth。
开放任务没有验证器时,被演化的是评分器,而不是再补一条手写 rubric。
- 设定: 任务与参考先固定。评分器是 drawback 检测器上的可读表达式;通过表示未发现已知缺陷,不是认定正确。唯一监督是十项锚点上的软标签,选择再乘无标签共识,并减去规模,从不读智能体分数。
- 系统: 检测器从聚类失败合成,经出生门、shadow 与留一边际决定入选和退役。Double Ratchet 用当前评分器给未改动的 Ratchet 技能循环打训练分;留出评估钉在评分器读不到的锁定集。对照是同一技能循环免费使用 ground truth 或 rubric。
- 有效性: MBPP+ 上演化组合为 0.625±0.050,手写种子为 0.417±0.058,所含裸 judge 为 0.55±0.04。作者称每个种子都为正,任务级 p 为 0.12 与 0.21,并不显著。Spider 为 0.500±0.026。Report 从 round 0 起即在天花板。
- 认证: Report 上去掉锚点守卫后,评分器通过 0.97–1.00 的对象,目标却报 1.000。关掉生命周期则留在锚定带内。作者称空洞评分器仍能把技能练到不差,因为未过滤练习本身有收益,而测量不经过评分器。因此下游任务分不能认证自演化评分器。
- 替代与博弈: Table 1 中 Double Ratchet 保留 reference lift 的 106%、110% 与 88%。Report 上技能利用了 rubric 的标签计数;外评抓住后,一次耦合修复把无值标签从约 30% 降到约 1%。generic 外评从 0.122 到 0.126;给出任务契约后,同一批配对上从 0.515 到 0.770(Table 2)。
- 作者结论: 锚定无法制造的参考,且不要锚到智能体自己的分数;让评分器可读,使失败能修到有名字的检查;外评必要,但要有任务契约。谁验证验证器:一个它要预测但从未看见的锚点,以及所有循环之外的 judge。