MARGIN:面向多智能体基础模型协调的运行时置信度校准
MARGIN: Runtime Confidence Calibration for Multi-Agent Foundation Model Coordination
作者用 MARGIN 在线校正异构模型自报置信;两次代码迁移后 ECE 低于五个在线基线。
- 协调器要用自报置信比较异构基础模型的答案,同一分数跨模型含义不同,任务分布变化后旧校正也可能不再适用。作者认为这会变成协调问题,而不只是单模型诊断。
- MARGIN 在各模型的置信带内用 EWMA 跟踪准确率与自报置信,用二者之比校正分数,稀疏带向该模型的整体比值收缩。校正分作为已获得答案的投票权重。不重训、不看内部状态、不用单独标定集,但依赖随后的正确性反馈。
- 两次代码迁移后,九云端 MARGIN 的 ECE 为 12.99 与 11.89,低于五个在线基线;MMLU-shift 为 2.85,与在线 Platt 比较无定论。18 模型冷启动的选择准确率在 MBPP、BCB 上升 4.32、13.98 个百分点。
- 作者称适用取决于正确性反馈,只核验被选回答者会损害校准;泛化受存档队列和突变迁移所限,渐变漂移未测。实验为 18 模型池与九云端子集,问答和数学只做校准、不做投票。
- 被测模型
- MiniMaxAI/MiniMax-M2.5Qwen/Qwen2.5-14B-Instruct-1MQwen/Qwen2.5-32B-InstructQwen/Qwen3-32BQwen/Qwen3-Coder-480B-A35B-Instruct-FP8deepseek-ai/DeepSeek-R1-Distill-Qwen-32Bdeepseek-ai/DeepSeek-V3.2openai/gpt-oss-120bzai-org/GLM-4.7-Flashollama/deepseek-coder-v2ollama/llama3.1_70bollama/llama3.1_8bollama/mistral_7bollama/phi4_14bollama/qwen2.5-coder_32bollama/qwen2.5-coder_7bollama/qwen2.5_14bollama/qwen2.5_72b
- 基准
- HumanEvalMBPPBigCodeBenchHumanEval+MBPP+MMLUMMLU-ProGSM8KMATH
- 指标
- ECEanswer-selection accuracypairwise resolution
论文提出 MARGIN(Multi-Agent Runtime Grading via Incremental Normalisation),一种运行时校准方法,无需重训练模型或留出校准集,即可从观测到的答案结果中学习各模型专属的置信度修正。在 18 模型池及 9 模型子集的代码生成、问答与数学评测中,MARGIN 在两次代码生成迁移上的迁移后期望校准误差低于全部五个在线校准基线,问答迁移上低于四个。代码生成协调实验中,校准使两个基准的答案选择准确率分别提升 4.3 和 14.0 个百分点。
深度解读
这篇论文试图解决什么问题?
自报置信跨模型不可直接比,负载变化还会使已有校正失效。
协调器要用自报置信比较异构基础模型的答案,但同一数值在不同模型和变化负载下含义不同。
- 场景:作者认为语言模型置信常常失准;分数一旦用于比较或聚合,失准就从单模型诊断变成协调问题。任务可以更换,而权重和回答策略不变,早先学到的置信–正确性关系可能不再适用。
- 现有方法:温度缩放、Platt scaling 和直方图分箱在标定数据上一次拟合。论文引用 Ovadia et al.,强调不能从分布内标定外推到数据集偏移。在线校正会随后续结果更新,但比较对象应是收到相同反馈、并把已学状态带入新负载的规则。
- 观察:BigCodeBench 的异构池上,模型平均自报置信与准确率负相关;一正一误的回答对中,选更自信者低于随机。作者称之为 confidence inversion(第 7.3 节)。
- 提出的方法:运行时方法 MARGIN(Multi-Agent Runtime Grading via Incremental Normalisation)按模型与置信带,用已观察准确率和自报置信之比校正分数,稀疏带向模型级估计收缩,再以校正分做答案级投票。不重训、不访问权重或 logits、不用单独标定集。
- 信息契约:协调器只使用候选答案、自报置信和事后正确性;回答者独立作答,不保留任务间状态,也不接收校正状态,回答策略固定。主实验在评分后给每个可用回答反馈。交互审议、规划、策略适应和轨迹依赖置信不在评测设定内。代码正确性由可执行测试判定,正确程序不必匹配参考解。
有哪些相关研究?
作者把 MARGIN 放在相同反馈的在线校正比较里,模型本身不重训。
校准与在线适应
- 事后校准:温度缩放、Platt scaling 和直方图方法把预测分数映射到经验正确率(Guo et al. 2017;Platt 2000;Naeini et al. 2015)。论文称一次拟合后是否仍有效,取决于标定分布与部署分布的关系,并引用 Ovadia et al. 2019 说明应在数据集偏移下评估不确定性。
- LLM 校准:Thermometer 从多任务学习辅助校准器再用于新任务(Shen et al. 2024);ConfTuner 用 token 化 Brier 目标微调口头置信(Li et al. 2025);Luo et al. 2025 用预训练参考模型校准后训练模型,且只在二者预测一致的例子上对齐置信,无需标注标定数据。论文称这些工作的访问和训练要求不同;MARGIN 固定回答模型,只从观察到的答案结果更新协调器校正。
- 序列校准:Dawid 1982、Foster and Vohra 1998 研究随结果到达而修订的概率;专家建议按损失给预测器分配权重(Cesa-Bianchi and Lugosi 2006);多重校准要求在指定、可能重叠的组上校准(Hébert-Johnson et al. 2018)。论文称这些目标相关但不同:MARGIN 使用固定的模型/置信带分组,估计定理只谈更新偏差,不声称遗憾界或多重校准。自适应共形推断调整的是覆盖准则(Gibbs and Candès 2021),论文称这不同于这里的点置信目标。
置信信号与模型选择
- 口头置信:Tian et al. 2023 研究直接索取口头概率。论文称 Xiong et al. 2024 比较置信引出策略,并报告 vanilla 口头置信的失败检测可以很差,某些设定下点估计低于随机;该分析比较的是同一模型的不同答案。本文的成对诊断比较的是回答同一任务的不同回答者,另有一个统计量看模型平均置信与准确率的关联。论文称二者相关但不能互换。
- 重复采样:Self-consistency 采样多条推理再聚合(Wang et al. 2023);语义不确定性按意义等价分组,而不是把每个不同字符串都当成不同答案(Kuhn et al. 2023;Farquhar et al. 2024)。综述见 Geng et al. 2024、Liu et al. 2025。论文称 MARGIN 的主评测用口头置信,校正作用在给定信号上,不改变引出程序。
- 选模型与级联:Gerych et al. 2024 用辅助回归器预测模型–提示词对的置信并选择一对;FrugalGPT 学习在答案质量与查询成本之间权衡的级联(Chen et al. 2024)。论文称这里候选答案已经取得,MARGIN 只给最终答案加权;少查询哪些模型是另一个问题。
多智能体协调与信任
- 辩论与委托:基础模型多智能体系统使用辩论、委托和结构化对话(Du et al. 2024;Smit et al. 2024;Wu et al. AutoGen 2024;Zhou and Chen 2025)。论文称那些设定里交互可以改变智能体最终给出的答案;La Malfa et al. 2025 讨论其与经典智能体模型的关系。MARGIN 研究的是独立回答者与协调器之间带置信的接口,回答策略保持固定。
- 信任与声誉:Jøsang et al. 2007 综述多种表述和证据来源;EigenTrust 把基于事务的评分聚成每个节点的全局声誉(Kamvar et al. 2003)。论文称单一参与者级分数可能掩盖置信区间之间的差别:同一回答者在中等置信时可靠,在高置信时仍可能高估可靠性。MARGIN 用模型/置信带状态跟踪这一上下文,乘性因子调整的是所报告的分数,而不是对智能体做无条件排名。
基线与基准
- 基线方法:未校正的原始自报置信;五个在线基线都维持逐模型状态并接收相同观察:滑动窗口直方图(最近 W=200,10 个等宽箱)、衰减直方图(衰减 0.98,10 箱)、窗口准确率 replace 与 multiply(窗口 200)、在线 Platt(学习率 0.1,L2 系数 10^-4)。无收缩 MARGIN 是消融,不是这五个基线之一(第 6.2 节)。
- 基准:HumanEval、MBPP、BigCodeBench 的 hard 子集、HumanEval+、MBPP+、MMLU 的 STEM 题到 MMLU-Pro 的 business 题、GSM8K 到 MATH。
作者把本文定位为:回答模型固定,协调器从答案结果更新校正;与收到相同反馈并保留各自源状态的在线直方图、窗口准确率和在线 Platt 比较比值、分带和收缩这一组合。
论文如何解决这个问题?
MARGIN 用置信带内准确率与自报置信之比校正分数,再做答案投票。
MARGIN 在协调器侧为每个回答者、每个置信带维护运行估计,用带内准确率与平均自报置信之比校正新分数,再把校正分当作已获得答案的投票权重。回答模型、其权重和回答策略都不改。
问题设定与形式化
- 回答池为 A={a1,…,aN}。任务 qt 上,参与子集 At 给出答案 ŷi,t 和自报置信 ci,t∈[0,1]。协调器先选答案,任务特定评测器随后可以给出 oi,t∈{0,1}。代码任务由可执行测试决定对错,正确程序不必与参考解一致。
- 校正目标是 Pr(oi,t=1∣ c̃i,t=p)≈ p, c̃i,t=fi,t(ci,t)。fi,t 只能使用给任务 t 打分之前已经到达的结果。该目标在观察到的流上评估,并不是假设变化中的负载已经校准。
- 协调器没有模型内部、训练数据或单独标定集。这里的 agent 是池中的一个模型实例。评测中的回答者独立作答,不保留任务间状态,也不把协调器的校正状态当反馈。
分带跟踪与对称更新
- 主分析把 [0,1] 分成 K=3 个等宽置信带,为每个(模型,带)维护单独因子,使失准可以随自报置信变化。存档口头置信在 0–100 上记录,校正前除以 100。带边界在负载变化时固定,使同一带在源流和目标流上含义不变。带索引记为 κ(c)。
- 每个带有两个 EWMA:âi,k 为该带经验准确率,c̄i,k 为该带平均自报置信,学习率 α∈(0,1)。观察到结果后,âi,k←(1−α)âi,k+α oi,t,c̄i,k←(1−α)c̄i,k+α ci,t。两者都初始化为带中点,因此初始因子为 1,没有观察时原始置信原样通过。
- 带内校正因子为 γi,k=âi,k/c̄i,k。论文举例:准确率 0.60、带内平均自报置信 0.90 时,因子约为 0.67;收缩和裁剪之前,新的 0.90 会被校正到约 0.60。在同一(模型,带)序列中,τ 次带更新之前的观察权重为 α(1−α)^τ,有效记忆大约是该带内 1/α 次观察。主分析取 α=0.04。
- 正确和错误使用同一个学习率。论文称失败后用更快的学习率即使在平稳条件下也会改变被估计的量。Theorem 1 考虑两速率 EWMA:成功用 αup、失败用 αdown。在独立同分布 Bernoulli(θ)、0<θ<1 下,稳态期望为 αup·θ 除以 αup·θ 与 αdown·(1−θ) 之和,当且仅当两个速率相等时等于 θ。附录 A 给出推导。论文称该结果只限于这一两速率族在平稳独立伯努利结果下的无偏性,不蕴含非平稳下的 MSE 最优,也不蕴含下游比值、ECE 或投票最优。
收缩、裁剪与投票
- ni,k 是模型 i 在带 k 上累计的观察数。模型级目标 γi,· 是各带 EWMA 的计数加权比值:分子为各带 ni,j·âi,j 之和,分母为各带 ni,j·c̄i,j 之和;总计数为 0 时取 1。它不借用其他模型的历史。
- 有效因子把带内因子与模型级目标按 ni,k/(ni,k+ks) 和 ks/(ni,k+ks) 混合。ks>0 控制带内估计多快取代模型级目标。论文称这是可信度加权混合,不是由显式先验和似然推出的后验。计数是累计的,准确率和置信估计用指数权重。主分析 ks=100;仅消融使用 ks=0,此时有效因子就是带内比值。
- 校正置信为有效因子乘以当前自报置信,再裁剪到 [0,1]。候选答案 y 的聚合分为所有给出该答案的回答者的校正置信之和,选择 argmax。代码实验的答案相等用精确代码签名:规范化换行,去掉首尾换行,保留缩进和内部空白。空程序或缺失程序不形成答案组。两个比值的分母都有 10^-12 的下界。
事件顺序
- Algorithm 1 把预测和反馈分开。任务到达时,用当前状态给每个候选打分、选出答案,并保存所用置信和带。结果到达时,用该次任务当时报告的置信更新,而不是用一条新回答。延迟结果因此仍对应原任务。Figure 1 的图注写明:当前结果只在预测已经打分之后才并入。
- 只有确定的结果和有效置信进入评测更新。未知或隔离标签不改记为失败。主设定全程使用 K=3、α=0.04、ks=100。同一凸 EWMA 递推可以接受 [0,1] 上的有界分级结果,但定理和实验针对二元正确性。论文称多类概率校准需要另行定义的类别特定构造,此处未评测。
论文做了哪些实验?
两次代码迁移上,MARGIN 的事后 ECE 低于五个收到相同反馈的在线基线。
实验设置
- 被测模型:规范池 18 个。九个云端为 MiniMaxAI/MiniMax-M2.5、Qwen/Qwen2.5-14B-Instruct-1M、Qwen/Qwen2.5-32B-Instruct、Qwen/Qwen3-32B、Qwen/Qwen3-Coder-480B-A35B-Instruct-FP8、deepseek-ai/DeepSeek-R1-Distill-Qwen-32B、deepseek-ai/DeepSeek-V3.2、openai/gpt-oss-120b、zai-org/GLM-4.7-Flash。九个本地为 ollama/deepseek-coder-v2、ollama/llama3.1_70b、ollama/llama3.1_8b、ollama/mistral_7b、ollama/phi4_14b、ollama/qwen2.5-coder_32b、ollama/qwen2.5-coder_7b、ollama/qwen2.5_14b、ollama/qwen2.5_72b。迁移比较用同一固定九云端子集。Gemma-4-31B-it 已收集但排除;作者称它属于更晚一代,混入会把能力与模型时代混在一起。本地模型记录为 4-bit,用 Ollama 的 0.13.x 与 0.16.x 服务,默认上下文分别为 2048 与 4096;逐请求遥测不完整。云端/本地划分是描述性的,不是对量化或能力的受控干预。
- 负载与规模:冷启动为 HumanEval 164、MBPP 257、BigCodeBench 144,均 18 模型。迁移为 HE→BCB(164→144)、MBPP→BCB(257→144)、MMLU STEM→MMLU-Pro business(189→200)、GSM8K→MATH(200→196)、HE→HE+(164→163)、MBPP→MBPP+(257→224),均为九云端(Table 1)。BCB 在冻结执行配置下隔离 4 个参考不满足该配置的任务,148 中留 144。可用目标记录(Table 9)冷启动为 2787、4412、2449,六个迁移目标为 1190、1190、1562、1700、1467、2016。HE+、MBPP+ 复用原候选程序、只加严测试,论文称这不是独立的未见问题泛化。问答与数学用存档答案、金标准记录和确定性评分器,只评校准,不做答案级投票。
- 采集:口头置信按 0–100 采集后除以 100,温度设为 0。输出上限为普通代码 4096 token、指定高 token 路径 16384、选择题 2048、数学 16384。作者称上限不能说明实际生成了多少 token,也不能说明没有截断。附录 B.2 给出各任务族模板。
- 协议与基线:迁移时每个在线方法在源负载上收到全部正确性反馈,自身状态不重置进入目标;目标预测先于其结果更新。冷启动从空历史直接在目标基准上估计。基线为原始自报置信,以及滑动窗口直方图、衰减直方图、窗口准确率 replace、窗口准确率 multiply、在线 Platt。配置固定,没有估计器被调到自己的最优。无 LLM 裁判。
- 指标:所有在线分数都是先预测后更新。ECE 用 10 个等宽箱,与 MARGIN 的 K=3 状态带不同,按 0–100 报告,并汇合队列内回答者;无有效置信或无确定对错的行排除。选择准确率是式 (9) 所选答案通过评测器的保留任务比例;无可用答案组则弃权,该任务计 0。代码分组平局按模型标识的固定顺序打破。成对分辨只保留恰有一个正确回答的对:该回答者置信更高计一胜,相等计半分;全对和全错的对排除,50% 为随机参照。
- 重复与区间:指标聚合 100 条打乱历史。ECE 先跨历史平均各题的箱计数、预测和与结果和,再算汇合残差,不是 100 个 ECE 的平均。配对 95% 区间来自 10000 次问题聚类 bootstrap,各方法抽到相同题目,且不在抽样内重放校准轨迹。区间以已记录历史、可用预测和保留任务为条件,不做多重性校正;含 0 时作者称为 inconclusive,而不是等价证据。主顺序是一题的全部预测完成后再做该题的任何更新。参数敏感性用历史观察顺序,因此同一固定配置的 ECE 与 Table 3 略有不同。
主结果
下表为九云端、各方法保留源状态的事后 ECE(Table 3)。Δ 为 MARGIN 减 Raw,单位是百分点;ECE 为 0–100,越小越接近置信与正确率一致。
| 条件 | Raw | MARGIN | Δ | 95% 区间 | | HE→BCB | 66.79 | 12.99 | −53.80 | [−54.41, −50.16] | | MBPP→BCB | 66.79 | 11.89 | −54.90 | [−55.55, −51.13] | | MMLU-shift | 18.70 | 2.85 | −15.85 | [−17.00, −12.50] | | GSM8K→MATH | 26.16 | 3.45 | −22.70 | [−24.16, −17.17] | | HE→HE+ | 8.57 | 3.57 | −5.00 | [−6.25, −1.99] | | MBPP→MBPP+ | 17.96 | 3.07 | −14.89 | [−16.18, −9.82] |
- 作者报告,两次到 BigCodeBench 的迁移上,MARGIN 的事后 ECE 低于全部五个在线基线。该两行上 ECE 最低的在线对照是 Online Platt,其 ECE 为 15.32 与 13.42(Table 10);相对 MARGIN 的差为 2.33 与 1.53 个百分点,配对区间均低于 0(Table 2)。与窗口类估计器的差更大。
- MMLU STEM 到 MMLU-Pro business 上,相对两个直方图和两个窗口准确率基线的配对比较都利于 MARGIN;Online Platt 的 ECE 为 3.17,与 MARGIN 的比较 inconclusive(Table 2、Table 10)。作者称所观察到的适应结果因此延伸到同时改变科目和答案格式的问答迁移。
- 作者称,相对 Raw 更低并不能把 MARGIN 和其他在线方法区分开。数学迁移上,只有相对 Online Platt 的点态区间利于 MARGIN,且端点接近 0(Table 10 写到三位小数 [−1.610, −0.003]);其余四个比较 inconclusive。两次同任务加固上,对五个基线的比较都 inconclusive。作者称比较性结论只针对所报告的迁移和配置。
答案选择
- 测了什么:另做冷启动协调,18 模型、无源历史,Raw 与 MARGIN 使用同一答案分组和投票,只改置信权重(Table 4)。这与第 7.1 节的迁移后比较分开。
- 结果:ECE 在三个代码基准上都更低。成对分辨上升 35.13、31.31、20.99 个百分点,配对区间为正。选择准确率在 MBPP 从 87.94% 到 92.26%(+4.32),在 BigCodeBench 从 13.89% 到 27.87%(+13.98),区间为正。HumanEval 从 94.51% 到 95.33%(+0.82),区间含 0。摘要写的是 4.3 与 14.0 个百分点。
- 作者解读:校正后的置信可以改变协调器选出的答案,但校准变好并不确立每个下游统计都变好。Raw 在 HumanEval、MBPP、BigCodeBench 上分别有 62.2%、59.9%、78.5% 的任务最高分组平局。按期望均匀打破后,选择差为 8.79、10.60、12.75 个百分点,区间均为正(Table 15)。
置信倒置与无历史比较
- 倒置:18 模型 BigCodeBench 上,平均自报置信与通过率 r=−0.692,区间 [−0.759, −0.514]。未校正成对分辨 42.37%,区间 [38.99, 45.58];作者称在该支持上选更自信者差于随机。九云端子集 r=−0.574,区间 [−0.775, −0.081];成对分辨 45.73%,区间 [40.07, 51.43],作者称该子集上低于随机并未确立。作者称这是两个不同统计,也不能认定模型能力、任务特征或服务配置的相对因果贡献。
- 单基准在线比较:无先验历史、18 模型(Table 5,格子为 MARGIN 减对照 ECE)。HumanEval 与 MBPP 上,相对衰减直方图为 −4.66 与 −4.03,区间为负;与其余四个方法 inconclusive。BigCodeBench 上,Online Platt、滑动直方图、multiply、replace 分别为 +3.79、+7.98、+8.98、+8.76,区间为正,即这些方法的 ECE 更低;与衰减直方图为 −0.63,区间含 0。
- 作者解读:这与 Table 2 的迁移后排序不同。匹配的九云端 BCB 冷启动(Table 14)仍保留这四项不利于 MARGIN 的比较,衰减直方图仍 inconclusive,因此不能只用从 18 模型换成九云端来解释。作者称该结果是评测流上累积的 ECE,本身并不确立收敛速度差异,也不把遗忘日程分离为原因。
选择性反馈
- 测了什么:源阶段仍全反馈;目标上每个方法能看到全部候选分数,但只更新自己校准置信最高的回答者。平局按各协议的候选顺序。诊断用稳定的模型级 argmax,不是第 7.2 节的答案级投票。ECE 仍覆盖全部可用候选预测(第 7.5 节)。
- 结果:问题顺序下,MARGIN 在 HE→BCB、MBPP→BCB 的 ECE 为 46.48(相对匹配全反馈 +33.49)和 41.75(+29.86);历史顺序为 46.62(+33.52)、41.66(+29.74)(Table 6)。作者称相对全反馈轨迹大约升高 30–34 个百分点。Table 11 的问题顺序还给出:MMLU-shift 9.05(+6.199),GSM8K→MATH 9.16(+5.707);HE→HE+ 为 −0.184,MBPP→MBPP+ 为 +1.844,这两个区间含 0。
- 作者解读:反馈集中会改变校准器收到的证据,很少被选中的模型不能在全负载上定期刷新估计。作者称绝对误差和对审查的敏感性是不同比较:该制度下 MARGIN 的 ECE 仍低于列出的五个基线,但其升幅大于硬窗口方法。Online Platt 的升幅大于 MARGIN;相对衰减直方图的升幅差 inconclusive。作者称实验诊断了这一限制,未评测探索或 off-policy 校正。
其他消融与分析
- 学习率,历史观察顺序(Table 7):HE→BCB 上 α=0.005/0.04/0.08 的 ECE 为 47.05/13.10/10.36;MBPP→BCB 为 43.75/11.91/9.80。这里的 0.04 基线不同于 Table 3 的问题顺序。
- 同一历史顺序下,α=0.08 相对主配置使 HE→HE+ 的 ECE 差为 +1.316,MBPP→MBPP+ 为 +2.188(Table 13)。作者称 0.08 改善 BCB 迁移值,但使同任务加固变差。
- 去掉收缩,问题顺序(Table 10):BCB、问答、数学迁移上与 ks=0 的差 inconclusive;HE→HE+、MBPP→MBPP+ 上 ks=0 的 ECE 更低,MARGIN 减 ks=0 为 +1.318、+0.876。
- 带数(第 7.6 节,网格为历史顺序):1 到 5 带时,BCB、问答、数学迁移的 ECE 变化小于 0.3;HE→BCB 上 1 带比 3 带低 0.05。10 与 20 带使 BCB 迁移 ECE 升高 2.9 到 6.9。MBPP→MBPP+ 上 3 带比 1 带低 0.54;HE→HE+ 的 1 带与 3 带之差 inconclusive。作者称网格支持少量带,但并不单独选出 3。
- 不对称成功/失败速率(Table 13):HE→BCB 上 0.08/0.02 与 0.04/0.01 的 ECE 为 39.726 与 45.867,相对对称 0.04/0.04 的 13.100,差为 +26.627 与 +32.767。作者称若干不对称设定相对固定对称设定使 ECE 上升很多;0.02/0.08 在 HE→BCB 上的区间含 0。
- 作者称这些发现刻画的是固定配置,并不据此选择新的主设置,也不确立任意负载上的最优默认值(第 7.6 节)。
有什么可以进一步探索的点?
作者称反馈、突变迁移和固定配置决定了结论能外推到哪里。
作者指出的局限与后续方向
- 比较评估的是完整的固定配置,不能分离出分带、收缩或某种遗忘日程的普遍收益。Theorem 1 解释的是平稳条件下准确率估计的偏差;适应比较和最终投票的质量依赖实验。冷启动比较和参数消融显示,固定的 MARGIN 配置并非处处更可取(第 8 节)。
- 正确性反馈是主要运行条件。全反馈适用于候选回答可以被检查的情形,如所保留的可执行测试。只核验被选中的回答者会产生选择性观察的历史;作者称该诊断显示校准受到实质损害。探索、周期性核验其他回答或 off-policy 调整是可能的后续做法,但这里没有评测(第 8 节)。
- 泛化受存档队列、保留任务支持和突变式负载转换所限。测试加固复用任务;渐变或反复漂移未测(第 8 节)。
- 提供方、模型能力、量化与服务配置没有被独立变化,逐请求的上下文和终止遥测不完整。作者称因此不能确定没有发生截断,也不能认定倒置的服务侧原因(第 8 节)。
- bootstrap 区间量化的是以已记录历史和支持为条件的变异,没有同时覆盖保证,也没有对新模型总体的保证(第 8 节)。
- 选择上的收益相对于未校正置信加权。作者称这不能确立集成优于以更低推理成本部署一个已知最强模型;这些证据支持的是所评测的协调器/回答者接口,不是关于协商、交互审议或自主多步智能体的证据(第 8 节)。结论把适用性条件写为参与回答者能够提供正确性反馈(第 9 节)。
实验覆盖范围
- 规范池为 18 个模型,迁移比较使用固定九云端子集;Gemma-4-31B-it 被收集后排除(第 6.1 节、附录 B.1)。
- 保留比较包括 Table 1 的三个代码冷启动和六个源到目标迁移。LiveCodeBench、CodeContests、TriviaQA 以及原来的动态池组合未进入保留比较;论文给出的原因是历史评测器或参考证据认证不足(第 6.1 节、附录 B.1)。
- 问答和数学只评校准,不做答案级投票。协调实验使用已经引出的池内答案,不比较相对单模型的总推理成本,也不确立相对事后选出的最佳模型的优劣(第 6.1–6.2 节)。
- 五个在线基线使用文中写明的固定配置,未在目标上做超参搜索;事后的设计期方法不用于主张只有 MARGIN 才有的优势(第 6.2 节)。主结果聚合 100 条打乱历史,区间来自 10000 次问题聚类 bootstrap;参数网格使用另一套历史观察顺序(第 6.3、7.6 节)。
- 主实验在评分后更新每个可用回答。第 7.5 节另有只更新校准 argmax 回答者的诊断,且未评测探索或 off-policy 校正。主比较表报告的是队列汇合 ECE;论文未在这些主表中按模型分别给出 ECE。
总结一下论文的主要内容
有反馈时,MARGIN 按模型校正自报置信,并在两次代码迁移上得到更低 ECE。
MARGIN 是放在协调器侧的运行时置信校正:异构基础模型各自报告置信,协调器不改模型,只把这些分数变成答案级投票的权重。
要处理的是两件事。同一自报数值在不同模型上可靠性不同;任务分布改变后,旧的校正关系也可能失效,而模型权重和回答策略可以保持不变。BigCodeBench 上还有置信倒置:18 模型池的平均自报置信与通过率相关为 −0.692,未校正成对分辨为 42.37%,作者称低于随机(第 7.3 节、Table 4)。
方法把置信分成 K=3 个等宽带,用同一学习率 α=0.04 的 EWMA 跟踪带内准确率与平均自报置信,以其比值校正新分数;观察少的带以 ks=100 向同一模型的整体比值收缩。预测先于结果更新。成功和失败用同一学习率,Theorem 1 说明两速率更新在平稳伯努利结果下会带来稳态偏差。
主要数字都带条件。九云端、相同反馈、源状态保留时,HE→BCB 与 MBPP→BCB 的 MARGIN 事后 ECE 为 12.99 与 11.89,低于五个在线基线;MMLU-shift 为 2.85,与在线 Platt 的比较无定论(Table 2、Table 3)。18 模型冷启动下,选择准确率在 MBPP、BigCodeBench 上升 4.32 与 13.98 个百分点,摘要写为 4.3 与 14.0;HumanEval 的选择差无定论,三个代码基准的成对分辨都上升(Table 4)。同一 BCB 冷启动上,若干在线基线的 ECE 低于 MARGIN(Table 5)。只更新被选模型时,两次 BCB 迁移的 ECE 升到 46.48 与 41.75(Table 6,问题顺序)。
作者的结论是:参与回答者能提供正确性反馈时,这些实验支持用模型别的运行时校正来做变化负载下的协调。该结论不延伸到交互审议或自主多步智能体,也不表示集成优于已知最强单模型。