跳到正文
原文
论文追踪· arXiv:2503.22989· Gabriel Recchia, Chatrik Singh Mangat, Issac Li, Gayatri Krishnakumar·本站收录 · 原文发表

FindTheFlaws:用于检测推理缺陷与可扩展监督研究的标注错误数据集

FindTheFlaws: Annotated Errors for Detecting Flawed Reasoning and Scalable Oversight Research

论文速读

评测与基准

据论文 PDF 整理(AI 生成),以原文为准

作者构建FindTheFlaws并评测五模型找错;MedQA上o3-mini错误定位准确率0.662。

问题
可扩展监督需要专家核验的正确长解答,以及标出具体错误的错误长解答,但这类数据很少。没有错误性质,就难判断监督是指出了真缺陷,还是只会做二元对错判断。
方法
五个数据集覆盖医学、法律、数学、科学、编程和Lojban。错误解答由模型生成或改写,再经领域专家修订、筛选并标注错误位置或说明。模型做对错判别,错误样本再由另一模型判断其说明是否与专家等价。
实验与结果
作者称Adv. MedQA上o3-mini错误定位准确率0.662(N=160),高于基线0.344(N=125);Lojban专家基线0.867(N=98)高于o3-mini的0.715。
局限与可以继续做的
作者指出引入的错误可能不同于欺骗或辩论训练中的分布;用Claude 3.5 Sonnet判定等价可能有偏,提示词也可能影响结果。多数集上前沿模型已达到或超过其保守专家估计。实验是模型找错,未跑监督协议对局。
实验设置gpt-4o-2024-11-20、o3-mini-2025-01-31 (medium) 等 · Modified TheoremQA、Adversarial MedQA 等 · F1、Accuracy 等
被测模型
gpt-4o-2024-11-20o3-mini-2025-01-31 (medium)claude-3-5-sonnet-20241022claude-3-7-sonnet-20250219Llama 3.3 70B
基准
Modified TheoremQAAdversarial MedQACELSGPQA Diamond PlusPython650Meta Python650Alt Meta Python650
指标
F1Accuracyerror-grading accuracymatch-allgrade-all
AI 导读研究者发布 FindTheFlaws,一组覆盖医学、数学、科学、编程和 Lojban 语言的五个数据集,每个数据集包含问题与长文本解答,并由专家标注其正确性或指出推理中的具体错误。论文称,这类同时包含专家验证正确解与带错误标注的缺陷解的数据集此前很少,而它们对评估辩论、批评、证明者-验证者博弈等可扩展监督方法很有用。作者评估了前沿模型的批评能力,发现性能差异可被利用:在特定数据集上表现较弱的模型可充当更强模型的评判者或验证者。在某些任务与数据集组合上,专家基线甚至超过顶级模型的表现。

研究者发布 FindTheFlaws,一组覆盖医学、数学、科学、编程和 Lojban 语言的五个数据集,每个数据集包含问题与长文本解答,并由专家标注其正确性或指出推理中的具体错误。论文称,这类同时包含专家验证正确解与带错误标注的缺陷解的数据集此前很少,而它们对评估辩论、批评、证明者-验证者博弈等可扩展监督方法很有用。作者评估了前沿模型的批评能力,发现性能差异可被利用:在特定数据集上表现较弱的模型可充当更强模型的评判者或验证者。在某些任务与数据集组合上,专家基线甚至超过顶级模型的表现。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    可扩展监督缺少带具体错误标注的长解答,FindTheFlaws用五个领域的数据补这一缺口。

    可扩展监督缺少专家核验的正确长解答,以及标出具体错误的错误长解答。

    • 场景:作者认为,解答变难后连领域专家也难直接核验;人类反馈的局限会削弱高风险场景中的信任,并牵出 robustness、reliability 与 alignment(Amodei et al., 2016)。协议希望人类或受信任裁判在直接核验过难或过贵时仍能评价输出。
    • 现有缺口:作者称,既有工作多测监督能否帮裁判做出正确的二元对错判断,较少问拒绝错误解答时有没有指出真正的问题(Lightman et al., 2023;Uesato et al., 2022 除外)。没有专家核验的错误性质,就难测批评是否对准真实缺陷,也难区分辩论成绩下降来自裁判更难评,还是辩手在用似是而非的论证。
    • 作者的判断:批评、辩论和 prover-verifier games 的评估都需要两类材料:专家核验的正确长解答,以及错误位置和/或说明已知的错误长解答。只知最终答案对错,不足以判断监督会不会随题目变难而失效。
    • 本文的资源:作者提出 FindTheFlaws,覆盖医学、数学、科学、编程和 Lojban。作者用它评测前沿模型的批评能力,并称特定数据集上较差的模型可作更强模型的 judge/verifier;部分任务的专家基线超过顶尖模型,作者认为更利于可扩展监督实验。
  2. 有哪些相关研究?

    论文讨论监督协议、批评基准、过程监督与幻觉检测,并把本文放在难题的专家错误标注上。

    可扩展监督与相关基准

    • 直接交互与 sandwiching:Bowman et al. (2022) 用 MMLU 与 QuALITY 测人类直接与 LLM 交互,并采用 sandwiching(Cotra, 2021)。作者称人与模型一起高于单独的人或模型。
    • 辩论实验:Khan et al. (2024) 只用说服力信号训练辩手;Michael et al. (2023) 比较辩论与 consultancy。二者主要用 QuALITY。Kenton et al. (2024) 扩到带隐藏信息的抽取式问答、数学、编程、逻辑题和多模态;作者称辩论通常优于 consultancy,尤其辩手可选立场。论文指出,除合成修改的 PrOntoQA 外,这些集没有错误位置或错误解释的真值标注。
    • 其他协议:同节还列出 self-critique(Saunders et al., 2022)、prover-verifier games(Anil et al., 2021;Kirchner et al., 2024)、market-making(Hubinger, 2020)和 recursive reward modeling(Leike et al., 2018)。论文称,不需专门知识、或困难来自人为限制信息的成功,未必迁到更复杂的真实场景;Barnes et al. (2020)、Irving and Askell (2019) 做过更难任务,但是小规模实验。

    批评能力基准

    • CriticEval:Lan et al. (2025) 测单回复反馈、两回复比较、按反馈改写、以及评价反馈本身,覆盖九个领域。
    • 更窄的基准:CriticBench(Lin et al., 2024)、MetaCritique(Sun et al., 2024)、SummEval(Fabbri et al., 2021)、WMT-22(Freitag et al., 2022)任务或领域更窄;MT-Bench(Zheng et al., 2023)针对多轮对话与指令遵循。
    • 早期批评实验:Saunders et al. (2022) 在主题摘要及算术、布尔可满足等合成任务上写自然语言批评。作者称,把批评给评估者后,他们比无人协助时多找出约 50% 的缺陷。论文称这些任务相对简单,错误空间也不够开放。

    过程监督与结果监督

    • PRM800K:Lightman et al. (2023) 在 MATH 上比较逐步奖励与只奖最终答案,过程监督模型解出 78% 测试题,并发布 800,000 条步骤正误标签。
    • 开放问题:Uesato et al. (2022) 认为过程监督可能抓住结果训练漏掉的错误。论文把“数学上的过程监督能否泛化到医学、法律、语言或生物学”留作开放问题,并称 FindTheFlaws 可供检验在 PRM800K 或合成数据上做过过程监督的模型。

    幻觉检测与合成错误

    • 检测基准:Huang et al. (2025) 区分事实性与忠实性幻觉,以及幻觉评测基准和检测基准。论文称,按该宽标准 FindTheFlaws 可算同时标注两类的检测基准,但焦点是需专家分析、且足以导致最终结论错误的错误。该综述中除 FELM 外,所列检测基准只考虑忠实性幻觉。
    • FELM:Zhao et al. (2023) 被作者称为最接近的数据集:专家标注、多领域、有错误位置和解释,最可比的是 CELS。论文称其三分之二提示来自 GSM8K、推荐或写作、Quora 或 TruthfulQA,且 FindTheFlaws 更大,并集中于难题和导致错误结论的输出。
    • 合成缺陷:Kirchner et al. (2024) 训练 sneaky prover 生成不正确但有说服力的解答;Perez et al. (2022) 训练模型生成能躲开检测器的文本。论文称 FindTheFlaws 的错误不是对抗训练生成的:部分靠对抗筛选,部分由模型引入后再经专家修订或改写。GPQA Diamond Plus 的做法类似 McAleese et al. (2024) 让承包者在模型代码中植入细微 bug,但本文不限于编程。

    基线与本文定位:实验对照不是复现上述协议,而是各子集上的人类专家或基线类比(附录 B)。作者称,本文同时给出专家核验的正确长解答和带错误性质标注的错误长解答,以便检查监督指出的是不是真实缺陷,而不是只会做二元判断的启发式。

  3. 论文如何解决这个问题?

    五套数据由模型草稿加专家修订或筛选构成,再测对错判别及错误说明是否与专家一致。

    作者构建 FindTheFlaws 的五个子集,每题有最终正确答案、一条或多条标为 CORRECT 或 FLAWED 的长解答,以及错误解答中错误的位置和/或描述。评测不训练监督协议,只测模型能否判别对错,并在错误样本上说清错误。

    数学、科学与医学子集

    • Modified TheoremQA:原 TheoremQA 有 800 个问答,其中 187 题有专家 LaTeX 解答。图像解答用 gpt-4-vision-preview 转成文本,再按句编号。gpt-4-1106-preview(temperature 0.7)以 few-shot 生成损坏解答,并写出引入的错误、所在步骤、错误答案和影响。人工核对位置与说明后得到 95 题。四例虽有计算错误,损坏解答却碰巧给出正确答案。
    • GPQA Diamond Plus:取 GPQA Diamond 198 题中的 191 题,7 题因校验者与原作者不一致被标为 unreliable。gpt-4-1106-preview 先把原解释改成编号步骤,并起草支持错误选项的解答;专家再接受、修订或重写。20 名校验者中 17 人已完成相关 PhD,3 人只完成部分 PhD 或硕士。在 191 道 reliable 题上,45 例修订了正确解答草稿,143 例认为没有问题,3 例只确认未引入新错误。错误解答草稿 165 例被修改、33 例照收(合计 198,含 unreliable 题)。另有 19 例改了选项,7 例接受了清晰度或错字修改。
    • Adversarial MedQA:从 MedQA 抽 319 道五选一题,按答案键使 gpt-4-0125-preview 错 80%、对 20%,使其期望成绩接近随机。筛选条件包括:2024 年 5 月 Google 首页搜不到答案、纯文本、两名执业临床给出自己的答案并评价模型长回答。人工筛到模型答错 255 题、答对 64 题。Clinician 1 为已通过 MRCP(UK) 的国际住院医;Clinician 2 来自 7 名英国全科、1 名注册前医生和 1 名国际外科住院医。临床可用自身知识和网上资料,中位用时 29 分钟。97 题两人都不符答案键,标为 unreliable;其余 222 题为 reliable,评测只用后者。
    • 告知难度:前 149 题不告诉临床题目对模型很难;后 170 题告知答案键上模型只对 20%。Clinician 1 在后 170 题上与模型的一致率为 57.6%,前 149 题为 69.1%(Fisher's exact test p = .037),与答案键则是 57.6% 对 45.6%(p = .034)。Clinician 2 两组都是 54.1% 对 53.7%(p = 1.0)。reliable 比例后 170 题为 75.3%,前 149 题为 63.1%(p = .021)。

    法律、Lojban 与编程

    • CELS:452 篇模型论证,来自 113 道二选题。gpt-3.5-turbo-0301 与 gpt-4-0314 各为每题的两个相反答案写论证。Table 1:合同法 5 题/20 篇,证据法 5/20,Lojban 48/192,外科 55/220。至少两名领域人员逐句标注不合逻辑、不真、真但误导或其他严重问题。法律每域三名美国律师,取与同行相关最高者为主要审稿人。两名审稿人都指出问题则为 FLAWED,都没指出为 CORRECT,只有一人指出为 AMBIGUOUS;法律改为至少两人指出才算 FLAWED。Table 2 句子数:合同法 268(正确 119、含糊 45、错误 104),证据法 254(104/58/92),Lojban 1938(528/308/1102),外科 2383(1306/479/598)。20 题(2 道医学、18 道 Lojban)被标为 inferior questions,供使用者自行取舍。
    • Python650:从 CodeNet 的 Python800 取 650 道竞赛题,保留有人类正确解、且 gpt-4-0314 植入的 bug 能被原测试确认的题。其中 325 题是 gpt-4-0314 在 bug detection 提示下未能判为有错的对抗筛选;另 325 题配人类正确解。再为每题生成支持与反对论证。Surge AI 为每题派两名编程标注者:判断对错、给通过或失败的测试,并挑出两篇论证中的问题。32 题两人不合或与原判断不合,改由有计算机科学 PhD 的讲师裁定。2 题因输出依赖解释器被删,剩 648 题。323/648 的“指向正确结论”的论证被标为 unreliable correct explanations,论文称排除出主分析;另 15 例因题目歧义、标注不一致或两人都不指出错误论证的问题而标为 unreliable。

    任务与成功判定

    • 解答级:模型读题目和候选解答,判 CORRECT 或 FLAWED,并写出发现的错误。Match 看该标签是否与真值一致。Error-grading 只在真值为 FLAWED 时计分:比较模型是否把错误说成与专家相同。TheoremQA 与 GPQA 比的是第一处错误;MedQA 比的是错误性质,多名标注者时只用主要标注者。比较由论文所写的 Claude 3.5 Sonnet(claude-3-7-sonnet-20250219)完成,输出 EQUIVALENT 或 DIFFERENT。名称与括号中的模型 ID 在论文里同时出现。
    • Python650 三套:Standard 只有题目和解答,因没有错误性质的真值,只做 match。Meta 还给出一篇关于解答对错的论证,match 看论证是否准确描述对错,error-grading 把模型说明与专家对论证问题的说明比较。Alt Meta 只保留“分类对了、但没指出真正错误”的错误论证,不报告 match。多名标注者时 error-grading 只用一条说明。
    • CELS:改到句子级。Match-all 看句子被判成 CORRECT 还是 FLAWED 是否与真值一致;Grade-all 看对 FLAWED 句的错误说明是否与专家等价。AMBIGUOUS 句不进入评测。每句当一个样本,但计分时考虑同一题目下句子的聚类(第 4.2.3 节)。
    • 提示与框架:评测用 Inspect。附录 C 给出生成评判和等价比较的提示模板。对 o3,论文去掉要求写出 evaluation_process 的部分,因为该模型限制请求 chain-of-thought。论文未报告评测时的 temperature 或重复次数。
  4. 论文做了哪些实验?

    五模型做对错判别与错误定位;作者称二者可不一致,且CELS Lojban上模型低于专家基线。

    实验设置

    • 被测模型:gpt-4o-2024-11-20、o3-mini-2025-01-31(medium)、claude-3-5-sonnet-20241022、claude-3-7-sonnet-20250219、Llama 3.3 70B。表中简写分别对应 gpt-4o、o3-mini、claude-3-5-sonnet、claude-3-7-sonnet、llama-3-3-70b。
    • 数据与规模:MedQA 只用 222 道 reliable 题,Table 5 为 62 个正例、160 个负例。GPQA 为 191 道 reliable 题,正确与错误解答各评一次。TheoremQA 为 95 题、各一对解答。CELS 句子数见 Table 2,AMBIGUOUS 排除。Python650 最终 648 题;各表 N 以 Table 5–10 为准,论文未把 323 例排除逐项对应到每一张表。
    • 指标:图注称 Figure 1–3 画的是 match 的 F1(正确解答为正类)和 error-grading 的 accuracy,并有 cluster-based block bootstrap 的 95% 置信区间。纯文本读不到柱高,下面的数字来自附录表,不来自图。
    • 等价判定:error-grading 与 grade-all 由论文所写的 Claude 3.5 Sonnet(claude-3-7-sonnet-20250219)判断是否与专家说明等价。论文未报告该判定与人工的一致性。
    • 基线:MedQA 用外部临床校验者。CELS Law、Lojban 的 Table 3 用单名专家,Surgery 用三名临床的多数票(附录 B)。Python650 用两名标注者互为参照。TheoremQA 与 GPQA 的 match 没有人类基线;error-grading 用基线类比。第 5.1 节和附录 B.1.3 称类比模型是 Claude 3.5 Sonnet;Figure 1 图注写成 o3-mini。两者都是在给出已标注的正确与错误解答后,比较其与解答作者关于第一处错误位置的一致率。
    • 未写明的设置:论文未报告评测 temperature、采样次数或重复运行次数。gpt-4o 有部分样本因输出格式不可用,Table 5–10 中其 N 略低。

    主结果

    下表为 error-grading 或 grade-all 准确率。模型行来自 Table 7、Table 8、Table 10;基线行来自 Table 4。GPQA 与 TheoremQA 的基线是基线类比,不是同一任务上的人类专家。

    表格较宽,可左右滑动

    模型MedQAGPQA+ThmQAMetaPyLojban
    claude-3-5-sonnet0.3620.5340.5790.5360.553
    claude-3-7-sonnet0.5440.6540.6420.6060.624
    gpt-4o0.3020.4100.5220.4470.525
    Llama 3.3 70B0.0500.3140.4840.3290.350
    o3-mini0.6620.6180.7470.5990.715
    基线0.3440.7380.9260.5960.867
    • 作者的解读:作者称 match 上顶尖模型往往接近,error-grading 差异更大,并称 GPT-4o 在后一任务上相对更差。作者据此认为,认出解答里有错误,和说清错误是什么,是不同能力。
    • 与基线的反例:作者称几乎所有模型在 Adv. MedQA 的两项任务上超过单名人类专家。Table 7 中 Llama 3.3 70B 与 gpt-4o 低于表内基线行;该基线 N=125,模型行多为 N=160,论文未说明差额。Lojban 基线 N=98,模型行约为 599–655。
    • 基线类比:作者称 TheoremQA 的类比高于标准 error-grading 上的全部模型;GPQA 上 Claude 3.7 与 o3-mini 的误差条与类比重叠(附录 B.1.3)。作者认为,模型在同时看到正确与错误解答时能找到一些单独评判时漏掉的错误。

    对错判别

    • Adv. MedQA 的 match:Table 5 的 F1 为 o3-mini 0.780、claude-3-7-sonnet 0.761、claude-3-5-sonnet 0.611、gpt-4o 0.592、Llama 3.3 70B 0.504;Table 3 基线 F1 为 0.548、accuracy 为 0.577。Llama 的 recall 为 1.000、specificity 为 0.238、accuracy 为 0.450。accuracy 上 Llama 低于基线。
    • GPQA 的 match:Table 5 的 F1 为 claude-3-7-sonnet 0.700、o3-mini 0.695、gpt-4o 0.691。作者称这三者在 match 上相当,而 error-grading 上 GPT-4o 下降。claude-3-5-sonnet 的 match F1 为 0.531,Llama 为 0.582。
    • 与专家误差条重叠的设置:Standard Python650 的 match F1,o3-mini 为 0.971,基线为 0.984(Table 6、Table 3)。作者称各指标误差条都重叠。CELS Surgery 的 match-all F1,o3-mini 为 0.936,基线为 0.940(Table 9、Table 3)。作者称顶尖模型除 precision 外落在校验者多数票的误差条内。

    Python650 三个子集

    • Meta 的 match:Table 6 的 F1 为 o3-mini 0.862、claude-3-7-sonnet 0.788、gpt-4o 0.654、Llama 0.574、claude-3-5-sonnet 0.565;基线 F1 为 0.890(Table 3,Npositive=319,Nflawed=633)。作者称专家基线也不高,error-grading 的差距可能只是评估者很难写出一致的错误描述,而不一定是模型能力的固有限制。
    • Alt Meta:Table 8 的 error-grading 为 o3-mini 0.236(N=314)、claude-3-7-sonnet 0.190(N=311)、claude-3-5-sonnet 0.166、gpt-4o 0.091(N=307)、Llama 0.067;基线 0.264(Table 4,N=314)。作者称模型和基线都下降,并称手动查看后,结论分类正确但推理有问题的论证里,模型和标注者都常漏掉细微错误。
    • Standard:只报告 match。Table 6 中 Llama 的 F1 为 0.686,低于 o3-mini 的 0.971 和基线 0.984。作者未把 Standard 的 error-grading 列入结果,原因是没有指出解答问题的真值论证。

    CELS 的领域差异

    • match-all F1:Law 上 claude-3-7-sonnet 0.898、o3-mini 0.777、基线 0.907;Lojban 上 claude-3-7-sonnet 0.765、Llama 0.662、基线 0.921;Surgery 上 o3-mini 0.936、gpt-4o 0.925、基线 0.940(Table 9、Table 3)。作者称 Lojban 的专家基线高于全部模型,Surgery 与 Law 则不然。基线 N 为 Law 223/196、Lojban 83/98、Surgery 129/39;模型在 Lojban、Surgery 上的 N 更大。第 5.3 节称基线来自每集 20 篇论证;附录 B 称 Law 的 Table 3 覆盖全部论证,Surgery 为前 20 篇上的多数票。
    • grade-all:Law 上 claude-3-7-sonnet 0.819(N=188)、claude-3-5-sonnet 0.801、o3-mini 0.459、Llama 0.347,基线 0.587(Table 10、Table 4)。作者称 Claude 系列高于其他,o3-mini 在 CELS Law 上异常地差。Surgery 上 o3-mini 0.819、Llama 0.449,基线 0.846(N=39)。作者称 Surgery 各方接近;表中 Llama 低于其余模型和该基线。
    • 作者对差距的用法:作者称,Python650 与 Meta Python650 的 match,以及 CELS Lojban、Meta Python650、Adv. MedQA 的 error-grading,出现了“人类基线或顶尖模型高于至少一个模型,而该模型又高于另一个模型”的格局,可供 automated sandwiching 使用。Claude 3.7 与 o3-mini 在多数集上较强,但 Law 的 error-grading 是 Claude 系列更高。

    其他消融与分析

    • 告知“模型只对 20%”后,Clinician 1 与模型一致率 57.6% 对 69.1%(p = .037),与答案键 57.6% 对 45.6%(p = .034);Clinician 2 两组都是 54.1% 对 53.7%(p = 1.0)(第 4.1.2 节)。
    • reliable 题比例:后 170 题 75.3%,前 149 题 63.1%(Fisher's exact test p = .021)。
    • MedQA 两名临床在 319 题上一致率 60.8%(Cohen's κ = 0.510),reliable 子集 51.8%(κ = 0.397),与外部校验者 53.6%(κ = 0.418)(附录 B.1.2)。
    • CELS 全句同意率:Lojban 84.1%(κ = 0.658),surgery 79.9%(κ = 0.577),law 80.3%(两两 κ 为 0.520、0.534、0.507;Fleiss' κ 0.518)(附录 B)。
    • Python650 两名初始标注者同意率 96.6%(κ = .932)。Alt Meta 上作者称,多数样本只有一名标注者指出论证缺陷(附录 B.1.1)。
    • gpt-4o 因格式问题 N 略低:Adv. MedQA 的 Nflawed 为 159,其余模型为 160(Table 5、附录 A)。
  5. 有什么可以进一步探索的点?

    作者指出错误可能偏人工、等价判定可能有偏,且多数集上模型已达到或超过其专家估计。

    作者指出的局限与后续方向

    • 错误来源:引入错误难免有人工性。部分错误是模型自然生成的(如 Adv. MedQA 的全部错误),并经专家核验,但其类型分布仍可能不同于欺骗模型或辩论训练中的错误。作者写到,后续扩展可以用对抗训练,使错误更能代表模型主动躲避检测的情形(第 6.4 节)。
    • 等价判定:用 Claude 3.5 Sonnet 判断模型指出的错误是否匹配专家标注,可能系统性地偏向某些错误描述或解释风格(第 6.4 节)。
    • 提示词:模型表现也可能受核验任务的具体表述影响。作者认为后续应探索降低对措辞敏感、并提高不同表述下一致性的提示方法(第 6.4 节)。
    • 专家判断本身:各集标注者间一致率不同。GPQA 与 TheoremQA 的基线类比说明,即使正确解答和错误解答都已知,第一处错误的位置仍可能有歧义。作者因此强调多名标注者和仔细校验(第 6.4 节)。
    • 饱和与更难领域:作者写到,当前前沿模型在 FindTheFlaws 的多数数据集上已达到或超过其对人类专家表现的保守估计。这些集仍可用于弱裁判实验,但更难领域中带错误标注的基准,有助于评估今天的监督机制在能力提高后还会不会继续适用(第 6.4 节)。

    实验覆盖范围

    • 被评测的找错模型为 gpt-4o-2024-11-20、o3-mini-2025-01-31(medium)、claude-3-5-sonnet-20241022、claude-3-7-sonnet-20250219、Llama 3.3 70B,共 5 个(第 4.2 节)。
    • 数据为五个子集。主结果使用 MedQA 的 222 道 reliable 题、GPQA 的 191 道 reliable 题、TheoremQA 的 95 题,以及 CELS、Python650 各任务在 Table 5–10 中的样本(第 4.1、5 节)。
    • 任务是 match、error-grading,以及 CELS 的 match-all、grade-all。Python650 分 Standard、Meta、Alt Meta;Standard 只做 match(第 4.2 节)。
    • 人类基线覆盖 Adv. MedQA、CELS 三个领域和 Python650 的相应任务。TheoremQA 与 GPQA 的 match 没有人类基线,error-grading 用基线类比;Figure 1 图注与正文、附录对类比模型的写法不一致(第 5.1 节,附录 B.1.3)。
    • 等价判断由论文所写的 Claude 3.5 Sonnet 完成。论文未报告该判断与人工的一致性,也未报告评测重复次数。正文实验是模型找错,未报告 debate、critique 训练或 prover-verifier 对局(第 4–5 节)。
  6. 总结一下论文的主要内容

    FindTheFlaws提供五领域对错长解答与错误标注,并评测模型能否指出具体错误。

    FindTheFlaws 是一组供可扩展监督研究使用的错误检测数据,本文的实验是评测模型找错,不是运行辩论或 prover-verifier 对局。

    • 要补的缺口:作者认为,只看裁判能否给解答打出正确的对错标签,不足以知道监督有没有指出真正的缺陷。因此需要专家核验的正确长解答,以及标出错误位置或说明的错误长解答。
    • 数据:五个子集覆盖医学、法律、Lojban、数学、科学和编程。错误解答来自模型生成、改写或对抗筛选,再由领域专家修订、筛选并标注。MedQA 评测用 222 道 reliable 题;GPQA Diamond Plus 用 191 道 reliable 题;TheoremQA 为 95 题。
    • 评测:五个前沿模型做 match(F1,正确解答为正类)和 error-grading(错误说明是否与专家等价)。等价性由论文所写的 Claude 3.5 Sonnet(claude-3-7-sonnet-20250219)判定。CELS 做到句子级;Python650 另有针对论证的 Meta 与 Alt Meta。
    • 主要数字:Adv. MedQA 上 o3-mini 的 error-grading 准确率为 0.662(N=160),专家基线为 0.344(N=125);Llama 3.3 70B 为 0.050,gpt-4o 为 0.302(Table 7、Table 4)。作者称顶尖模型在该集上达到或超过单名专家,表中后两个模型并未超过该基线。
    • 例外:CELS Lojban 的 grade-all 专家基线为 0.867(N=98),o3-mini 为 0.715(N=641)(Table 4、Table 10)。作者称该集仍未饱和。Alt Meta Python650 上 o3-mini 为 0.236,基线为 0.264(Table 8、Table 4)。CELS Law 的 grade-all 上 claude-3-7-sonnet 为 0.819,o3-mini 为 0.459(Table 10)。
    • 作者的结论:作者认为,判别有无错误和说清错误并不总是一起出现;部分任务上的模型差距适合做金标签、弱裁判和中等性能系统并存的监督实验。相对强弱随领域变化,因此不宜只凭单一领域评价监督方法。
阅读原文arxiv.org