SciSlopBench:评测并缓解 AI 生成论文中的科学灌水
Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers
作者用六项科学推理断裂指标构建SciSlopBench(390对),区分AI与人类论文的PairAcc为85.9%,并提出SciSlopHarness把修订约束在实验记录上。
- AI生成论文各部分单独看都像那么回事,但跨章节的科学推理会断裂,token级检测器读不到这种paper-level的scientific slop。
- SciSlopBench把390篇AI论文与同问题、同贡献类型的人类论文配对,用Structure、Argument、Artifacts六项比例打分。SciSlopHarness定位缺陷后做局部修订,并对照原稿与实验记录决定保留或回退,最多三轮。
- 六项均值在SciSlopBench上PairAcc为0.859,高于Binoculars的0.687与全文评审的至多0.685;Cross-section references单独达0.905。该分数与更低的ICLR评分相关,并在2017–2025每年区分拒稿与接收。Harness把相对Claude Code的剩余AI–human差距缩小63%,且不把人类论文当修订目标。
- 作者称六项只是初步视角,评测集中在FARS与Agents4Science 2025且多为计算机科学,并计划扩展到新生成器与学科,以及问题、方法、证据如何共同支撑结论。指标中两项依赖模型;修订编辑与评审为Claude,检测器读prose view。
- 模型
- Binoculars (Falcon-7B)DetectGPT (t5-3b)NTSPangramCycleReviewer (8B)AI Scientist reviewer (Qwen2.5-32B-Instruct)Qwen2.5(指标所用)Claude(编辑与评审)
- 基准
- SciSlopBenchFARSAgents4Science 2025ICLR 2017–2025
- 指标
- PairAccAUROCTPR@5% FPRAI–human gapcalibrated AI probabilityrejection AUROC|ρ|
研究者提出以科学灌水(scientific slop)为对象的评测框架,用 Structure、Argument、Artifacts 三个维度的六项指标识别 AI 生成论文中局部看似合理但整体科学推理断裂的问题。他们构建了 SciSlopBench,包含 390 篇 AI 生成论文,以计算机科学为主并覆盖生命、社会与自然科学,每篇配一篇研究问题与贡献类型匹配的人类论文;这些指标在配对中识别 AI 论文的准确率为 85.9%,高于 Binoculars 的 68.7%。科学灌水程度越高,ICLR 评分越低,且在 2017 至 2025 年每一年都能以高于随机的水平区分被拒与录用论文。作者指出直接优化这些指标并不奏效,并提出 SciSlopHarness,在实验记录支持改动时才引导固定 LLM 修改,相比最强改写基线将剩余的人机差距缩小 63%,且不需要人类参考目标。
深度解读
这篇论文试图解决什么问题?
AI论文局部像真的,但跨全文的科学推理会断,现有检测与改写都对不准。
AI生成论文里,各部分单独可信,但把章节、主张、引用和证据连起来的科学推理会反复断裂,现有token级检测既测不到、也修不好这种paper-level的scientific slop。
- 场景与重要性:作者把AI slop定义为低成本、高产量、看起来完成但缺乏实质的输出,并认为它把核验负担转给读者。作者称学术界的论文与同行评审里AI slop越来越常见;投稿平台已限制综述,会议开始用AI检测器筛稿。但作者认为科学论文不只是文句,FARS、AI Scientist等系统可以跑实验并写成稿,生成文本即使底层数据是编造的也可以显得可信。
- 现有方法的不足:作者称DetectGPT、Binoculars、NTS、Pangram等读的是局部文本或token概率。转述改写就能去掉token级信号(Krishna et al., 2023),而修复科学推理断裂必须补上缺失关系、且不改底层科学。现有检测集只标注文本,因此检测器——包括读完全文的LLM——识别这些模式的程度此前没有被测量。
- 核心观察:作者把scientific slop定义为科学推理如何跨全文连接时反复出现的断裂(Figure 1)。作者称这类失败在端到端AI生成论文里反复出现,ICLR审稿人即使在人类投稿里也会为此扣分。
- 本文提出什么:作者构建SciSlopBench,用Structure、Argument、Artifacts下的六项可数模式给整篇论文打分,并把390篇AI论文与同研究问题、同贡献类型的人类论文配对。为降低这些模式,作者提出SciSlopHarness:把诊断转成对固定LLM的迭代修订指引,每轮对照原稿与实验记录核验,只用审稿反馈修补仍在的推理缺口。作者称直接优化这些指标并不简单,直接的slop-aware提示会触发reward hacking。
有哪些相关研究?
相关工作分检测、自动审稿修订、以及在固定模型外做测量与去除。
机器生成文本检测
- DetectGPT(Mitchell et al., 2023)、Binoculars(Hans et al., 2024)、NTS(Ma et al., 2026)、Pangram(Emi & Spero, 2024):分别用概率曲率、模型困惑度比较、对采样温度的敏感度,以及在生成文本上训练的分类器,读局部文本片段。
- 水印与转述(Kirchenbauer et al., 2023; Krishna et al., 2023):同样作用在表层信号上。作者称与这些工具不同,本文指标读的是整篇论文中的关系,而不是局部文本片段。
- 既有检测基准:作者在第3.2节提到Wang et al. (2024)、Li et al. (2024)、Dugan et al. (2024)、Wu et al. (2024)通常评测独立散文,因而章节、表格与代码之间的关系未被检验。
自动审稿与修订
- AI Scientist(Lu et al., 2024)、CycleReviewer(Weng et al., 2025):前者用模拟评审评价自己的论文,后者从真实同行评审中学习。作者把二者用作检测基线。
- OpenReviewer与DeepReview(Idahl & Ahmadi, 2025; Zhu et al., 2025)、Self-Refine(Madaan et al., 2023):把生成评审当作主要任务,或让同一模型批评并修订自己的输出。
- RefineBench(Lee et al., 2026c)、REPAIR(Oh & Kim, 2026):前者按清单给精炼打分,并发现没有反馈时模型改进很少;后者把每一轮精炼接地到经科学API核验的文档。作者称这些系统给的是一般反馈,没有把反复出现的特定模式单独拆出来,并追问一般的审稿与修订能否去掉本文定义的缺陷;基于审稿人的精炼循环被用作修订基线。
在主动去除下做测量
- Harness层改进(Lee et al., 2026a)、Metan(Kim et al., 2026)、Evolution Fine-Tuning(Lee et al., 2026b):改变固定模型周围的信息、检查和工具,或对输出递归施加固定改进、或在进化搜索轨迹上训练。作者称SciSlopHarness沿用这一设计:编辑模型固定,编辑前加入定位到的发现,编辑后做记录接地的复核。
- 变异测试(DeMillo et al., 1978; Jia & Harman, 2010)与对抗文体测量(Brennan et al., 2012; Potthast et al., 2016):通过试图去掉某一性质来评判它。作者称slop-aware基线扮演这一角色。
基线与基准
- 检测基线:Binoculars、DetectGPT、NTS,以及AI Scientist reviewer、CycleReviewer的总体评分;Figure 4另出现Pangram。修订基线:Base prompting、Claude Code、reviewer-based refinement(合称general revision),以及Slop-aware revision。评测环境为SciSlopBench(FARS与Agents4Science 2025配对)和ICLR 2017–2025稿件。
作者把本文定位为:用整篇论文上的关系而不是局部文本来定义并测量scientific slop,并追问一般审稿修订能否去掉这些被单独定义的缺陷;Harness保持编辑模型不变,用定位发现和记录接地的复核来约束修订。
论文如何解决这个问题?
六项比例分数构成SciSlopBench,Harness只保留实验记录能支持的局部修订。
作者用六项可计数的推理断裂给整篇论文打分,建成配对基准SciSlopBench;缓解则靠SciSlopHarness,在固定LLM外定位缺陷、局部改稿,并只保留实验记录支持的改动。
六项模式与打分
- 分组:Structure管章节如何服务于论证;Argument管主张如何得到支持、以及相对已有工作的位置;Artifacts管方法能否被检查、结果代表什么。Table 1给出计数单位,以及分数为1时的含义。完整规则在Appendix A。
- Structure:Cross-section references统计正文各节与带标签对象中、从未被其他节引用的比例。Macro redundancy把句子视为复用:句子至少八个token,且超过一半token落在更早章节已出现的8-gram里。
- Argument:Argument graph看Introduction中的关键主张有多少是浅的——前面没有铺垫。Citation isolation看引言与Related Work的引用句中,有多少引用没有被归组、比较或关联到其他工作。这两项里Argument graph在Table 3标为需要模型。
- Artifacts:Figure exposition看方法图里的内容类型中,有多少不是展示方法所需要的(实验细节或结果主张会干扰步骤与连接)。Evidence gap只在正文有结果表的论文上检查全文与附录是否给出具体输入、输出或案例。Figure exposition在Table 3标为需要模型。
- 分数:对论文p、项目j,分析单位为Uj(p),hj(u)表示单位u是否满足Table 1的计数标准。项目分数是这些单位上的比例,sj(p)=1/(|Uj(p)|)∑u∈ Uj(p) hj(u)。作者报告的是归一化比率,以抵消篇幅和单位数量差异。检测时用六项(或三个平面)的均值;PairAcc把分数方向事先固定,平局记半分。
SciSlopBench怎么建
- 配对:每个实例是一篇AI论文加一篇人类论文,按论文类型与主题匹配。人类对照须为人类撰写、早于2024、顶会主会、相同贡献类型,并匹配研究问题;标签反映论文是如何产生的,而不是事后的质量标注。
- 来源与规模:AI论文来自FARS与Agents4Science 2025。FARS从研究想法出发,自己跑实验并写成稿;对每篇FARS论文,在被引论文里按上述筛选找最近的主题匹配,得到143对。Agents4Science再加入247对,其中有PDF的被转换成可测量形式。合计390对,领域覆盖计算机与数据科学、生命与健康、社会科学、自然科学及其他。来源构成、接收数和主题分布在Appendix B。
- 文档视图:展开全部input,把附录、致谢或参考文献之前的正文当作paper body,配对双方用同一规则。结构视图保留章节、标签、引用和浮动体,供六项指标使用;散文视图去掉浮动体与图注,并把数学、引用换成哨兵token,供文本检测器使用。人类论文从LaTeX e-print直接建视图。247篇Agents4Science中18篇有源码,其余229篇从PDF重建同样的LaTeX结构。
- 指标:主指标是PairAcc与AUROC。另报5% FPR下的TPR,即阈值放过5%人类论文时被标出的AI论文比例。第5.2节的ICLR分析把各系统分数用FARS对上的logistic拟合转成AI概率(Appendix E)。
SciSlopHarness
- 任务:给定原稿M0及其代码产生的结果文件,最多修订三轮。按harness-level optimization,修订模型固定,只改它周围的信息和检查。第r轮,修订模型收到Mr−1、固定的SciSlop.md(各类slop应如何改)和SLOP_FINDINGS.md(检测到的问题及位置),编辑LaTeX得到草稿Mfr。
- 复核:评审模型把每个改动段落与Mr−1、M0、实验输出和代码对照,检查受影响的主张、数字、引用和例子。与报告结果、已有证据和被引工作一致才留在Mr,否则回退到Mr−1。结果与实验输出冲突则回退;新例子仅当记录里已有同一例子才保留;删引用或添加不必要参考文献也回退。没有问题可改,或复核不再产生变化,就停止。交稿前再检查报告数字与被引工作是否保留、引用是否有效。
- 设计选择:发现用来指引修订,不要求每一项分数都下降。模型可以在建议的连接对该论文不必要时保持原样,例如只有另一节确实使用该对象时才加交叉引用。因此提供发现和修订指引,但不给目标分数,也不把人类论文的均值当作修订目标。
修订基线与检测实现
- 检测:文本检测器读散文视图,其他方法读论文源码,需要时提供代码。Binoculars用Falcon-7B的base与instruct,超出2048 token则无重叠开窗后平均。DetectGPT用t5-3b生成100个扰动。AI Scientist reviewer用Qwen2.5-32B-Instruct,CycleReviewer用其发布的8B checkpoint。AI Use Statement写明指标使用Qwen2.5模型。
- 修订协议:四种基线共用编辑模型与轮次协议。Base prompting、Claude Code、reviewer-based refinement只收到一般性改进指令,合称general revision。Slop-aware revision收到显式的slop定义和检测位置,编辑器与工具配置与reviewer-based refinement相同。比较时对聚合项目分数取负,使更高值偏向人类作者身份。差距缩减的距离定义在Appendix C.5,基线细节在Appendix D。
论文做了哪些实验?
配对区分PairAcc达0.859,与ICLR评分同向,Harness把剩余差距缩小63%。
实验设置
- 被测对象:检测侧为Binoculars(Falcon-7B base与instruct)、DetectGPT(t5-3b,100个扰动)、NTS、Pangram(Figure 4),以及全文评审CycleReviewer(发布版8B)和AI Scientist reviewer(Qwen2.5-32B-Instruct)。修订侧编辑与评审为Claude模型;指标侧使用Qwen2.5。论文未在正文列出Claude的具体型号。
- 数据:SciSlopBench为390对(FARS 143对,Agents4Science 2025为247对)。修订在该基准的每一篇AI论文上跑满三轮。ICLR分析覆盖2017至2025共九年的接收与拒稿,以及ICLR 2026的四个评审维度(Figure 4)。
- 基线:检测基线见上。修订基线为Base prompting、Claude Code、reviewer-based refinement和Slop-aware revision,与SciSlopHarness共用编辑模型和轮次协议。
- 指标:PairAcc(人类论文分数低于配对AI论文的比例,方向事先固定,平局半分)、AUROC、5% FPR下的TPR。修订看各项slop与匹配人类均值的差,以及六项加总后剩余AI–human gap。Figure 4用经年份调整的calibrated AI probability、各维度的|ρ|(p<0.05为显著),以及rejection AUROC(0.5为机会水平)。
- 评审方式:Argument graph与Figure exposition需要模型(Table 3的dagger)。ICLR分数由FARS对上的logistic拟合校准(Appendix E)。论文未报告PairAcc的重复次数或置信区间。
- 修订判定:复核对照原稿、实验输出和代码;交稿前检查数字与引用是否保留。Guard breaks在Figure 6中按轮次比例报告。
主结果
Table 2为整篇区分,Table 3为分项。TPR均为5% FPR。
表格较宽,可左右滑动
方法 PairAcc AUROC TPR 出处 Binoculars 0.687 0.683 0.238 Table 2 DetectGPT 0.638 0.623 0.146 Table 2 NTS 0.626 0.607 0.123 Table 2 CycleReviewer 0.685 0.689 0.054 Table 2 AI Scientist 0.615 0.613 0.146 Table 2 SciSlop(六项/平面均值) 0.859 0.854 0.272 Table 2–3 Cross-section refs.(单项最高) 0.905 0.895 0.648 Table 3 Argument graph(单项最低) 0.586 0.584 0.159 Table 3 - 作者称科学slop比所列检测器和读完全文的自动审稿更准:两边最好成绩为0.687与0.685,SciSlop为0.859,把错误削减一半以上。贡献列表另写相对Binoculars减少55%的检测错误;摘要写85.9%对68.7%。
- 作者称Cross-section references不需模型即达0.905,在5% FPR下标出65%的AI论文,Binoculars为24%(与Table 3的0.648、Table 2的0.238对应)。Evidence gap的TPR为0.000(Table 3)。其余单项PairAcc:Macro redundancy 0.723、Citation isolation 0.793、Figure exposition 0.809、Evidence gap 0.764。
- 作者称把这些模式定义成具体缺陷后,检测可以接到可修订的目标上。
与人类评审和接收决定
- 测了什么:Figure 4把各系统的AI概率对着ICLR评审分、四个评审维度和逐年接收决定。作者称面板(a)对年份差异做了调整;(b)画的是|ρ|,蓝/红为p<0.05的负/正相关,灰为不显著;(c)是rejection AUROC。
- 结果:引言写AI-likeness随评审分从2升到9而从26%降到12%。正文称只有scientific slop在overall、soundness、presentation、contribution四个维度上都把更低评分的论文打得更高,且四维都有统计支持。Figure 4(b)给出SciSlop一行的|ρ|为0.13、0.11、0.12、0.08;Binoculars为0.05、0.03、0.10、0.07,Pangram为0.15、0.01、0.05、0.10,其余检测器与审稿模型的格子更小。面板(c)纵轴约从0.4到0.8,机会水平标为0.50。
- 作者的解读:作者认为这些发现suggest,被定义为scientific slop的弱点已经反映在更低的人类评价里,并且该关系延伸到评审量表逐年变化下的接收决定。作者称SciSlop在全部九年都高于机会,而检测器在大多数比较中低于机会。
修订是否去掉slop而不只是分数
- 测了什么:在SciSlopBench每篇AI论文上,把Harness与四种修订基线各跑三轮,不把人类均值当目标。Figure 5的纵轴是slop减人类均值,0为与人类均值重合,0以下刻度被压缩;round 0是原稿。
- 结果:作者称Harness在全部六项上最终最接近人类均值。对Macro redundancy、Cross-section references、Citation isolation,general revision留下大量slop,slop-aware修订把分数推过人类均值并越走越远,作者认为这suggest过度修正。Evidence gap、Argument graph、Figure exposition上基线几乎没有进展,Harness仍有收获。六项加总后,相对最近的基线Claude Code,剩余差距小63%(Appendix C.5)。
- 个案与消融:Table 4用同一处Macro redundancy和Cross-section references对比。作者称slop-aware把重复句连同四处引用一起删掉从而得到零分;Harness只去重复、保留四处引用。交叉引用上,slop-aware在结论里散加三节、三表、两图的引用;Harness只在阈值表支持稳健性主张处加一处引用。Appendix F的Table 14给出其余模式的原稿/slop-aware/Harness分数:0.615/0.385/0.571、1.000/0.000/0.500、0.333/0.167/0.000、0.500/0.500/0.167,并称基线不改图像所以图分数保持原稿。Figure 6:原稿到人类的距离0.31;只有定义加定位时距离0.11,但23%的轮次出现guard breaks;只有复核时距离0.30、17% guard breaks;定义加复核为0.25与10%;完整Harness为0.17且0% guard breaks。
其他消融与分析
- Figure 2示意配对后AI论文六项均值0.62、人类论文0.30,作者用这一对说明AI侧更高;论文未说明该对是否为全基准均值。
- Evidence gap的TPR为0.000(Table 3),即在5% FPR下没有标出AI论文;作者未在正文单独解释这一格。
- Argument graph的PairAcc为0.586,是六项中最低(Table 3)。
- 摘要写直接按指标优化并不简单:标准修订留下残余slop,直接的slop-aware提示触发reward hacking。
- 修订最多三轮,无可改问题或复核不再改动即停;论文未在正文报告平均实际轮数或查询次数。
- AI Use Statement称报告结果来自运行已发布代码;Claude与ChatGPT被用于实现和改稿,作者复核了代码与终稿。
有什么可以进一步探索的点?
作者称六项只是初步视角,评测集中在FARS、Agents4Science且多为计算机科学。
作者指出的局限与后续方向
- 六项只是初步视角:Discussion写道,六项scientific slop提供的是论文内部连接如何暴露缺陷并引导修复的初步看法(initial view)。后续可以把这一视角扩展到一项研究的问题、方法与证据如何从整体上支持其结论(Limitations and future directions)。
- 生成器与学科:评测集中在FARS和Agents4Science 2025,多数论文来自计算机科学。作者称把配对评测扩展到新的生成器和学科,可以检验这一视角适用得多广(Limitations and future directions)。
- 分数下降不等于不当修复:Ethics Statement称,修正推理失败即使削弱了AI作者身份信号仍然有价值;负责任修复的标准是研究记录是否支持该改动。这不是实验局限,而是作者对修复标准的说明。
- 不推断作者意图:Ethics Statement称这些发现针对论文的推理,并不确立作者意图或不当行为。
- 伦理声明中的做法:ICLR分析使用公开稿件与评审信息,只报告测量slop与评审结果的汇总关系;基准的数据来源与处理过程被记录下来以供检查其构建。作者未把这些写成未完成的工作。
实验覆盖范围
- 配对规模:SciSlopBench为390对,FARS 143对、Agents4Science 2025为247对;领域写成计算机与数据科学、生命与健康、社会科学、自然科学及其他,细表在Appendix B。人类对照经人类撰写、早于2024、顶会主会、相同贡献类型与研究问题筛选。
- 检测与修订模型:散文检测用Binoculars(Falcon-7B,超2048 token则开窗平均)、DetectGPT(t5-3b,100个扰动)、NTS;全文评审为CycleReviewer 8B与AI Scientist的Qwen2.5-32B-Instruct;Figure 4另有Pangram。修订编辑与评审为Claude。Argument graph与Figure exposition需要模型。247篇Agents4Science里229篇由PDF重建LaTeX结构。
- 评审对齐:ICLR分析覆盖2017–2025每年的拒稿与接收,以及overall、soundness、presentation、contribution;AI概率由FARS对上的logistic拟合得到。作者报告四维相关在p<0.05下有统计支持。
- 修订协议:每一篇AI论文修订至多三轮;general revision三条基线只收一般改进指令,slop-aware收到定义与位置,Harness额外做记录复核。差距按六项加总、相对Claude Code计算(Appendix C.5)。Figure 6给出去掉定义、定位或复核后的距离与guard-break比例。
- 论文未报告的实现细节:正文未报告PairAcc的重复次数、Claude的具体型号、Harness的平均查询次数或耗时,也未报告Evidence gap的TPR为0时的作者解释。修订不使用人类论文作为目标分数。
总结一下论文的主要内容
六项推理断裂能以0.859的PairAcc标出AI论文,记录接地的修订缩小剩余差距63%。
SciSlopBench用整篇论文上的科学推理断裂来区分AI生成论文与配对的人类论文,SciSlopHarness则只在实验记录支持时才改这些断裂。
- 问题:作者认为token概率和局部检测读不到一种论文级失败:章节、主张、引用、证据和图表各自都像那么回事,把它们连起来的推理却断了。转述可以抹掉表层信号,但不能在不改科学内容的前提下补上这些关系。
- 测量:六项分属Structure(交叉引用、宏冗余)、Argument(论证图、引用孤立)和Artifacts(图示过窄、证据缺口)。每项是满足计数规则的单位占比。390对来自FARS(143)和Agents4Science 2025(247),人类侧按问题与贡献类型匹配,且为顶会主会接收。PairAcc看系统是否把人类论文排在配对AI论文之上。
- 检测结果:六项均值PairAcc 0.859、AUROC 0.854、5% FPR下TPR 0.272(Table 2)。Binoculars为0.687,全文评审最高为CycleReviewer的0.685。单项里Cross-section references达0.905,Argument graph为0.586(Table 3)。作者称相对Binoculars,检测错误减少55%(贡献列表)或一半以上(第5.2节)。
- 与评审的关系:作者称AI-likeness从评审分2时的26%降到9时的12%。只有该指标在ICLR 2026的四项维度上都与更低评分同向,且报告了p<0.05。2017–2025每年,它区分拒稿与接收都高于机会,检测器则在大多数年份低于机会(Figure 4)。作者认为这些弱点已经体现在人类评价里。
- 修订:直接优化分数会过冲。Slop-aware修订能把分数压过人类均值,但Table 4显示它会删掉引用或堆上不承接主张的交叉引用。Harness最多三轮,改动须与原稿、实验输出和代码一致,否则回退。作者称它在六项上都最接近人类均值,且从未收到这些均值;相对Claude Code,剩余AI–human差距小63%。去掉定位、指引或复核都会留下更多距离或guard breaks(Figure 6:完整设置为0.17与0%)。
- 作者的结论:AI生成论文在科学推理如何跨全文连接上留下可测量痕迹;把修订接地到科学记录,而不是只润色文句,这些痕迹才能用来指导修复。作者把六项看作初步分类,并认为后续应考察问题、方法与证据如何共同支持结论,以及在新生成器和其他学科上配对评测是否仍然成立。