跳到正文
原文
论文追踪· arXiv:2608.08975· Ming Li, Chenguang Wang, Xirui Li, Xinyue Zeng, Dianqi Li, Peng Shi, Dawei Zhou, Tianyi Zhou·本站收录 · 原文发表

研究揭示修辞如何对 AI 审稿人实施奖励作弊

How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review

论文速读

风险行为

据论文 PDF 整理(AI 生成),以原文为准

作者用六维双向改写测AI评审,称证据与新颖性反差最大,严格协议平均OA降1.36分。

问题
AI同时改稿和评审时,修辞可能在科学内容保留的情况下改变分数。作者要找出哪些维度和方向会构成这种奖励投机,以及效应如何随评审条件变化。
方法
从120篇匿名ICLR 2026投稿出发,两个LLM沿六个修辞维度做正反全文改写,五个LLM评审在标准与严格协议下配对打分,并测试联合、递归和评审引导改写。
实验与结果
证据框架与新颖性立场的正负反差最大,范围框架次之。联合改写是否升分取决于改写模型;评审引导平均不优于无引导的第二轮。严格协议降低绝对OA,作者称并不稳定改变修辞敏感度。
局限与可以继续做的
语料限于可恢复源码并有公开评审元数据的ICLR 2026投稿。六个维度不正交;多数配置每稿一次评审。作者称结果刻画所测模型与提示词,而不是人类评审或重复采样的全部变异。
实验设置Gemini 3.5 Flash-Lite、Qwen 3.5 Flash 等 · ICLR 2026 submissions · OA、weak-accept probability 等
被测模型
Gemini 3.5 Flash-LiteQwen 3.5 FlashGPT-5 miniGPT-5.5Claude Sonnet 5
基准
ICLR 2026 submissions
指标
OAweak-accept probabilitysoundnesspresentationcontribution
AI 导读研究者构建了由 120 篇匿名 ICLR 2026 投稿衍生的 4200 篇完整论文语料,考察在科学内容不变的前提下,修辞选择如何影响 AI 审稿判断。两个 LLM 改写器沿六个修辞维度做正反两个方向的改写,五个 LLM 审稿人在标准与严格协议下评估改写后的稿件,并测试联合改写、递归改写和审稿人引导改写。结果显示修辞敏感性是有结构的:证据呈现方式和新颖性立场在总体评价上产生最大的正负差异,范围框定构成较弱的第二梯队,其余维度影响更小或更不稳定。这一层级在人工评估的质量档次间保持一致,但分数变动强烈依赖 AI 审稿人的原始分数,低分倾向上升、高分倾向下降,方向性差异在中间区间最明显。更复杂的工作流并未稳定带来更大收益:联合改写高度依赖改写器,审稿人引导并不稳定优于无引导的第二轮改写,重复改写收益递减且依赖配置。

研究者构建了由 120 篇匿名 ICLR 2026 投稿衍生的 4200 篇完整论文语料,考察在科学内容不变的前提下,修辞选择如何影响 AI 审稿判断。两个 LLM 改写器沿六个修辞维度做正反两个方向的改写,五个 LLM 审稿人在标准与严格协议下评估改写后的稿件,并测试联合改写、递归改写和审稿人引导改写。结果显示修辞敏感性是有结构的:证据呈现方式和新颖性立场在总体评价上产生最大的正负差异,范围框定构成较弱的第二梯队,其余维度影响更小或更不稳定。这一层级在人工评估的质量档次间保持一致,但分数变动强烈依赖 AI 审稿人的原始分数,低分倾向上升、高分倾向下降,方向性差异在中间区间最明显。更复杂的工作流并未稳定带来更大收益:联合改写高度依赖改写器,审稿人引导并不稳定优于无引导的第二轮改写,重复改写收益递减且依赖配置。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    作者要辨认内容保留时哪些修辞会改变AI评审,以及效应如何随条件变化。

    在报告的科学内容被保留时,哪些修辞选择会改变 AI 评审分数,效应又如何随评审条件变化。

    • 场景:作者认为 LLM 同时改写稿件并担任评审时,修辞呈现可能在科学没有相应改进的情况下改变判断,形成一种潜在的奖励投机(reward hacking)。同一工作可以写得更自信或更谨慎,证据可以被强调或弱化。作者引用会议评审指南,认为评审应区分呈现与科学价值,但清晰度本身也可以是正当标准;问题是内容保留的修辞是否系统改变与价值相关的判断。
    • 现有缺口:作者称自然论文无法分离修辞与质量,因为更强的论文往往呈现也更精致。已有工作显示只改呈现可以提高 AI 评审分数,但尚未说清哪些修辞维度驱动变化、方向效应在评审者之间是否稳定。
    • 所测条件:改写覆盖全文叙事,包括图注、过渡和已报告结果的呈现,不要求句级语义等价;软约束保留方法、实验设置、报告数值与比较、证据边界和实质发现。评审模型只看编译后的 PDF,不知改写条件或改写模型。
    • 本文做法:从 120 篇匿名 ICLR 2026 投稿得到 4,080 篇改写,全文稿件共 4,200 篇。六个预设维度各做正、负方向,由两个改写模型生成,五个 LLM 评审在标准与严格协议下配对评分,并另测联合、递归和评审引导改写。作者称并不倡导或反对 AI 用于撰稿或评审。
  2. 有哪些相关研究?

    作者把本文定位为六维双向对照,而不是只追求抬分的改写。

    作者在 Section 2 与附录 A 按 LLM 评审、AI 科学评审和稿件侧改写分组,并据此定位本文。

    LLM 评审

    • 对齐与呈现偏差:论文转述 G-Eval(Liu 等,2023)、MT-Bench(Zheng 等,2023)和 Prometheus(Kim 等,2024)用 rubric 或成对比较对齐人类偏好。后续工作记录位置与长度(Wang 等,2024;Dubois 等,2024)、提示词、重复采样与自评偏好(Stureborg 等,2024;Panickssery 等,2024),以及认识标记在正确性不变时降低评价(Lee 等,2025)。
    • 元评估:Bavaresco 等(2025)认为对齐取决于评审者、任务、属性与数据来源。Bhat 与 Varma(2026)考察语义等价的评审指令改写。Yang 等(2026a)学习能抬高特定评审者分数的保义风格编辑。

    AI 辅助科学评审

    • 反馈与弱点:PeerRead(Kang 等,2018)、ReviewRobot(Wang 等,2020)和 ReviewAdvisor(Yuan 等,2022)把接收预测、分项分数或初稿反馈做成计算任务。Liang 等(2024)报告 GPT-4 反馈与人类意见的重叠可与人–人重叠相当。论文转述 Zhou 等(2024)与 Li 等(2025a):LLM 较弱于长文处理、识别实质弱点和区分论文质量。
    • 指南与部署:PeerCheck(Chen 等,2026)记录人类与 LLM 评审的差异。Li 等(2026a)发现官方会议指南比僵硬的模仿式 rubric 更接近人类分数;作者称这与本文的标准/严格协议不是同一比较。Thakkar 等(2026)报告向人类评审者展示 AI 反馈可提高具体性与可操作性。

    稿件侧呈现与改写

    • 非普通干预:Hyland(1998,2018)与 James 等(2024)讨论立场、元话语和语言确定性。隐藏指令(Ye 等,2024;Collu 等,2026)和字符、词、句级扰动(Lin 等,2025)可改变 AI 评审;作者称这些不是普通学术改写。Du(2025)显示标题风格变体可改变同一摘要的 AI 分数。
    • 以抬分为目标的改写:Kaneko(2026)在摘要层搜索保义改写;Li 等(2026b)反复优化转述、改写与夸大主张。Baumann 等(2026)用 paper laundering 描述不增加实验、旨在抬高 AI 分数的自动改写;Yang 等(2026b)的 adversarial repackaging 在保留方法、实验、图、公式、证明和数值的前提下搜索有利呈现。Dycke 与 Gurevych(2026)破坏结果、解释与主张的关系以测试缺陷检测;作者称该问题与本文不同。

    对照与定位

    • 基线:对照是同一论文、同一评审模型、同一协议下的匿名原稿,语料为 120 篇 ICLR 2026 投稿。联合改写还与六维正向单维改写的论文内均值比较;作者称这是描述性跨批次对照,不是协同效应估计。
    • 定位:作者称既有改写研究多寻找能提高分数的修订,并强调有利候选或汇总增益;本文对六个预设维度做正反双向干预,保留包括降分在内的全部结果。
  3. 论文如何解决这个问题?

    两个改写模型沿六维双向改写全文,五个评审模型在两种协议下配对打分。

    作者用受控修辞改写分析框架把呈现与科学内容分开:同一匿名 LaTeX 项目生成正反变体,多个 LLM 评审在盲态下打分,再用配对差衡量维度效应。框架覆盖单维、联合、递归和评审引导改写。

    语料与匿名基线

    • 抽样:经 OpenReview API 取 ICLR 2026 投稿,保留有有效评估与评审意见者,排除撤稿与 desk-reject。按人类总体评分均值六个区间各抽 20 篇:[1, 3)、[3, 4)、[4, 5)、[5, 6)、[6, 7)、[7, 8.5],共 120 篇。
    • 源码匹配:用稿件元数据匹配公开 arXiv LaTeX。多版本时,以归一化源文与 OpenReview PDF 的 token 余弦相似度和 5-gram Jaccard 相似度保留对应最强的版本。
    • 匿名化:agentic 流程删除作者姓名、单位、致谢、投稿状态陈述和带身份的资源链接。源差异检查把编辑限制在身份与状态相关区域,再人工核对源码与编译 PDF。该项目是所有变体的共同基线,各变体独立生成。

    六个修辞维度

    Table 2 定义六个预设维度。正、负只标干预方向,用来把方向敏感性与改写本身造成的分数移动分开。两个方向都从同一基线独立生成,并叠加同一套项目级保留约束。附录 G 给出完整改写提示词。

    • 新颖性立场:正向更坚定地表述已有支持的主张与新颖性;负向更谨慎。
    • 范围框架:正向在已支持边界内写得更广;负向更绑定已评估设置。
    • 证据框架:正向更强调已报告的比较与模式;负向少强调比较优势。
    • 其余三维:贡献凸显改变贡献是否前置标出;技术语域在更正式与更平白之间变化;语言复杂度在更复杂与更简单的词汇句法之间变化。

    维度来自主要 AI 会议评审指南及相关文献。作者称它们是评审相关、彼此区分的呈现方式。

    源码级改写

    • 执行者:GPT-5.5 经 Codex CLI,Opus 4.8 经 Claude Code。代理检查完整 LaTeX 项目并改写全文叙事,可改措辞、组织、强调、图注、表格,以及已报告结果的呈现与解释,也可改部分数值和数学表达式的呈现。
    • 保留与检查:软约束保留方法、实验设置、报告数值与比较、证据边界、实质发现和科学含义,不要求句级语义等价。程序对照基线检查引用与交叉引用键、标签、URL、图路径、受支持的数学环境、代码与算法环境、参考文献文件。违规退回修复;未解决的违规或编译失败则丢弃。
    • 单维规模:每篇、每个改写模型生成 6 维 × 2 方向,共 2,880 篇。单维改写不叠加。

    联合、递归与评审引导

    • 联合改写:一条提示词同时施加六个正向目标,在段落层协调改写,而不是六次顺序编辑。两个模型各对每篇做一次,共 240 篇。
    • 递归:同一联合提示词连做三轮,后一轮改写前一轮输出。Table 1 将额外两轮计为 480 篇。
    • 评审引导:先得到 Intermediate,由改写骨干模型按标准协议评审编译 PDF;校验结构化评审后,把评审 JSON 与六维提示词交给同一改写模型再改一次,得到 Final。作者要求保留优点、用稿件修订回应弱点与问题,并收敛评审认为过度的修辞维度。Intermediate 与 Final 合计 480 篇。

    评审协议与配对估计

    • 评审者:Gemini 3.5 FL、Qwen 3.5 F、GPT-5 mini、GPT-5.5、Sonnet 5。不知改写条件与改写模型。PDF 经 OpenRouter 默认处理提交;温度等采样参数不覆盖,用服务端默认(附录 B.1)。
    • 两种提示词:标准提示词遵循常规会议 rubric。严格提示词额外要求高分须有具体证据,并指示不要因呈现给分,除非呈现改变科学评估。两者都要求结构化评审和与 ICLR 指南对齐的数值分。
    • 指标:主结果是总体评分(OA)。次级为 soundness、presentation、contribution;confidence 为辅助诊断。弱接收概率是 OA 不低于 6 的评价占比。作者说明 6 分在 rubric 中表示可接收,且高于 ICLR 2026 录用稿评审均分 5.39;该阈值表示落在弱接收一侧,而不是预测实际录用。
    • 配对:改写与同一论文、同一评审模型、同一协议的匿名原稿比较。正负对比额外固定维度与改写模型。汇总时先在论文内平均,再对六个人类分数层等权。报告有符号均值、绝对移动,以及层内 5,000 次论文级 bootstrap 的 95% 分位区间。缺失不填补。作者不用多重检验阈值给效应分类,而按幅度、方向和跨模型、跨协议的一致性解释。
  4. 论文做了哪些实验?

    作者称证据与新颖性反差最大;严格协议平均OA降1.36分,但不稳定改变修辞效应。

    实验设置

    • 模型:评审者为 Gemini 3.5 Flash-Lite、Qwen 3.5 Flash、GPT-5 mini、GPT-5.5、Claude Sonnet 5。改写者为 GPT-5.5(Codex CLI)与 Opus 4.8(Claude Code)。GPT-5.5 同时改写;评审引导时,改写骨干模型也按标准协议评 Intermediate。
    • 语料与流程:120 篇 ICLR 2026 投稿,六个人类 OA 区间各 20 篇。单维改写 2,880,联合 240,递归额外 480,评审引导的 Intermediate 与 Final 合计 480。全文语料 4,200 篇。
    • 协议与缺失:标准与严格两种主提示词,评审者不见改写标签。计划评审 42,480 条,有效结构化记录 42,396 条,84 条缺失且不填补(附录 B.2)。
    • 指标与重复:配对 OA 变化;弱接收概率的百分点变化;次级 soundness、presentation、contribution。主协议每个评价单元一次评审。汇总按六个人类分数层等权,并做 5,000 次论文级 bootstrap。

    主结果

    严格协议、Opus 4.8 改写器下,相对同协议原稿的平均 OA 变化(Table 3):

    表格较宽,可左右滑动

    评审模型新颖性+新颖性−证据+证据−
    Gemini 3.5 FL+.567-.733+.933-.617
    Qwen 3.5 F+.092-.350+.525-.292
    GPT-5 mini+.467-.617+.775-.317
    GPT-5.5+.133-.100+.483-.075
    Sonnet 5+.017-.534+.084-.496
    • 汇总层级:Table 3 的 Overall mean(跨评审者、两种改写器与两种协议)为:证据 +.289/−.303,新颖性 +.187/−.353,范围 +.136/−.289,技术语域 +.142/+.034,贡献 +.192/+.049,词汇 +.017/+.006。作者称证据框架与新颖性立场反差最大,范围框架是较弱的第二层;新颖性与范围主要来自负向惩罚,证据框架则双向移动分数。Finding 1 把正向证据升幅写成 up to 0.93、负向新颖性降幅写成 up to 0.73,对应上表 Gemini 3.5 FL 两格。
    • 例外:正向并不总是相对原稿升分。标准协议、GPT-5.5 改写器、Sonnet 5 上,正向新颖性为 -.150,正向证据为 -.311(Table 3)。作者称评审者多偏好同一方向,但对相对原稿升还是降并不一致;Sonnet 5 把效应整体下移(Section 6.1)。
    • 弱接收:作者报告证据框架的正负反差为 13.0 个百分点,新颖性 12.0,范围 9.0;新颖性在标准协议下略强,证据在严格协议下略强(Section 4.1,Appendix Table 16)。

    起始分数与人类质量分层

    • 人类质量:作者称维度层级在有足够样本的人类 OA 区间上保持,但人类评分并不构成稳定的敏感度梯度;更强的论文并非一致更抗改写(Section 4.2,Table 4)。Table 4 的 [8,10] 标†,少于 5 篇。严格协议对应表为 Appendix Table 20。
    • AI 起始分:作者报告,标准协议下把两种改写器与全部评审者在论文内合并后,正向证据在原稿 OA 属于 [1, 3] 时平均 +1.050,属于 [8, 10] 时为 −0.187(Appendix Table 25)。正文写 +1.05 与 −0.19。低分倾向上升、高分倾向下降;作者认为这可能部分反映量程边界和向均值回归,并可能在两端压过预定方向,且随评审者变化(Section 4.3)。
    • 论文级一致性:两种改写器、两种协议和五个评审者在论文内平均后,新颖性、证据、范围的预定顺序分别出现在 117、116、113 篇上;词汇复杂度为 62 胜、7 平、51 负(Table 15,各 120 篇)。

    多阶段改写

    • 联合改写:Table 6 中,Opus 4.8 的评审者平均 OA 变化在标准协议为 +.289、严格协议为 +.463;GPT-5.5 为 +.021 与 +.045。作者称后者接近零来自评审者反应不一致,不是改写无效。相对六维正向单维改写的论文内均值,Opus 4.8 高 +.160,GPT-5.5 低 −.074;作者称这是描述性跨批次比较。Table 7 的 Overall mean:联合改写的 OA 变化从 AI 原稿分 [1, 3] 的 +1.42 到 [8, 10] 的 −0.88。
    • 评审引导:相对单次联合改写,Opus 4.8 的平均增益从标准 +.289 到 +.396、从严格 +.463 到 +.557;GPT-5.5 从 +.021 到 +.015、从 +.045 到 +.032。四个改写器–协议平均上,引导减无引导第二轮均为负:GPT-5.5 为 −.035 与 −.042,Opus 4.8 为 −.008 与 −.067(Table 6)。作者称第一轮独立生成,该对比不是反馈的因果估计。
    • 递归:Appendix Table 33 在论文内平均五个评审者后,第三轮相对原稿的 OA 变化为:GPT-5.5 标准 +0.076、严格 +0.157;Opus 4.8 标准 +0.438、严格 +0.631。作者称 Opus 4.8 的改进大多在第二轮,第三轮增加很少。正文另写 GPT-5.5 到第三轮为标准 +0.080、严格 +0.153。Figure 3 图注将原稿归一到 0,R1–R3 为累计均值。

    协议、改写器与次级分数

    • 分工:作者称改写器主要改变正负变体的分离,评审者决定 OA 效应的幅度和符号(Section 6.1,Figure 4)。作者称 Qwen 3.5 F 与 GPT-5 mini 的反应分布最宽,GPT-5.5 移动更小,Opus 4.8 的正负分离通常宽于 GPT-5.5。Figure 4 图注写明细线为第 10 到第 90 百分位,粗线为四分位距,点为均值。
    • 严格协议:Table 8 Overall mean:改写稿 OA 从 6.296 到 4.934,∆P 为 −1.361,95.0% 的论文在严格协议下更低;绝对 OA 的跨协议 Spearman 为 .862。扣掉同协议原稿后,改写效应从标准 +.003 到严格 +.020,论文级改写效应的跨协议 Spearman 为 .081。作者称更严的提示词改变评分严厉程度,并不使评审对内容保留的修辞更不变。Finding 3 将平均降幅写作 1.36 分。
    • 次级分数:作者称 ∆OA 与 presentation 变化只弱相关,与 contribution、soundness 更相关(Table 9)。例如标准协议、GPT-5.5 改写器下,Qwen 3.5 F 的 contribution 与 ∆OA 的 Spearman 为 .747,presentation 为 .275。作者称这些是共同变动,不是因果中介,也不等于科学价值真的改变。

    其他消融与分析

    • 附录 F:GPT-5 mini 三次独立评审相对单次指定评审,12 个基线配对效应的 Pearson r = 0.995,Spearman ρ = 0.993,平均绝对差 0.040,最大差 0.098。
    • Table 39:评审者对哪些论文的改写反应最大一致程度弱;例如标准协议、GPT-5.5 改写器下,Gemini 3.5 FL 与 Qwen 3.5 F 的论文级 ∆OA Spearman 为 .066。
    • Table 11:匿名原稿上,标准协议五个 AI 评审的均分都高于人类 OA(4.782),差值从 0.418 到 2.934;严格协议下 GPT-5 mini、GPT-5.5、Sonnet 5 低于人类 OA,Qwen 3.5 F 为 +0.018,Gemini 3.5 FL 仍高 1.676。Spearman 从 0.395 到 0.621。
    • 附录 B.2:Sonnet 5 对一篇研究越狱方法的稿件有 26 个评审单元多次重试后仍无有效记录;另有 1 条 Qwen 严格协议联合改写被提供方内容检查拒绝。作者认为该模式与安全机制被触发一致,但记录不能确定每次失败原因。
    • Table 3 Overall mean 中,技术语域负向仍为 +.034,贡献负向为 +.049。作者称其余维度效应更小或更不稳定。
  5. 有什么可以进一步探索的点?

    作者指出语料限于 ICLR 2026、维度不正交,且结果不表征人类评审。

    作者指出的局限与后续方向

    • 会议与领域:基准限于能恢复全文源码并有公开评审元数据的 ICLR 2026 投稿,结果未必推广到其他会议或学科(Limitations)。
    • 缺失评审:全文改写与多模型评审计算代价高。部分计划评审没有产出有效结构化记录,缺失可能非随机,因为有些失败看起来与稿件主题触发模型安全措施有关(Limitations)。
    • 维度不正交:六个修辞维度并不正交。每次改写是受控的全文干预,效应不应被解释成单个语言特征的独立系数(Limitations)。
    • 重复采样与外推:多数配置每稿只有一次 AI 评审,重复评审只在辅助审计中检查。结果刻画的是所测模型与提示词,而不是人类评审,也不是重复采样的全部变异(Limitations)。
    • 评价建议:作者在 Conclusion 建议,AI 辅助评审应按多个模型与条件评估修辞稳健性,而不是只看总体一致性或平均评分行为。

    实验覆盖范围

    • 评审模型为 Gemini 3.5 FL、Qwen 3.5 F、GPT-5 mini、GPT-5.5、Sonnet 5;改写模型为 GPT-5.5 与 Opus 4.8;协议为标准与严格(Table 1,Section 3.4)。
    • 语料为 120 篇 ICLR 2026 投稿,六个人类均分区间各 20 篇;单维改写 2,880 篇,联合 240 篇,递归额外 480 篇,评审引导的 Intermediate 与 Final 合计 480 篇(Section 3.1–3.3)。
    • 主协议每个评价单元一次评审;附录 F 仅对 GPT-5 mini 用三次独立评审做稳定性审计。计划评审 42,480 条,有效 42,396 条,缺失不填补(Section 3.5,附录 B.2)。
    • 与人类 OA 的对照在 Table 11,对象是匿名原稿,每个评审者×协议 120 篇。论文未报告人类对改写稿的再评分。
    • 内容保留依靠提示词约束、结构锚点检查、编译与修复,未通过则丢弃。论文未报告最终保留下来的改写占尝试次数的比例,也未报告对科学内容保留做独立人工审核的样本量。
  6. 总结一下论文的主要内容

    作者称修辞影响选择性且依赖配置,证据与新颖性反差大,复杂流程不保证更大增益。

    作者分析内容保留的修辞变化如何改变 AI 科学评审,并把这种现象称为对 AI 评审者的潜在奖励投机。

    • 问题:同一科学内容可以用不同修辞呈现。作者要分辨哪些选择会改变分数、是否存在被偏好的方向,以及效应如何随改写器、评审者和协议变化。
    • 做法:在 120 篇匿名 ICLR 2026 投稿上,GPT-5.5 与 Opus 4.8 沿六个维度做正反全文改写;五个 LLM 评审在标准与严格协议下对原稿和改写稿配对打分。另有联合、三轮递归和评审引导。程序检查保护引用、标签、图路径、代码与参考文献等结构锚点。
    • 主结果:Table 3 的 Overall mean 上,证据框架为 +.289/−.303,新颖性为 +.187/−.353,范围次之。严格协议、Opus 4.8、Gemini 3.5 FL 的正向证据为 +.933,负向新颖性为 -.733。作者报告弱接收概率上,证据框架的正负反差为 13.0 个百分点。低起始 AI 分数倾向上升,高起始分数倾向下降。
    • 条件依赖:标准协议下,Opus 4.8 联合改写的评审者平均 OA 变化为 +.289,GPT-5.5 为 +.021(Table 6)。评审引导平均并不优于无引导的第二轮。严格协议把改写稿平均 OA 从 6.296 降到 4.934(Table 8);作者称这不使修辞效应稳定变弱或变强。
    • 作者结论:作者称修辞不是普遍的奖励投机,影响是选择性的、依赖配置的,有时还会使分数更低。作者认为,AI 同时参与改稿和评审时,上游修辞会变成下游价值分数里依赖评审者的信号;分数上升不应被当成科学价值提升。
阅读原文arxiv.org