研究者提出对抗性重新包装:不改科学内容仅调整表述即可拉高 AI 审稿分数
No Hidden Prompts Needed! You Can Game AI Peer Review with Presentation-Only Revisions
作者对三款前沿模型测试对抗重构,在固定实验证据下纯表述修改取得75.1%成功率与+1.21/10分提升。
黑盒设定,攻击者在 LaTeX 源码级别操作,不可接触审稿提示词与模型参数;仅允许修改摘要、引言、相关工作与讨论等表述层,严格固定实验数据、图表、公式及数值结果。
- 探究 AI 审稿系统在无隐藏文本、无提示注入且不改动任何科学实质内容的前提下,能否被纯表述层面的对抗重构所操纵,以检验其抗表述博弈的鲁棒性。
- 将论文划分为自由区、受限区和固定区,在固定实验证据与方法核心的前提下,提取 AI 审稿人结构化反馈信号,闭环迭代优化叙事重构与表面润色等表述策略。
- 在 3 种前沿模型上取得 75.1% 攻击成功率与 +1.21/10 的平均分提升;重构叙事效果优于表面润色;审稿人表现出更容易被强化优势打动而非被化解弱点说服的非对称性。
- 作者指出的局限包括:仅测试了 Claude 与 GPT 两大模型家族的 3 种配置;存在自然效果上限(以具体实验缺陷为弱点的论文分数在 5.0–5.5 趋于平缓)。实验覆盖范围为:覆盖机器学习等 11 个领域、500 余篇未发表 arXiv 预印本,且未测试模型家族外的其他体系。
- 被测模型
- Claude Sonnet 4Claude Sonnet 4.5GPT-5-mini
- 基准
- arXiv rolling benchmark (500+ papers)smallari/openreview-iclr-peer-reviews
- 指标
- ASRΔSΔstrengthΔseverityΔcontent
德州大学奥斯汀分校等机构研究者提出对抗性重新包装攻击,在不改动方法、实验、图表、公式与数值结果的前提下,仅修改摘要、贡献表述、相关工作与叙事结构,并利用 AI 审稿反馈闭环迭代搜索最优表述。在 Claude Sonnet 4、Claude Sonnet 4.5 和 GPT-5-mini 三个审稿模型上,攻击成功率达 75.1%,平均分数提升 +1.21/10。研究还发现 AI 审稿人对强化优点的回应稳定,而试图消解缺点的编辑有 31.6% 反而招致更严厉批评;改变审稿人理解方式的重构策略(如相关工作重新定位、分析性讨论扩写)明显优于局部润色、表格排版等表面编辑。团队同时发布了一个滚动更新的无污染基准与攻击框架,用于测试 AI 审稿在仅改表述时是否仍锚定科学内容。
推荐理由在科学内容完全不变的前提下,仅靠摘要、相关工作与叙事重排即可把 AI 审稿分数推高,论文给出了跨模型的成功率与策略排序,可迁移到其他 LLM 评审场景的鲁棒性测试。
深度解读
这篇论文试图解决什么问题?
探究 AI 审稿系统在科学实质不变时能否被合规的纯表述重构操纵。
论文试图探究 AI 审稿系统在不改变任何科学证据、仅修改表述方式的情况下,是否会被系统性操纵评分。
问题背景与重要性:作者指出,随着同行评审压力激增,大语言模型生成的审稿意见正从实验性工具转变为基础设施(例如 AAAI 2026 开展了试点,ICLR 2025 部署了反馈智能体)。理解其面临的操纵风险对于维护学术评价体系的公正性至关重要。
现有安全研究的不足:作者认为,现有对 AI 审稿鲁棒性的研究多聚焦于显式的提示注入或隐藏文本攻击;这类手段已被学术会议明令禁止且易被规则检测,属于可修补的表面漏洞,未能触及评审评估机制本身的结构性缺陷。
核心观察与假设:作者提出“抗纯表述博弈(resistance to presentation-only review gaming)”应作为 AI 审稿自动化的必要条件:当科学内容未改变时,AI 审稿人的打分不应仅仅因为表述方式的调整而系统性变好。
提出的方法与基准:论文提出了对抗重构(adversarial repackaging)框架,在固定实验数据与方法核心的前提下,利用审稿人反馈闭环搜索表述层修改策略;同时构建了一个无污染的滚动预印本基准数据集。
威胁模型:
- 攻击者目标:在保持论文科学实质内容完全固定的前提下,通过调整表述方式最大化 AI 审稿人的评分与正面评价。
- 攻击者知识:黑盒(black-box)设定,攻击者无法访问 AI 审稿系统的内部提示词(prompts)或模型参数。
- 攻击者能力:攻击者在 LaTeX 源码级别操作,可多次向 AI 审稿人发起黑盒查询;修改范围严格限制在表述层,不得改动数据、图表、公式、推导及数值结果。
- 受害系统:基于前沿多模态大语言模型、接收编译后 PDF 论文并根据官方评审指南生成结构化评审意见的 AI 审稿系统。
有哪些相关研究?
梳理了 AI 审稿评估、提示注入、文本扰动与论文洗稿等相关工作。
论文系统梳理了 AI 审稿评估、显式对抗攻击、文本扰动以及论文重写四个方向的相关研究。
AI 审稿系统与评估
- 探索利用 LLM 生成审稿意见的工作(如 Chang 等 2025 年的 TreeReview、Idahl 与 Ahmadi 2024 年的 OpenReviewer 等)。
- 评估 AI 审稿质量的研究(如 Shin 等 2025 年、Akella 等 2025 年、Li 等 2025 年等)指出,AI 审稿存在系统性分数膨胀、关注点趋同、与人类评审一致性低以及视角缺乏多样性等缺陷;作者指出这些研究仅刻画了审稿质量局限,未系统测试其能否被表述层修改操纵。
提示注入与隐藏文本攻击
- 针对 AI 审稿人的显式攻击(如 Ye 等 2024 年、Zhou 等 2025 年、Zhu 等 2025 年),通过在论文中嵌入肉眼不可见的指令操纵审稿输出;作者指出这类攻击容易违规被拒,揭示的是可修补的漏洞而非评估机制的内在缺陷。
表面级文本扰动
- Lin 等(2025 年)将传统 NLP 对抗攻击引入审稿场景,通过同义词替换等表面扰动提升分数;作者指出该工作采用的是非语义扰动,未深入分析评估机制失效的原因。
论文重写与洗稿
- Kaneko(2026 年)通过审稿分数反馈多轮优化摘要改写,但作者指出其仅修改摘要、仅使用标量分数反馈且单篇需要超过 2000 次 API 调用,成本极高。
- Baumann 等(2026 年)提出“论文洗稿(paper laundering)”,通过零样本全篇重写提升分数;作者指出其未区分科学内容与表述,且提升幅度较小。
基线方法与基准
- 对比基线包括:Zero-shot Paper Laundering(Baumann 等 2026 年)、PAA(Kaneko 2026 年)以及不含对抗选择机制的 Research Agent;评测基准为作者从 arXiv 构建的包含 500 余篇论文的滚动基准数据集。
作者将本文定位为:首个在严格固定科学证据的约束下,结合多轮闭环反馈与结构化策略搜索,系统揭示 AI 审稿机制内在结构性缺陷的研究。
论文如何解决这个问题?
基于三分区约束,通过信号驱动规划与成对门控实现闭环对抗迭代。
整体思路:采用对抗重构(adversarial repackaging)框架,在严格固定科学证据的约束下,以 AI 审稿人的多维度反馈为优化信号,通过多智能体协作闭环迭代搜索最佳表述策略。
论文分区与形式化定义
论文将源文件划分为三个编辑区域以约束攻击范围:
- 自由区(Free zone):包括摘要、引言、相关工作、讨论和结论,允许重写,但不得引入未获支持的新科学主张。
- 受限区(Limited zone):包括方法描述与结果分析,允许重新措辞或调整结构,但必须保留事实内容。
- 固定区(Fixed zone):包括实验数据、表格、图片、公式、推导和数值结果,绝对不可修改。
在满足内容保留约束集合 C(S) 的前提下,攻击目标形式化为:
maxS′ ∈ C(S) 𝒥(𝒴(D, T), 𝒴(D′, T))其中 𝒴(D, T) 表示在审稿模板 T 下由 N 篇独立审稿组成的聚合审稿结果,𝒥 测量修改前后在分数与内容维度的总体评价偏向程度。
闭环迭代攻击系统流程
攻击系统包含六个阶段的闭环回路:Profile → Plan → Edit & Compile → Review → Evaluate → Update。
- 特征提取(Profile):画像智能体分析 N 篇审稿文本与源码,提取审稿人反复提及的结构化信号,并标注频率与严重程度。
- 策略规划(Plan):主智能体将未解决信号映射至预设策略池,优先响应高严重度信号,保护已被认可的优势,避开此前产生反作用的方向。
- 编辑与编译(Edit & Compile):编辑智能体修改 LaTeX 源码并重新编译为 PDF,保持科学内容不变。
- 审稿与评估(Review & Evaluate):生成 N 篇新审稿,由成对裁判模型评估优势增量 Δstrength 与弱点缓解量 Δseverity。
- 版本更新(Update):维护历史最优版本 S∗,仅当候选版本通过方向门控并取得更高选择分时才更新。
预设策略池
系统包含 20 余种表述策略,划分为两大类别(附录 Table 3 给出完整列表):
- 叙事重构(Narrative restructuring):重塑审稿人对论文的理解,包括贡献列表强化、分析性讨论扩展、相关工作重新定位、摘要重构、预先定调等。
- 表面润色(Surface editing):提升排版与行文质量但不改变叙事结构,包括删除自贬措辞、局部润色、表格重构、插入算法框等。
评估协议与门控机制
候选版本必须通过方向门控筛选以进入选择流程,门控判定规则为:
Δstr > τs ∧ Δsev < τw ∧ Δstr − Δsev > τn参数设置为 τs = 1.0、τw = 1.0、τn = 0.8;通过门控后计算复合选择得分: SelectionScore = wr · r̄cand + wc · Δcontent,权重设定为 wr = 0.8、wc = 0.2。每次评估生成 N=3 篇独立审稿,迭代上限为 8 轮。
论文做了哪些实验?
全数据集上平均涨分 +1.21 且 ASR 达 75.1%,叙事重构明显优于表面修饰。
实验设置
- 被测模型:Claude Sonnet 4(claude-sonnet-4-20250514)、Claude Sonnet 4.5(claude-sonnet-4-5-20250929)、GPT-5-mini。
- 基准数据集:从 arXiv 抓取的 500 余篇未发表预印本,涵盖机器学习、计算机视觉、自然语言处理等 11 个领域,且均提供编译通过的 LaTeX 源码与 PDF。
- 基线方法:Zero-shot Paper Laundering(单轮全篇重写)、PAA(8 轮摘要迭代)、Research Agent(8 轮启发式全篇重写)。
- 指标定义:平均分位移(Δ S)、攻击成功率(ASR,定义为 Δ S ≥ +1 的论文比例)、优势变化量(Δstrength ∈ [−10, +10])、弱点严重度变化量(Δseverity ∈ [−10, +10],负值表示批评减轻)、净内容提升(Δcontent = Δstrength − Δseverity)。
- 评审与裁判方式:采用官方指南(默认 ICLR 2025,评分为 1–10 分制);每轮每篇由审稿模型生成 N=3 篇独立审稿。裁判模型使用独立的 Claude Sonnet 4.5 进行盲态成对打分。
- 样本量与重复次数:全数据集包含 500 余篇论文;基线消融评测在论文子集上展开;人类审计评估抽样 30 对版本。
主结果
下表呈现全数据集主测试结果以及在论文子集上的基线对比(据 Table 1):
表格较宽,可左右滑动
评审模型 方法 原始分 攻击后分 Δ S ASR Δstrength Δseverity Δcontent Sonnet 4 Ours 3.80 5.27 +1.47 87.0% +3.40 -2.81 +6.21 Sonnet 4.5 Ours 4.18 5.42 +1.24 79.8% +3.11 -2.75 +5.86 GPT-5-mini Ours 5.12 6.03 +0.91 58.4% +2.25 -1.98 +4.23 Sonnet 4 Zero-shot PL 3.88 4.21 +0.33 30.0% +0.72 -0.25 +0.97 Sonnet 4 PAA 3.88 4.34 +0.46 36.7% +0.71 -0.19 +0.90 Sonnet 4 Research Agent 3.88 4.78 +0.90 53.3% +1.85 -0.92 +2.77 Sonnet 4 Ours (子集) 3.88 5.41 +1.53 86.7% +3.29 -2.91 +6.20 Sonnet 4.5 Zero-shot PL 4.33 4.58 +0.25 28.3% +0.55 -0.18 +0.73 - 攻击有效性跨模型成立:作者称,全数据集上跨模型平均 Δ S = +1.21、ASR 达 75.1%,原本处于拒稿区间的论文在攻击后显著上升,部分跨过接收阈值;所有全数据集 Δ S 经 Wilcoxon 检验均达 p < 0.0001。
- 三维设计缺一不可:在子集对比中(Table 1 下半部分还包括 Sonnet 4.5 下 PAA 获 +0.27、Research Agent 获 +0.55、Ours 获 +1.02),本文方法各项指标均高于基线,证实了闭环迭代、全篇编辑与信号驱动选择的结合必要性。
优势与弱点的非对称性(Figure 2)
- 测了什么:使用成对裁判按轮次分别统计优势增量与弱点严重度变化。
- 结果:86.1% 的轮次中优势得到提升(均值 +2.19);而仅有 68.4% 的轮次弱点严重度下降,31.6% 的轮次弱点反而恶化(反作用率是优势的 2.6 倍)。在整体分数提高的轮次中,有 15.8% 伴随着弱点恶化。
- 作者解读:作者认为 AI 审稿人“更容易被打动而非被说服”,审稿人对优势信号的强化反应可预测,但对化解弱点的尝试反应难以控制;只要新引入的优势足够醒目,其综合判断就会被优势信号所“淹没(swamped)”。
策略有效性梯度(Table 2)
- 测了什么:统计各策略在首轮成功更新中的出现率(First-hit)及整体被采纳为最优版本的曝光采纳率(Accepted Exposure Rate)。
- 结果:贡献列表强化在首轮命中率最高(87.2%),但在后续轮次边际收益递减(曝光采纳率仅 36.8%);相关工作重定位(49.3%)与分析性讨论扩展(44.9%)的曝光采纳率最高。表面编辑策略表现较低:表格排版为 29.8%、局部润色为 27.8%、算法框插入为 26.5%。
- 作者解读:作者称重构叙事远优于表面润色,AI 审稿人系统性地对学术写作中的定位信号敏感,而非单纯偏好流畅语句。
迁移性与人类语义审计
- 跨模型与跨模板迁移:在不匹配模型设置下,平均 Δ S 为 +0.88,所有非对角项均为正(Table 8);在 ICLR 优化后的论文迁移至 NeurIPS 模板(1–6 分)获 Δ S = +0.60,迁移至 ICML 模板(1–6 分)获 Δ S = +0.53(Table 9)。
- 人类语义保留审计:3 位标注者对 30 对盲态样本评估,平均得分为 0.80/1.00,在阈值 0.8 下语义保留率为 66.7%(20/30);实验设置保留度最高(1.93/2),结论主张得分最低(0.97/2)(Table 11)。
其他消融与分析
- 测试-重测方差:三模型论文内标准差分别为 0.28(Sonnet 4)、0.10(Sonnet 4.5)、0.19(GPT-5-mini)(Table 5)。
- 分数校准检验:AI 审稿人在历史接收与拒稿论文上的打分存在差异(p < .005),与人类均分相关性为 r = .58–.61(Table 4)。
- 成对裁判内容校准:评分差距 ≥ 5 时裁判方向准确率达到 95.3%–96.9%(Table 6)。
- 输入顺序不变性:裁判模型在弱点维度一致性为 100%,优势维度一致性 ≥ 98%(Table 7)。
有什么可以进一步探索的点?
受算力限制仅覆盖两大家族三模型,且对实验硬伤论文存在提分上限。
作者指出的局限与后续方向
- 模型覆盖受算力约束:受算力预算限制,实验仅覆盖了 Claude 和 GPT 两个模型家族的 3 种配置;作者认为扩展到更多模型家族将有助于进一步验证这一结构性缺陷(出自 Limitations 节)。
- 存在自然效果上限:对于弱点根植于具体实验硬伤(如单一数据集、缺乏真实场景验证)的论文,表述优化虽然仍能提分,但提分会在 5.0–5.5 左右陷入停滞,无法完全掩盖实质性缺陷(出自 Limitations 节)。
- 表述干预测试机制的落地:作者建议在实际部署前对 AI 审稿系统进行纯表述扰动测试,并将科学合理性评估与写作质量评估解耦(出自 Section I.3 节)。
实验覆盖范围
- 被测审稿模型共 3 个:分别为 Claude Sonnet 4、Claude Sonnet 4.5 与 GPT-5-mini,未测试其他模型家族架构。
- 论文样本涵盖 11 个领域:基于 arXiv 筛选出的 500 余篇论文涵盖 Deep Learning、ML for Sciences 等 11 个研究领域,且页数在 12–35 页之间。
- 优化迭代上限为 8 轮:每轮每篇生成 3 篇独立审稿进行评估,未测试更高轮次下的变化趋势。
- 评审模板覆盖 3 个会议:主实验采用 ICLR 2025 指南,迁移测试覆盖 NeurIPS 2025 与 ICML 2026 指南。
- 人工审计样本量为 30 对:由 3 名标注者对 30 对盲态修改版本进行五维度语义保留审计。
总结一下论文的主要内容
揭示 AI 审稿系统易受纯表述重构操纵,建议在部署前解耦科学与写作评价。
- 研究定位:该研究系统评估了前沿 AI 审稿系统在合规、可见且完全不改变科学实质内容的“纯表述修改”面前的鲁棒性。
- 核心问题:针对现有安全防范忽视表述博弈的现状,检验当研究方法、实验数据、图表和结论数字保持不变时,仅重构叙事和论述能否被作者用于操纵 AI 审稿得分。
- 方法要点:提出对抗重构(adversarial repackaging)框架,将论文分为自由区、受限区和固定区,以 AI 审稿人反馈为信号,通过成对比较门控机制闭环迭代搜索最佳叙事和排版策略。
- 关键实验结果:在 500 余篇 arXiv 论文与 3 款主流前沿模型上,纯表述修改取得 75.1% 的攻击成功率与平均 +1.21/10 的分数提升(Table 1);重构相关工作与分析讨论等叙事策略的采纳率(44.9%–49.3%)明显优于表面润色与排版(26.5%–29.8%)(Table 2);审稿人优势提升率达 86.1%,但化解弱点有 31.6% 产生反向加剧(Figure 2a)。
- 结论与启示:作者认为当前 AI 审稿人存在“易被打动而难被说服”以及将“提及局限”混淆为“解决局限”的结构性认知缺陷;建议在实际部署前引入纯表述扰动压力测试,并在评分机制中严格解耦科学性评价与写作评价。