跳到正文
原文
论文追踪· arXiv:2606.12716· Xinyu Zhao, Rana Muhammad Shahroz Khan, Zhen Xu, Zhen Tan, Tianlong Chen·本站收录 · 原文发表

PaperGuard:针对多模态 AI 同行评审的攻击与防御基准

Does AI Reviewer See the Full Picture? Attacking and Defending Multimodal Peer Review

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

PaperGuard测得Claude-sonnet-4.5提示注入ASR为0.80,分块检索文本Acc为95.0。

威胁模型自动审稿MLLM为受害系统。攻击者不能改Prev或M,只能改论文文本T与图像I。

问题
AI审稿已进入会议初审,但鲁棒性研究以文本为主,攻击目标是抬高领域评分而非通用越狱。作者称尚无针对长文、跨模态操纵的实用防御。
方法
PaperGuard包含多领域图文论文、黑盒提示注入,以及文本GCG和图像PGD、APGD、C&W。防御将论文切成文本块和图块,用嵌入与已知攻击模式比对后再做意图核验。
实验与结果
Claude-sonnet-4.5提示注入ASR为0.80。Janus-Pro-7B白盒APGD抬升14.11。分块检索文本Acc为95.0、FPR为0.0;17篇真实注入论文Recall为100.0(17/17)。
局限与可以继续做的
论文未设局限专节。附录G将完整PDF栅格化或OCR抽取写为后续方向。实验包含8个提示注入评审模型、1136篇论文和多种检测器;未报告主实验重复次数及视觉攻击的扰动预算。
实验设置Claude-sonnet-4.5、GPT-4o 等 · PaperGuard(ICLR 605篇与F1000Research 531篇,共1136篇)、Lin (2025)确认含隐藏提示注入的arXiv论文 · ASR、Score Shift 等
威胁模型
自动审稿MLLM为受害系统。攻击者不能改Prev或M,只能改论文文本T与图像I。黑盒注入恶意文本或新图;白盒用梯度做GCG与PGD/APGD/C&W。作者称白盒是上界,并供代理模型优化后迁移。目标是最大化overall分数抬升,而非通用越狱。
被测模型
Claude-sonnet-4.5GPT-4oGPT-4.1Gemma-3-27b-itMistral-Small-3.1-24B-InstructQwen2.5-VL-32B-InstructQwen-3-8BDeepSeek-R1-Distill-Llama-8BQwen2.5-VL-7BJanus-Pro-7BLLaVA-v1.5-7B
基准
PaperGuard(ICLR 605篇与F1000Research 531篇,共1136篇)Lin (2025)确认含隐藏提示注入的arXiv论文
指标
ASRScore ShiftAvg. #Pos ShiftAvg. #Neg ShiftAccRecallFPRFNR
AI 导读研究者提出 PaperGuard,用于系统评估和防御针对 AI 生成同行评审的跨模态定向攻击。该框架包含覆盖多个科学领域的多模态评审数据集、统一攻击套件(黑盒提示注入与白盒扰动,分别针对文本的 GCG 和图表的 PGD),以及利用分块嵌入检索定位并缓解有害指令的防御方法。在多个前沿模型上的实验显示,AI 评审模型普遍存在被操纵的脆弱性。该工作已被 ICML 2026 接收。

研究者提出 PaperGuard,用于系统评估和防御针对 AI 生成同行评审的跨模态定向攻击。该框架包含覆盖多个科学领域的多模态评审数据集、统一攻击套件(黑盒提示注入与白盒扰动,分别针对文本的 GCG 和图表的 PGD),以及利用分块嵌入检索定位并缓解有害指令的防御方法。在多个前沿模型上的实验显示,AI 评审模型普遍存在被操纵的脆弱性。该工作已被 ICML 2026 接收。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    作者称AI审稿会被跨模态评分操纵,且缺少对症的评测与防御。

    AI审稿可能被跨模态内容操纵去抬高评分,现有评测与防御并不针对这种失败。

    • 场景:作者称AAAI、ICML、NeurIPS已把AI生成评审纳入初审;模型成为发表守门人后,操纵鲁棒性是当下问题,而不只是学术问题。
    • 不足:作者列出三缺口。鲁棒性研究几乎只做文本攻击,忽略承载方法与结果的图。审稿攻击要的是领域内定向失败,例如忽略某缺陷或抬高某方法的分数,而不是违反“不要说有害内容”这类通用策略。恶意指令藏在长文中,作者认为简单的提示审核或越狱检测可能无效,并称尚无实用防御。
    • 提出:作者提出PaperGuard,含多领域图文审稿数据、黑盒注入与白盒文本/图像扰动,以及面向长上下文的分块嵌入检索。作者称这是首个系统评测并防御此类攻击的基准。
    • 威胁模型:
      • 受害系统:MLLM M担任自动审稿人,输入评审提示Prev、全文T与K张图I,输出文本评审R和分数向量S。
      • 目标:最大化overall分数抬升,即对抗输出与干净输出的overall之差。作者强调输出可以符合通用安全,但评价是欺诈性偏正。
      • 能力:黑盒无权重和梯度,向T追加文本,或向I追加带指令的新图。白盒有查询和梯度,可扰动已有文本块(如GCG),或在ℓp预算内扰动已有图(如PGD)。
      • 边界:两种设定都不能改Prev或M。作者称白盒不假定真实攻击者能取得部署模型的梯度,而是脆弱性上界,以及在开源代理上优化后再观察迁移。
  2. 有哪些相关研究?

    相关工作分审稿自动化、质量基准和文本对抗;作者称多模态攻击尚未被系统评测。

    审稿自动化

    • 早期工具做政策合规、抄袭或统计错误筛查(Kilicoglu et al., 2018;Riedel et al., 2020;Zhang, 2010;Nuijten et al., 2016;Checco et al., 2021)。作者称它们限于表层检查。
    • NLP评审生成试图接近人类判断(Kuznetsov et al., 2024;Nikiforovskaya et al., 2020;Yuan et al., 2022a)。作者称仍受领域特异性与生成可靠性约束。
    • LLM可分析论文、写反馈并协助元评审(Du et al., 2024;Lu et al., 2024;Zhuang et al., 2025;Liu & Shah, 2023;Zhou et al., 2024b;Liang et al., 2024)。作者引用Zhou et al. (2024b),称即便GPT-4o也常达不到人类对评审质量的预期。微调与多智能体(Kang et al., 2018b;D’Arcy et al., 2024;Tan et al., 2024等)被用来补质量,论文未把它们当作安全基线。

    质量基准

    • 早期用ROUGE(Lin, 2004)或BERTScore对照人类评审(Shen et al., 2022;Gao et al., 2024等),随后采用LLM-as-a-judge(Robertson, 2023b;Zhou et al., 2024b;Gao et al., 2025a)。
    • MMReview(Gao et al., 2025b)是大规模、多学科、多模态评审基准,含13项任务,覆盖文本与图。作者称它假定输入良性,不回答安全问题。

    对抗与审稿操纵

    • 文本攻击包括字符扰动、同义词替换和句子改写(Gao et al., 2018;Jin et al., 2020;Qi et al., 2021a等)。Yao et al. (2024)与Kumar (2024)把数据投毒和提示注入视为实际威胁;位置、冗长和自我增强偏差也被写入讨论(Liu et al., 2024;Zheng et al., 2023)。
    • 审稿场景中,Robertson (2023a)观察到GPT-4难以处理细微操纵;Raina et al. (2024)显示对抗攻击可抬高评估分数。
    • Breaking the Reviewer(Lin et al., 2025)考察LLM审稿人面对文本攻击的鲁棒性。作者称该线工作忽略图、表和图表这一攻击面。

    基线与数据

    • 基线方法:防御对比为Moderation API、LLM-as-Judge、BERT滑窗分类器、文档嵌入分类器;附录H另比较加了警惕指令的评审提示。Figure 1图注还写了Perplexity Detection与Perturbation,正文表未给对应数字。
    • 基准/数据集:自建1136篇,来自PeerRead、AgentReview的ICLR论文与NLPeer的F1000Research;检测另用Lin (2025)记录的真实隐藏注入论文。

    作者定位:质量基准在良性输入下衡量审稿质量,文本鲁棒性研究未覆盖科学论文的视觉通道。作者称据其所知,尚无工作系统评测AI审稿人的多模态对抗脆弱性。

  3. 论文如何解决这个问题?

    PaperGuard用注入与白盒扰动抬分,再用分块嵌入检索定位恶意指令。

    PaperGuard把自动审稿写成对图文投稿的分数抬升问题,再用注入、可学习扰动和分块检索分别攻击与检测。

    系统与目标

    • 模型M读取Prev、文本T和图像集I,输出评审R与分数S。良性情形写作(Rclean, Sclean) = M(Prev, T, I)。
    • 攻击者只改T和/或I。目标是最大化overall分数差:max Ladv = soverall,adv − soverall,clean。
    • 第3.2节写不能改Prev,文本注入是把块并入T,视觉注入是追加新图。第4.1节公式却写成在Prev后追加指令,同时又写注入位置在论文开头或结尾并随机选择。后文实验描述以论文首尾位置为准。
    • ASR定义为overall相对干净输出至少上升1.0的比例。另报告八方面分数变化之和,理论上限为±80,以及正、负标签数变化。八方面是Overall、Substance、Appropriateness、Meaningful Comparison、Soundness/Correctness、Originality、Clarity、Impact,各为1–10。

    数据

    • 1136篇:ICLR 605篇,来自PeerRead与AgentReview的五年出版物;F1000Research 531篇,来自NLPeer,覆盖生物医学与物理。
    • 只保留偏拒稿样本:ICLR拒稿,以及F1000一轮评审明显倾向拒稿的投稿。PDF经ScienceParse转为JSON,匿名化并只留正文;方法或主要结果图由人工裁剪。

    攻击

    • 黑盒提示注入:正文写有12种变体,附录B与Figure 4给出类型名,如直接指令、少样本、角色、权威、多步、代码切换、伪装和混淆。可伪装成良性内容,或用低对比度文字隐藏。附录给出完整提示词,此处不复述。每次实例随机选择变体,以及文首或文末位置。
    • 白盒文本:用GCG在开源代理上优化字符串,再插入论文中随机位置。目标响应是结构化评审格式的前缀。作者称抬分来自负标签减少、批评被抑制,而不是目标串直接编码高分。附录C:500步,候选批大小64,每位置top-k为64,每步替换一个token,可早停;代理为Qwen-3-8B与DeepSeek-R1-Distill-Llama-8B,实现为nanoGCG。
    • 白盒视觉:对一张目标图在ℓp球内最大化同一抬分目标。为避免只对一种优化过拟合,采用PGD(l∞)、APGD(l∞)和C&W(l2)。C&W文中举例成功余量τ为+1.0、置信参数κ为0,未写实验实际取值。论文未给出ε、步长或迭代次数。

    防御

    • 检测是二分类。评估集等分为干净论文、已知攻击、未知攻击。已知集含文本注入和视觉攻击模式;未知集是留出的提示变体和视觉模板。主结果表未按这三类拆开数字。
    • 对照包括:通用Moderation API;用系统提示Pjudge让LLM寻找操纵分数的指令;BERT滑窗分类器,应对512 token限制,取窗口logit最大值;E5-V分别嵌入文本和图像再拼接分类,长文须截断。
    • 分块嵌入检索把文本按句边界切块(有字符上限,未给数值),每张图单独成块,可配图注。用E5-V与已知文本/视觉模式库做余弦top-k,k未给出。验证器LLM判断候选是主动恶意指令还是良性讨论;至少一块被核为恶意才标为攻击。视觉评测把对抗图当作查询,最近邻属于正确攻击族或被核为带指令图像即计成功。验证器模型名未写。
    • 指标为Acc、Recall、FPR、FNR。作者称审稿场景应优先压低FPR,以免指控正当作者。
  4. 论文做了哪些实验?

    Claude-sonnet-4.5提示注入ASR为0.80,Janus-Pro-7B上APGD抬升14.11。

    实验设置

    • 评审模型:提示注入为Claude-sonnet-4.5、GPT-4o、GPT-4.1、Gemma-3-27b-it、Mistral-Small-3.1-24B-Instruct、Qwen2.5-VL-32B-Instruct、Qwen-3-8B、DeepSeek-R1-Distill-Llama-8B。GCG报告在后两者上,目标即优化用的代理。视觉白盒为Qwen2.5-VL-7B、Janus-Pro-7B、LLaVA-v1.5-7B。附录F另把7B上做出的图零样本迁到Qwen2.5-VL-32B、Gemma-3-27B、Mistral-Small-3.1-24B;论文未写明这些简称是否与主实验全名同一检查点。
    • 数据与协议:每篇构造干净–攻击对。数据共1136篇。附录F写,因白盒优化开销大,所有learnable-attack实验用随机抽取的120篇。温度0.3,最大新token 2048;评审模板另限制输出不超过500 token,8–10分须过闸门,有明显弱点时相关方面上限为7(附录I)。开源模型为bfloat16。
    • 指标:ASR看overall是否至少+1.0。第4.1节把所报告的分数变化定义为八方面变化之和;Table 1标题写的是干净到攻击的平均分数变化。标签变化是正、负标签数之差。防御指标为Acc、Rec.、FPR、FNR。
    • 谁打分:攻击分数来自评审模型自己的结构化输出,不是另一个模型评分。Table 4与附录H的LLM-as-Judge写明为GPT-4o;Table 1b未写检测器面对的评审模型。
    • 未写明项:主表重复次数、±的含义、各模型是否跑完全部1136篇,以及视觉攻击的ε和步数。
    • Figure 1:图注写数据集Dpro、Dreal,以及Perplexity Detection、Perturbation、LLM-as-Judge相对No Defense的下降,下划线表示列内最低下降。抽出的图内文字是三种攻击示例和GPT-4o、Qwen3-8B、Qwen2.5-VL-7B。正文表未报告图注中的那些条件,转换文本也没有括注数值。

    主结果

    提示注入,据Table 1a。Score与#Neg为表中Average Shift;#Neg列标题方向为下降,表内数字带符号。

    表格较宽,可左右滑动

    模型ASRScore变化#Neg变化
    Claude-sonnet-4.50.80±0.0214.14±0.72-2.62±0.12
    GPT-4o0.72±0.096.65±1.44-1.37±0.38
    GPT-4.10.68±0.049.40±1.00-2.27±0.07
    Gemma-3-27b-it0.74±0.057.93±0.34-1.88±0.05
    Mistral-Small-3.1-24B-Instruct0.76±0.019.95±0.24-3.26±0.25
    Qwen2.5-VL-32B-Instruct0.73±0.027.11±0.69-2.43±0.11
    Qwen-3-8B0.64±0.034.16±0.51-1.39±0.20
    DeepSeek-R1-Distill-Llama-8B0.46±0.095.05±0.980.11±0.18
    • 作者称先进模型普遍易受黑盒提示注入影响,且专有模型更易被操纵。表中ASR最高与最低分别在Claude-sonnet-4.5和DeepSeek-R1-Distill-Llama-8B。GPT-4.1、Qwen-3-8B、DeepSeek在Multimodality列未打勾;附录E称GPT-4.1为text-only。
    • 作者称攻击主要通过抑制批评,而不是堆砌正面评价。表中仅DeepSeek的#Neg变化为正。Mistral-Small-3.1与Qwen2.5-VL-32B的#Pos变化为0.00±0.07和0.00±0.38。
    • 作者称更大模型因更会遵循指令而更易中招,并把DeepSeek的低ASR解释为能力失败:长上下文下结构化评审只在约62%的情形解析成功。该约62%不是表内数字。

    白盒可学习攻击

    • 文本GCG(Table 2a,目标即代理):Qwen-3-8B的ASR为0.78±0.03,Score变化3.33±0.95,#Neg为-1.33±0.18。DeepSeek-R1-Distill-Llama-8B的ASR为0.52±0.07,Score变化5.74±0.18,#Neg为0.26±0.02。作者称后者ASR更低,但成功时分数抬升更大。
    • 视觉(Table 2b,优化发生在被测模型上,未报告ASR):三行都是APGD高于PGD、PGD高于C&W。Qwen-2.5-VL-7B为11.14±0.49、12.71±0.58、9.83±0.31;Janus-Pro-7B为12.78±0.25、14.11±0.70、9.91±0.28;LLaVA-v1.5-7B为12.64±0.57、13.97±0.65、9.17±0.31。作者称只改图、不改文本即可误导审稿,因此纯文本防护不够。
    • Figure 3标出被攻击模型为GPT-4o、Qwen3-8B、Qwen2.5-VL-7B。图注称雷达图橙色为攻击、绿色为干净,并用了significant inflation;转换文本没有可读刻度。

    防御

    • 文本(Table 1b,未写对应评审模型):Moderation API的Acc/Rec./FPR/FNR为33.30、0.0、0.0、100.0。LLM-as-Judge为66.70、100.0、100.0、0.0。BERT为38.50、0.0、35.0、100.0。嵌入分类器为64.50、0.0、12.0、100.0。分块检索为95.0、92.86、0.0、7.14。引言称零误报;此表FPR为0.0,后文视觉与附录设置并非全是0。
    • 视觉(Table 3):LLM-as-a-Judge为35.60、90.00、1.00、10.00。嵌入分类器为72.50、0.00、0.10、1.00。分块检索为93.50、90.32、0.10、9.68。作者称LLM-as-Judge在文本和视觉设置下FPR都是100%;这与Table 1b一致,与Table 3的1.00不一致。嵌入分类器的Rec.为0.00而FNR为1.00,论文未解释。作者称全局表示对局部威胁过粗。
    • 分布外与真实样本:Table 4在17篇有源码的真实注入论文上,EmbSearch的Recall为100.0(17/17)、FPR为0.0;GPT-4o为64.7(11/17)、FPR为0.0;Moderation API为0.0(0/17)、FPR为0.0。作者称LLM-as-Judge漏掉更间接的身份操纵和markdown变体。附录H对GCG字符串(100篇攻击加100篇干净,优化代理与被攻击论文的模型不同):EmbSearch的Recall为95.0、FPR为2.0;提示中告知GCG的LLM-as-Judge为75.0与8.0;Moderation API为1.0与0.0。

    迁移

    • Table 5把对抗图从基模型零样本迁到另一个评审模型。PGD的六格为9.83至12.53,最高是LLaVA-v1.5-7B到Janus-Pro-7B的12.53;C&W为6.27至8.10,最高是同一方向的8.10。作者称扰动利用共享视觉特征,攻击者不必拥有部署模型的梯度。
    • 这些端点就是Table 5全部格子的最小与最大,不是另行估算。跨尺度与重编码见下节。

    其他消融与分析

    • Table 6,120篇,7B代理零样本迁到24–32B:PGD为7.38–8.92,C&W为4.97–6.11。作者称7.4–8.9与5.0–6.1。
    • Table 7,三模型上生成的对抗图再做resize与JPEG,数字未按模型拆开:无处理时PGD/APGD/C&W为12.19、13.60、9.64;resize加JPEG后为8.91、9.86、7.02。作者称强度下降但未消失。
    • 附录H,10种故意改写的注入、200篇攻击论文:EmbSearch的recall为100%、FPR为5%;GPT-4o为95%与0%,其中indirect-factual为65%、narrative-voice为85%,其余八种为100%;Moderation API为0。
    • Table 9,text-embedding-3-large:已知集内部平均余弦距离0.464,未知类对已知集0.509,改写变体对已知集0.531。
    • Table 10,200样本的警惕提示:Qwen-3-8B、Gemma-3-27b-it、GPT-4o的ASR从95%、95%、72%变为95%、90%、68%,干净分下降4.05、2.80、3.45。作者称ASR最多降5个百分点,干净分下降2.8–4.1。论文未说明这200样本与Table 1a的关系。
    • 30篇含攻击术语的干净对抗机器学习论文:三种防御FPR均为0%(30/30)。
  5. 有什么可以进一步探索的点?

    论文未设局限专节;附录G把PDF栅格化或OCR抽取列为后续方向。

    作者指出的局限与后续方向

    • 论文未专门讨论局限。正文没有Limitations、Discussion或Future Work专节,结论也未逐条写不足。
    • 附录G写明一条后续方向:更激进的端到端文档流程,例如完整PDF栅格化或基于OCR的抽取。

    实验覆盖范围

    • 提示注入的评审模型为Table 1a的8个;视觉白盒为Table 2b的3个7B级MLLM;GCG的ASR报告在Qwen-3-8B与DeepSeek-R1-Distill-Llama-8B上,这两行的目标就是优化所用代理。
    • 论文集为1136篇,其中ICLR 605篇、F1000Research 531篇,并筛过偏拒稿样本。附录F写learnable-attack实验用随机120篇。防御主表只写三份等大划分,未写各份篇数。
    • 攻击包括12类提示注入(位置随机在文首或文末)、GCG,以及PGD、APGD、C&W。跨模型与跨尺度迁移在Table 5和Table 6,resize与JPEG在Table 7。
    • 防御比较了Moderation API、LLM-as-Judge、BERT分类器、嵌入分类器和分块检索,并另测17篇真实论文、GCG字符串、10种改写、30篇难负例,以及附录H的警惕提示。
    • 论文未报告主实验重复次数、±的定义、视觉攻击的ε与迭代步数、分块字符上限与top-k、分块检索验证器的模型名,以及攻击成功判定与人工评审的一致性。
  6. 总结一下论文的主要内容

    PaperGuard测到提示注入与白盒视觉抬分,并比较分块检索防御。

    PaperGuard同时评测并检测多模态AI审稿中的评分操纵。

    • 会议已把AI评审纳入初审,但既有工作要么在良性输入上比评审质量,要么只测文本攻击。这里的失败是抬高领域分数、放过缺陷,不是通用越狱。
    • 数据来自ICLR与F1000,共1136篇,并抽出图。攻击者不能改评审提示或模型,只能改投稿:黑盒把指令放进论文,白盒用GCG改文本、用PGD/APGD/C&W改图。防御把文本和图切块,与已知攻击模式做嵌入检索,再由验证器判断是否为主动指令。
    • Table 1a中,Claude-sonnet-4.5的提示注入ASR为0.80±0.02,八方面分数变化为14.14±0.72;八个模型里ASR最低的是DeepSeek-R1-Distill-Llama-8B,为0.46±0.09,其负标签数并未下降。
    • 白盒视觉攻击直接优化被测模型时,Table 2b的最高抬升是Janus-Pro-7B上APGD的14.11±0.70。换成另一个模型评估时,Table 5的PGD仍有9.83–12.53。
    • 检测方面,Table 1b的分块检索Acc为95.0、FPR为0.0;Table 3的视觉FPR为0.10。Table 4对17篇真实隐藏注入的Recall为100.0(17/17)。同一文本表里,Moderation API和两种分类器的Recall为0.0,LLM-as-Judge的FPR为100.0。
    • 作者的结论是:现有MLLM审稿人在文本和图像上都会被抬分,长文使标准防御不够;分块检索可以把这类操纵隔出来,并为可抵御攻击的AI辅助审稿提供基准与协议。
阅读原文arxiv.org