跳到正文
原文
论文追踪· arXiv:2601.06884· Masahiro Kaneko·本站收录 · 原文发表

研究者提出改写式对抗攻击 PAA,可在不改变论文主张的情况下抬高 LLM 审稿评分

Paraphrasing Adversarial Attack on LLM-as-a-Reviewer

AI 导读

研究者提出改写式对抗攻击(PAA),一种黑盒优化方法,通过搜索语义等价且语言自然的改写序列,在不改变论文主张的前提下抬高 LLM 审稿给出的评分。PAA 借助上下文学习,用此前的改写及其得分引导候选生成。在五个 ML 与 NLP 会议、三种 LLM 审稿模型和五种攻击模型上的实验显示,PAA 能稳定提高评审分数,人工评估确认生成的改写保持了语义与自然度。研究还发现被攻击论文的评审困惑度升高,可作为潜在检测信号,而对投稿做改写也能部分缓解此类攻击。

阅读原文arxiv.org