研究者提出改写式对抗攻击 PAA,可在不改变论文主张的情况下抬高 LLM 审稿评分
Paraphrasing Adversarial Attack on LLM-as-a-Reviewer
AI 导读
研究者提出改写式对抗攻击(PAA),一种黑盒优化方法,通过搜索语义等价且语言自然的改写序列,在不改变论文主张的前提下抬高 LLM 审稿给出的评分。PAA 借助上下文学习,用此前的改写及其得分引导候选生成。在五个 ML 与 NLP 会议、三种 LLM 审稿模型和五种攻击模型上的实验显示,PAA 能稳定提高评审分数,人工评估确认生成的改写保持了语义与自然度。研究还发现被攻击论文的评审困惑度升高,可作为潜在检测信号,而对投稿做改写也能部分缓解此类攻击。