攻击arXiv 2606.12716
PaperGuard:针对多模态 AI 同行评审的攻击与防御基准
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
- arXiv
- 2606.12716
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- Claude-sonnet-4.5、GPT-4o、GPT-4.1 等 11 个
摘要PaperGuard 测到提示注入与白盒视觉抬分,并比较分块检索防御。
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
另有 246 篇论文还没打上分类标签,暂不在筛选结果里。
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。