攻击arXiv 2606.12716
PaperGuard:针对多模态 AI 同行评审的攻击与防御基准
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
- arXiv
- 2606.12716
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- Claude-sonnet-4.5、GPT-4o、GPT-4.1 等 11 个
摘要PaperGuard 测到提示注入与白盒视觉抬分,并比较分块检索防御。
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
提出 CRCP 框架,优化分块与重排下的 RAG 语料投毒
CRCP 研究的是带分块和重排的 RAG 语料投毒,而不是只提高文档级检索分数。