攻击arXiv 2606.12716
PaperGuard:针对多模态 AI 同行评审的攻击与防御基准
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
- arXiv
- 2606.12716
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- Claude-sonnet-4.5、GPT-4o、GPT-4.1 等 11 个
摘要PaperGuard 测到提示注入与白盒视觉抬分,并比较分块检索防御。
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
提出 LPCI,把延迟条件载荷写入记忆与检索库以跨会话触发
作者把LPCI定义为针对智能体逻辑执行、记忆留存和工具集成的跨阶段漏洞类,而不是单次输入上的提示改写。