攻击arXiv 2606.12716
PaperGuard:针对多模态 AI 同行评审的攻击与防御基准
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
- arXiv
- 2606.12716
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- Claude-sonnet-4.5、GPT-4o、GPT-4.1 等 11 个
摘要PaperGuard 测到提示注入与白盒视觉抬分,并比较分块检索防御。
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
提出 CRCP 框架,优化分块与重排下的 RAG 语料投毒
CRCP 研究的是带分块和重排的 RAG 语料投毒,而不是只提高文档级检索分数。
提出 CodecAttack,在编解码器隐空间构造可穿透有损压缩的对抗音频
提出 AudioHijack,用不可感知对抗音频对语音模型做上下文无关提示注入
摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示