攻击arXiv 2606.12716
PaperGuard:针对多模态 AI 同行评审的攻击与防御基准
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
- arXiv
- 2606.12716
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- Claude-sonnet-4.5、GPT-4o、GPT-4.1 等 11 个
摘要PaperGuard 测到提示注入与白盒视觉抬分,并比较分块检索防御。
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
提出 CRCP 框架,优化分块与重排下的 RAG 语料投毒
CRCP 研究的是带分块和重排的 RAG 语料投毒,而不是只提高文档级检索分数。
提出 CodecAttack,在编解码器隐空间构造可穿透有损压缩的对抗音频
提出 AudioHijack,用不可感知对抗音频对语音模型做上下文无关提示注入
摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。