攻击arXiv 2608.03844
MAFIA:针对带审计 LLM Agent 的查询式记忆投毒攻击
提出 MAFIA,以探测放置与事实伪装对带审计 Agent 做查询式记忆投毒
- arXiv
- 2608.03844
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- gpt-5.4-mini、Gemini、ProtectAI 等 8 个
提出 MAFIA,以探测放置与事实伪装对带审计 Agent 做查询式记忆投毒
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
提出 CFD 跨会话分解攻击,利用工件来源缺口绕过工具型 Agent 的本地检查
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。