防御arXiv 2609.02127·9月2日论文提出带类型溯源与断言护栏,防止持久化 AI Agent 把不可信输入当作自身历史提出类型化溯源与断言护栏,约束持久 Agent 释放自传断言arXiv2609.02127发表9月2日层应用层场景AI Agent防御水印与溯源攻击投毒与后门组件记忆+2+2深度解读完整解读
攻击arXiv 2606.04329·6月3日研究者系统研究 LLM 智能体记忆投毒攻击并提出 MPBench 基准系统研究 LLM 智能体记忆投毒并构建基准 MPBencharXiv2606.04329发表6月3日层应用层场景AI Agent被测模型Meta-Llama-3.1-70B-Instruct、Deberta-v3-base、Llama-3.1-8B-Instruct 等 5 个攻击投毒与后门技术潜伏触发组件记忆+1+1摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。深度解读完整解读