防御arXiv 2609.02127·9月2日论文提出带类型溯源与断言护栏,防止持久化 AI Agent 把不可信输入当作自身历史提出类型化溯源与断言护栏,约束持久 Agent 释放自传断言arXiv2609.02127发表9月2日层应用层场景AI Agent防御水印与溯源攻击投毒与后门组件记忆+2+2深度解读完整解读
防御arXiv 2607.04379·7月6日PA-LLM-RAG 框架的知识库投毒攻击与防御提出策略 RAG 的知识库投毒攻击与检测防御 CLD-KBarXiv2607.04379发表7月6日层应用层场景LLM 应用被测模型Llama 3.2防御检测与过滤攻击投毒与后门组件RAG+1+1深度解读完整解读