防御arXiv 2609.02127·9月2日论文提出带类型溯源与断言护栏,防止持久化 AI Agent 把不可信输入当作自身历史提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放arXiv2609.02127发表9月2日层应用层场景AI Agent防御指令与数据隔离攻击投毒与后门组件记忆+2+2深度解读完整解读
防御arXiv 2609.21088·9月18日Provenance-Aware Transformers:用来源感知架构分离可信边界以防御间接提示注入提出 Provenance-Aware Transformers,隔离不可信来源防御间接提示注入arXiv2609.21088发表9月18日层应用层场景LLM 应用测试SmolLM2-360M-Instruct、LLaMA-3-8B-Instruct、Qwen2.5-7B-Instruct 等 4 个防御指令与数据隔离攻击提示注入+1+1深度解读完整解读