防御arXiv 2609.02127·9月2日论文提出带类型溯源与断言护栏,防止持久化 AI Agent 把不可信输入当作自身历史提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放arXiv2609.02127发表9月2日层应用层场景AI Agent防御指令与数据隔离攻击投毒与后门组件记忆+2+2深度解读完整解读
防御arXiv 2609.01487·9月2日Defense-as-Skill:为技能增强型 Agent 演化运行时护栏技能提出可安装护栏技能 SkillSonar,在运行时分流技能增强 Agent 的敏感动作arXiv2609.01487发表9月2日层应用层场景AI Agent测试GLM-5、GPT-5.4、Claude Haiku 4.5 等 5 个防御指令与数据隔离攻击投毒与后门组件MCP 与技能深度解读完整解读