防御arXiv 2609.02127·9月2日论文提出带类型溯源与断言护栏,防止持久化 AI Agent 把不可信输入当作自身历史提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放arXiv2609.02127发表9月2日层应用层场景AI Agent防御指令与数据隔离攻击投毒与后门组件记忆+2+2深度解读完整解读
防御arXiv 2608.02683·8月3日S³:用多阶段防御提升 LLM 智能体安全提出 S³ 多阶段防御,由 guard agent 编排阶段安全技能检测并缓解风险arXiv2608.02683发表8月3日层应用层场景AI Agent测试DeepSeek-V4-Pro、DeepSeek-V4-Flash防御监控与审计攻击投毒与后门风险Agent 危险操作组件监控器+3+3深度解读完整解读
防御arXiv 2609.36603·9月29日SED:面向 LLM 智能体的免训练持续安全策略学习框架提出免训练框架 SED,把智能体有害轨迹蒸馏成可检索安全策略arXiv2609.36603发表9月29日层应用层场景AI Agent测试DeepSeek-V4-Flash、GLM-5.2、Kimi K3防御监控与审计攻击提示注入组件记忆+2+2深度解读完整解读