防御arXiv 2610.04504·10月3日论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用arXiv2610.04504发表10月3日层应用层场景AI Agent测试DeepSeek-chat、Meta Llama 3.1 8B、Kimi防御权限与审批攻击提示注入组件权限与沙箱+1+1深度解读完整解读
防御arXiv 2609.02127·9月2日论文提出带类型溯源与断言护栏,防止持久化 AI Agent 把不可信输入当作自身历史提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放arXiv2609.02127发表9月2日层应用层场景AI Agent防御指令与数据隔离攻击投毒与后门组件记忆+2+2深度解读完整解读