防御arXiv:2610.04504 · 10月3日论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证提出 VAL 框架并用确认门与参数沙箱约束高风险工具调用AI Agent·测试DeepSeek-chat、Meta Llama 3.1 8B、Kimi·应用层权限与审批提示注入权限与沙箱完整解读
防御arXiv:2610.01058 · 10月2日MOMAT:面向量化 LLM 低功耗越狱防御的多图集混合框架提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱模型与 API·测试Llama2-13B、Llama2-7B、Mistral-7B·提示层检测与过滤越狱护栏与评审+1+1完整解读
防御arXiv:2609.34518 · 9月28日SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE提出工具智能体的状态攻击 DART 与预执行防御 SAGEAI Agent·测试GPT-5.6 Luna、GPT-5.6 Terra、Gemini 3.8 Flash 等 8 个·应用层权限与审批越狱权限与沙箱摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。完整解读