攻击arXiv 2608.27531·8月27日MAMJ:面向视觉语言模型的元自适应多模态越狱攻击提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重arXiv2608.27531发表8月27日层提示层场景模型与 API攻击者黑盒测试GPT-4o、Gemini-3-Pro-Preview、Seed 2.0 等 4 个攻击越狱技术自动化搜索组件视觉+1+1深度解读完整解读
防御arXiv 2610.00400·10月2日DART:用表征位移检测多轮 LLM 智能体中的新兴安全风险提出 DART,用去噪表征转移检测多轮智能体攻击并注入提醒arXiv2610.00400发表10月2日层应用层场景AI Agent攻击者黑盒测试Qwen3-8B、Qwen3-14B、Qwen3-32B 等 6 个防御监控与审计攻击越狱组件监控器+1+1深度解读完整解读