攻击arXiv 2608.27531·8月27日MAMJ:面向视觉语言模型的元自适应多模态越狱攻击提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重arXiv2608.27531发表8月27日层提示层场景模型与 API攻击者黑盒测试GPT-4o、Gemini-3-Pro-Preview、Seed 2.0 等 4 个攻击越狱技术自动化搜索组件视觉+1+1深度解读完整解读
防御arXiv 2609.21363·9月18日用扩散模型隐空间扰动防御视觉语言模型的地理位置隐私泄露提出扩散潜空间地理扰动防御,抑制视觉语言模型泄露精确地理位置arXiv2609.21363发表9月18日层提示层场景模型与 API攻击者黑盒测试GPT-4.1、GPT-5、Gemini 2.5 Pro 等 6 个攻击恶意使用组件视觉深度解读完整解读