攻击arXiv 2610.09973·10月7日从期望危害到似然:LLM 智能体越狱的概率重构提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体arXiv2610.09973发表10月7日层应用层场景AI Agent攻击者白盒被测模型Llama-3.1-8B-Instruct、Ministral-8B-Instruct-2410攻击越狱技术梯度与表征优化+1+1深度解读完整解读
攻击arXiv 2512.20168·2025年12月23日Odysseus 用双重隐写越狱 GPT-4o、Gemini-2.0 与 Grok-3提出双重隐写越狱 Odysseus,用图像隐写绕过多模态系统安全过滤器arXiv2512.20168发表2025年12月23日层应用层场景AI Agent攻击者黑盒被测模型GPT-4o-2024-08-06、Gemini-2.0-pro、Gemini-2.0-flash 等 4 个攻击越狱技术编码与混淆组件护栏与评审+2+2深度解读完整解读