攻击arXiv 2610.09973·10月7日从期望危害到似然:LLM 智能体越狱的概率重构提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体arXiv2610.09973发表10月7日层应用层场景AI Agent攻击者白盒被测模型Llama-3.1-8B-Instruct、Ministral-8B-Instruct-2410攻击越狱技术梯度与表征优化+1+1深度解读完整解读
攻击arXiv 2510.09023·2025年10月10日论文提出自适应攻击框架,击穿 12 项 LLM 越狱与提示注入防御提出自适应攻击框架,击穿越狱与提示注入防御arXiv2510.09023发表2025年10月10日层应用层场景AI Agent攻击者白盒、黑盒被测模型Gemini-2.5 Pro、GPT-5 Mini、Llama-3.3 70B 等 15 个攻击越狱技术针对防御+2+2深度解读完整解读