攻击arXiv 2610.09973·10月7日从期望危害到似然:LLM 智能体越狱的概率重构提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体arXiv2610.09973发表10月7日层应用层场景AI Agent攻击者白盒被测模型Llama-3.1-8B-Instruct、Ministral-8B-Instruct-2410攻击越狱技术梯度与表征优化+1+1深度解读完整解读
攻击arXiv 2607.00481·7月1日研究者提出 SMT 框架,通过模拟审核轨迹越狱函数调用 LLM提出 SMT 框架,用模拟审核轨迹越狱函数调用 LLMarXiv2607.00481发表7月1日层提示层场景模型与 API攻击者黑盒、白盒被测模型GPT-4o、GPT-5.4、Qwen3-Max 等 7 个攻击越狱技术多轮渐进+1+1深度解读完整解读