攻击arXiv 2610.09973·10月7日从期望危害到似然:LLM 智能体越狱的概率重构提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体arXiv2610.09973发表10月7日层应用层场景AI Agent攻击者白盒被测模型Llama-3.1-8B-Instruct、Ministral-8B-Instruct-2410攻击越狱技术梯度与表征优化+1+1深度解读完整解读
攻击arXiv 2609.02035·9月2日ISM:通过语义匹配隐式操纵 LLM Agent 的技能选择提出 ISM,用语义匹配隐式操纵 Agent 技能选择arXiv2609.02035发表9月2日层应用层场景AI Agent被测模型Llama-2-7B、Llama-3-8B、Llama-3.1-8B 等 8 个攻击投毒与后门技术诱导选用组件MCP 与技能深度解读完整解读