攻击arXiv 2610.09973·10月7日从期望危害到似然:LLM 智能体越狱的概率重构提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体arXiv2610.09973发表10月7日层应用层场景AI Agent攻击者白盒被测模型Llama-3.1-8B-Instruct、Ministral-8B-Instruct-2410攻击越狱技术梯度与表征优化+1+1深度解读完整解读
攻击arXiv 2608.03642·8月4日规避与投毒攻击对恶意软件数据漂移检测器的实证分析用通用扰动对恶意软件分类器及漂移检测器做规避与后门投毒arXiv2608.03642发表8月4日层模型层场景模型与 API被测模型MLP 100-100、CADE (CAE 512-384-256-128)、CADE (CAE 512-128-32-8) 等 6 个攻击检测规避技术梯度与表征优化+2+2深度解读完整解读