攻击arXiv 2610.09973
从期望危害到似然:LLM 智能体越狱的概率重构
提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体
- arXiv
- 2610.09973
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 白盒
- 被测模型
- Llama-3.1-8B-Instruct、Ministral-8B-Instruct-2410
提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体
提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
提出检索器后门攻击操纵智能体搜索,并用 DOU 逃避检测
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化
提出 ElasticBack,在单个 Agent 技能中植入条件后门
ElasticBack 是放在 LLM agent 单个 skill 里的条件后门攻击。。
提出 MAFIA,以探测放置与事实伪装对带审计 Agent 做查询式记忆投毒
提出 EvoBreak,以良性任务组合诱导自进化 Agent 的持久经验并削弱安全边界
提出 CFD 跨会话分解攻击,利用工件来源缺口绕过工具型 Agent 的本地检查
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。