攻击arXiv 2610.09973
从期望危害到似然:LLM 智能体越狱的概率重构
提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体
- arXiv
- 2610.09973
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 白盒
- 被测模型
- Llama-3.1-8B-Instruct、Ministral-8B-Instruct-2410
提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体
提出 AdaLCPI,把恶意指令拆成碎片嵌入工具返回并诱导 Agent 越权执行
提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
提出跨通道分段攻击,利用 MCP 隐式信任外发敏感文件
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
提出 Relink 攻击,在 Agent 压缩边界将分散良性片段重组为恶意指令
本文研究了智能体基于摘要的提示词压缩所引入的新型安全漏洞——重链(Relinking),并提出了系统化的攻击构建方法与边界审计防御机制。
提出 TIP,用树搜索为 MCP 响应生成隐蔽注入载荷
TIP 是面向 MCP 工具响应的 black-box 间接提示注入,目标是在不改工具元数据的情况下生成语义连贯的 JSON 载荷。
提出自适应攻击框架,击穿越狱与提示注入防御
提出 RL-Hammer,从零训练攻击模型经工具输出实施提示注入
RL-Hammer 是一个无需热启动数据、基于 GRPO 算法从零训练的黑盒提示注入对抗攻击框架。现有针对大语言模型智能体的提示注入防御(如 Instruction Hierarchy 与 SecAlign)主要在静态或弱攻击下测试,在面对自动化强力攻击时的真实防御能力缺乏充分检验。方法的核心机制包括。
提出 LPCI,把延迟条件载荷写入记忆与检索库以跨会话触发
作者把LPCI定义为针对智能体逻辑执行、记忆留存和工具集成的跨阶段漏洞类,而不是单次输入上的提示改写。