攻击arXiv 2610.09973
从期望危害到似然:LLM 智能体越狱的概率重构
提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体
- arXiv
- 2610.09973
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 白盒
- 被测模型
- Llama-3.1-8B-Instruct、Ministral-8B-Instruct-2410
提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体
提出 CRIME 框架,组合良性 Agent 技能诱发恶意行为
CRIME 把公共技能库中各自通过审查的技能配成两两组合,看联合执行能否实现指定恶意任务。。
评估应用决策层的输入注入与隐私推断风险
Jev 是 TypeSafe 的 System One 模型,把应用 state 和固定问题变成 Choice、Noul 或 Score 的类型化决策与概率。作者用官方 API 和可改训练的 NanoJev,考察它作为决策层时的操纵、泄露与双重用途。
提出能力洗钱攻击,拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
提出 CFD 跨会话分解攻击,利用工件来源缺口绕过工具型 Agent 的本地检查
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示
提出双重隐写越狱 Odysseus,用图像隐写绕过多模态系统安全过滤器
提出自适应攻击框架,击穿越狱与提示注入防御
提出 STAC 框架,把恶意目标拆成多轮看似无害的工具调用链
摘要作者提出并验证了智能体在序列化工具攻击下的普遍脆弱性,指出针对累积动作序列防御的必要性。