从期望危害到似然:LLM 智能体越狱的概率重构
提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体
- arXiv
- 2610.09973
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 白盒
- 被测模型
- Llama-3.1-8B-Instruct、Ministral-8B-Instruct-2410
提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体
提出 WebMirage,用局部对抗图像劫持视觉网页 Agent 的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见
摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱
Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。
提出只训练或篡改多智能体潜在通信链路来提高有害遵从
学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。
提出 AdaLCPI,把恶意指令拆成碎片嵌入工具返回并诱导 Agent 越权执行
提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
提出跨通道分段攻击,利用 MCP 隐式信任外发敏感文件
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
提出 SN-Guided Diffusion,利用安全神经元实现离线越狱
论文系统评估了扩散大语言模型(DLLM)在安全对齐中的双重角色——既作为白盒攻击目标,又作为黑盒越狱生成的对抗工具。
提出 SYNCHAIN,诱导计算机使用 Agent 自建跨任务持久攻击链
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出 SMT 框架,用模拟审核轨迹越狱函数调用 LLM
提出 Relink 攻击,在 Agent 压缩边界将分散良性片段重组为恶意指令
本文研究了智能体基于摘要的提示词压缩所引入的新型安全漏洞——重链(Relinking),并提出了系统化的攻击构建方法与边界审计防御机制。
提出日志基底提示注入,操纵 SOC 分析员的分类、摘要与处置建议
摘要在 gpt-4o-mini 上,人格劫持与上下文操纵可改写 SOC 分析输出,直接覆盖在分类上无效。
提出 DREAM 框架,评测 Agent 的跨环境长链攻击脆弱性
摘要DREAM 提出基于知识图谱与策略搜索的动态红队框架,分析了长链跨环境攻击对当前主流智能体的系统性威胁。