SLIP:无需外部攻击模型的多轮自我越狱,在 11 个模型上平均成功率 94.7%
Break Me If You Can: Self-Jailbreaking of Aligned LLMs via Lexical Insertion Prompting
作者提出无攻击模型的SLIP,在AdvBench上对11个模型取得平均94.7%的ASR且平均仅需7.9次查询。
黑盒设定(black-box),攻击者无需外部攻击模型(no external attacker LLM),利用目标模型自身潜在知识,在多轮对话中通过良性安全数据构建框架生成种子池并迭代插入词汇锚点,目标是在最短轮数内使自动化判定器判定补全满足恶意目标。
- 现有越狱多依赖外部攻击者模型或手工提示词,查询开销大且单轮载荷易被检测。对齐模型本身具备有害知识,但因安全对齐在直接请求时被压制,如何在无外部攻击模型下利用目标模型自身潜在知识实现黑盒越狱成为关键问题。
- 提出 SLIP 方法,将越狱建模为多轮对话树的广度优先搜索。首先利用良性安全数据构建框架诱导目标模型生成种子对,随后通过词频与向量相似度识别与攻击目标的词汇差距,迭代向良性提示词中插入缺失锚点词,并按索引要求模型展开补全。
- 在 AdvBench 和 HarmBench 上,SLIP 对 11 个模型取得 94.7% 和 94.4% 的平均 ASR,平均单次成功仅需 7.9 次查询。在 AdvBench 的 GPT-5.1 上,新提出的 SDM 防御在 5% FPR 下取得 76% 检测率,而自适应攻击可将 ASR 提至 43%。
- 只在英文提示词上评估,未测试多语言或多模态;SDM 与漂移分析依赖静态句子编码器;评估仅覆盖 11 个模型及两套基准;论文未报告非英语表现、自适应攻击在全部模型上的表现及更大规模人工标注结果。
- 模型
- GPT-5.1GPT-4oClaude-Sonnet-4.5Claude-Opus-4.5Gemini-2.5-ProGemini-2.5-Flash-LiteDeepSeek-V3Llama-3.3-70B-InstructLlama-3.1-8B-InstructMistral-7B-InstructMistral-7B
- 基准
- AdvBenchHarmBench
- 指标
- ASRQuery budget (API calls per success)
研究者提出 SLIP(Self-Jailbreaking via Lexical Insertion Prompting),一种无需外部攻击模型的黑盒越狱方法:先以生成安全训练数据为名让目标模型自己产出良性/有害提示-补全对,再通过多轮对话逐步插入攻击目标中缺失的关键词,用广度优先树搜索寻找最短越狱路径。在 AdvBench 和 HarmBench 上,SLIP 对 11 个模型(含 GPT-5.1、Claude-Sonnet-4.5、Gemini-2.5-Pro、DeepSeek-V3)取得 90–100% 攻击成功率,平均 94.7%(AdvBench)和 94.4%(HarmBench),平均仅约 7.9 次模型调用,比此前方法少 3–6 倍。Claude-Opus-4.5 最难攻破,为 61.4%/68.7%。
推荐理由论文提出无需外部攻击模型的自我越狱方法,在 11 个模型上给出成功率与查询成本,并附一个对话级检测防御。
深度解读
这篇论文试图解决什么问题?
论文研究对齐大模型能否在无需外部攻击模型的情况下,仅利用自身潜在知识引导多轮对话实现自我越狱。
论文试图解决已对齐大语言模型是否可以在无需外部攻击者模型协助的情况下,仅凭自身内在知识实现自我越狱的问题。
- 多轮交互下的安全对齐挑战:作者指出,大语言模型在实际部署中面临越狱风险;尽管单轮恶意提示词常被静态检测拦截,但攻击逐渐转向通过多轮对话逐步引导模型输出有害内容。
- 现有攻击对外部攻击模型的依赖与开销:论文提出,现有多轮越狱方法(如 PAIR、TAP、Crescendo)通常需要额外配置攻击者大语言模型来生成对抗性提示词,增加了部署负担,且通常需要 40 至 50 次查询才能完成一次攻击。
- 自我越狱的核心观察:作者认为,已对齐模型本身已经具备生成有害内容所需的知识,安全对齐仅压制了有害表达而并未消除能力;当通过构建安全训练数据等良性框架进行引导时,目标模型会自行生成有害示例。
- 威胁模型设定:根据论文设定,攻击者在黑盒环境中与目标模型交互:
- 攻击者目标:寻找最短的多轮对话序列,使得自动化判定器判定输出满足指定的恶意攻击目标 P*。
- 攻击者知识:对目标模型为黑盒访问(black-box),无法获取模型权重或内部梯度。
- 攻击者能力:无需外部攻击模型(no external attacker LLM),仅通过发送文本消息并维护对话历史;中间轮次仅使用索引引用先前样本,避免在单轮中出现显式有害请求。
- 受害系统:经过安全对齐的黑盒商业及开源大语言模型。
- 解决方案的提出:针对上述问题,论文提出了基于词汇插入提示的自我越狱算法(SLIP),通过广度优先树搜索迭代填补良性提示词与攻击目标之间的词汇差距。
有哪些相关研究?
论文梳理了模型对齐、单轮越狱与多轮越狱工作,重点对比了依赖外部攻击模型的基线及树搜索方法。
- 大语言模型对齐与防御
- 训练期与测试期防御:Ouyang et al. (2022) 与 Ziegler et al. (2019) 采用指令微调和基于人类反馈的强化学习(RLHF)进行对齐;Bai et al. (2022) 提出宪法与对抗性微调。在测试期,PromptGuard (AI, 2024)、ICD (Wei et al., 2024) 和 PAT (Mo et al., 2024) 用于输入端检测,SmoothLLM (Robey et al., 2025) 则在解码期平滑危险输出。
- 基于目标的防御:Jain et al. (2024) 提出指令层级防御,通过系统提示词优先保障安全目标。
- 单轮越狱攻击
- 梯度与离散搜索:白盒梯度优化方法如 GCG (Zou et al., 2023)、I-GCG (Jia et al., 2025)、AutoDAN (Liu et al., 2024) 和 MAC (Zhang & Wei, 2025) 在白盒场景可达较高成功率,但向闭源模型迁移受限。
- 黑盒触发词优化:PAIR (Chao et al., 2025) 和 TAP (Mehrotra et al., 2024) 利用外部攻击者模型优化自然语言触发词;Andriushchenko et al. (2025) 采用自适应攻击,Yadav et al. (2025) 则通过信息过载实现越狱。
- 多轮越狱攻击
- 会话逐步升级与角色网络:Crescendo (Russinovich et al., 2025) 通过自然会话流逐步升级有害内容;CoA (Yang et al., 2024) 链接语义对齐的跟进问题;X-Teaming (Rahman et al., 2025) 采用自适应多智能体协作;ActorBreaker (Ren et al., 2024) 将恶意意图隐藏在良性角色叙事中;RACE (Ying et al., 2025) 在多轮对话中嵌入推理机制。
- 树搜索与推理漏洞:Tempest (Zhou & Arel, 2025) 在多轮对话上应用树搜索;Yong & Bach (2025) 发现微调模型在思维链中会自发展开有害输出,作者称其为“自我越狱”的突发现象。
- 基线方法与基准数据集
- 对比基线:论文选取的单轮基线包括 AutoDAN、PAIR、TAP;多轮基线包括 X-Teaming、ActorBreaker、Crescendo。
- 评测基准:实验采用 AdvBench (Zou et al., 2023) 和 HarmBench (Mazeika et al., 2024) 两个安全基准。
- 本文与已有工作的区别定位 作者指出,Tempest 等树搜索方法通常需要 40 至 50 次查询,查询量约为 SLIP 的 5 倍;Yong & Bach (2025) 的研究属于良性微调带来的非预期副效应,而 SLIP 是一种针对任意已对齐黑盒模型的主动推理期攻击,且全程无需外部攻击者模型生成对抗提示词。
- 大语言模型对齐与防御
论文如何解决这个问题?
SLIP 构建安全数据种子池并利用词频与嵌入相似度识别词汇差距,以广度优先搜索驱动模型逐步展开有害回答。
论文提出了基于词汇插入提示的自我越狱方法 SLIP(Self-Jailbreaking via Lexical Insertion Prompting),将越狱过程形式化为多轮对话树上的广度优先搜索,通过目标模型自身生成种子并定向插入词汇锚点,引导模型逐步逼近攻击目标。
树初始化:种子池构建
- 安全数据生成框架:根节点向目标模型 T 发送良性种子提示词,要求其在未提及攻击目标 P* 的情况下,生成包含 30 组提示词与补全对的列表。作者指出,对齐模型在直接请求时会拒绝有害表达,但在“为安全防护模型构建训练数据”的良性包装下会直接生成有害示例。
- 良性与有害混合机制:种子池必须同时包含良性与有害样本,作者认为纯有害请求会暴露越狱意图并触发拒绝。
- 一次性摊销与历史植入:种子池 P 在每个目标模型上仅生成一次并在该模型的所有攻击请求中复用,以摊销生成成本;即便目标模型单次拒绝,SLIP 也会在 API 历史中硬编码该交互以保证流程继续。
广度优先探索:节点检查与节点扩展
搜索算法按广度优先方式展开,每个出队节点包含对话历史 H、样本池 P 和深度 d,分为两个处理阶段:
- 阶段一:节点检查(Node Inspection):
- Top-k 筛选:利用冻结的句子编码器(paraphrase-MiniLM-L6-v2),计算样本池中所有提示词 p 与目标 P* 的嵌入余弦相似度,选取相似度最高的 k 个样本组成候选集 Ck。
- 补全展开:针对候选集中的每个样本,向目标模型发送展开提示词,要求其详细补全第 i 个样本。提示词仅通过索引 i 引用而不复述有害文本,以规避基于文本匹配的安全过滤。
- 判定与终止:展开后的补全 c* 由自动化评审器 J 判定,若满足恶意目标,则搜索终止并返回补全。搜索的核心目标为寻找满足以下条件的最短轮次序列:
- 阶段二:节点扩展(Node Expansion):若阶段一未成功,算法定位当前候选提示词 p 与目标 P* 之间的词汇差距:
- 锚点词识别:通过词性标注提取名词、动词、形容词和副词,排除功能词;利用预训练词向量计算 P* 中的内容词与 p 中内容词的最大余弦相似度,低于阈值 tau_word 的词被列为候选锚点词;随后按逆词频(wordfreq)降序排序,选取排名靠前的词构成词汇差距集合 Delta。
- 子节点生成:向目标模型发送锚点插入提示词,要求生成与第 i 个样本语义相似且包含锚点词 Delta 的新样本对;每个候选样本重复发送 Rretry 次独立请求,在不超过最大深度 Dmax 的条件下将新节点入队。
关键参数与搜索策略
- 搜索策略选择:SLIP 采用广度优先搜索(BFS)而非深度优先搜索(DFS),作者指出 BFS 能在深入前遍历当前深度所有节点,倾向于找到更短的越狱路径,避免在无效分支上过度消耗查询。
- 默认参数配置:种子池大小 N = 30,锚点词相似度阈值 tau_word = 0.8,最大树深度 Dmax = 3,分支因子 k = 3,每个节点重试次数 Rretry = 2。
输出规范与格式修复
- 结构化输出约束:SLIP 要求目标模型以 JSON 格式返回结果,包含 prompt、completion 和 type 字段。
- 降级修复机制:当目标模型返回格式畸变(如拼写错误、缺少括号或附带解释文本)导致直接解析失败时,调用 gpt-4o-mini 进行纯模式修复。作者说明该模型仅修正 JSON 格式,不修改提示词或补全内容,以维持黑盒假定。
论文做了哪些实验?
SLIP 在两项基准上取得约 94% 平均 ASR 且平均仅需 7.9 次查询,现有多轮防御表现出模型间差异。
实验设置
- 被测模型:共 11 个模型,闭源模型包括 GPT-5.1、GPT-4o、Claude-Sonnet-4.5、Claude-Opus-4.5、Gemini-2.5-Pro、Gemini-2.5-Flash-Lite、DeepSeek-V3;开源模型包括 Llama-3.3-70B-Instruct、Llama-3.1-8B-Instruct、Mistral-7B-Instruct、Mistral-7B。附录补充评估了 Vicuna-13B 和 Llama-2-7B-chat。所有模型均按黑盒系统处理。
- 数据集:AdvBench(520 条提示词,涵盖网络犯罪、威胁、非法指令)和 HarmBench(200 条精选提示词,涵盖仇恨言论、性内容、恐怖主义、自残)。
- 对比基线:单轮方法包括 AutoDAN(仅开源模型)、PAIR、TAP;多轮方法包括 X-Teaming、ActorBreaker、Crescendo。
- 评测指标:攻击成功率(ASR,衡量模型回答提供具体、可操作的有害信息的比例);查询预算(成功越狱所需的平均 API 调用次数,SLIP 包含目标模型调用与 JSON 修复调用,不含评审模型调用)。
- 评审方式:由 Llama-3.3-8B-Instruct、Llama-3.3-70B-Instruct 和 GPT-4o-mini 组成的集成评审模型进行多数表决,统一采用 HarmBench 分类器提示词。
- 样本量与重复次数:每个实验重复 5 次并报告平均 ASR;人工评估在 GPT-5.1 和 Llama-3.1-8B-Instruct 上抽取 120 个被判定成功的样本进行双盲标注。
主结果
据 Table 1,各方法在 AdvBench 上的 ASR(%)对比如下:
表格较宽,可左右滑动
模型 PAIR TAP ActorBreaker Crescendo X-Teaming SLIP GPT-5.1 49.2 79.4 82.7 88.1 96.9 98.6 GPT-4o 74.6 94.2 95.8 100 96.2 100 Claude-Sonnet-4.5 8.4 65.7 77.3 40.6 95.1 94.8 Claude-Opus-4.5 3.7 48.5 58.9 43.8 57.3 61.4 Gemini-2.5-Pro 51.3 80.2 83.4 88.9 95.7 100 Llama-3.3-70B-Instruct 35.8 38.4 85.5 72.2 87.2 97.4 DeepSeek-V3 52.4 71.8 79.6 82.4 99.0 98.9 Mistral-7B-Instruct 78.4 73.9 81.5 99.2 98.7 100 (注:据 Table 1,表中省略了 Gemini-2.5-Flash-Lite、Llama-3.1-8B-Instruct 与 Mistral-7B;AutoDAN 仅在开源模型上评估故未在此表中列出。所有被测模型均为目标模型本身,非代理模型。)
- 总体攻击表现:作者报告,SLIP 在 AdvBench 上取得 94.7% 的平均 ASR,在 HarmBench 上取得 94.4% 的平均 ASR;在 GPT-4o、Gemini-2.5-Pro 和 Mistral-7B-Instruct 上达到 100% 的 ASR。
- 高难度目标与模型差异:作者指出,Claude-Opus-4.5 是难度最高的目标,SLIP 在其上取得 61.4%(AdvBench)和 68.7%(HarmBench)的 ASR,高于所有基线(X-Teaming 分别为 57.3% 和 61.0%)。
- 例外情况:在 Claude-Sonnet-4.5 上,X-Teaming 的表现高于 SLIP(AdvBench 上 95.1% 对 94.8%,HarmBench 上 89.1% 对 86.3%),作者以此说明 SLIP 并非在所有模型上占据优势。
查询预算与开销分析
- 查询次数对比:在 AdvBench 上,SLIP 平均每个成功样本需 7.9 次 API 查询(含约 21% 至 24% 的 JSON 修复调用),低于 X-Teaming(9.5 次)、ActorBreaker(11.7 次)、TAP(26.4 次)和 PAIR(35.3 次)(Table 2、Table 5)。
- 与树搜索基线对比:同样基于树搜索的 Tempest 在 GPT-4 上达到 97% ASR 时需 40 至 50 次查询,作者称 SLIP 达到相近 ASR 所需查询量约为其五分之一。
- 全流程开销估算:附录 Table 7 显示,若计入三模型集成评审,SLIP 平均总 API 次数约为 104 次;若改为单模型评审,平均总 API 次数降至约 41 次,作者称单模型评审对 ASR 的影响在 3% 至 5% 以内。
现有防御评估与语义漂移监控
- 现有防御表现:作者在 AdvBench 上测试了四种防御(Table 2、Table 4)。目标优先级(Goal Prioritization)在 GPT-5.1(17.6%)和 Claude-Sonnet-4.5(11.1%)上将 ASR 大幅压低,但在 GPT-4o(85.8%)和 Mistral-7B-Instruct(87.6%)上依然较高;LlamaGuard-3 面对 SLIP 时平均 ASR 为 68.8%,PromptGuard-v2 为 78.1%,ICD 为 82.6%。作者指出现有单轮防御缺乏跨轮次记忆,难以抵御单轮良性的多轮轨迹。
- 语义漂移监控器(SDM):作者提出 SDM,通过追踪每轮会话与有害质心的余弦相似度统计量(最大值、均值和单步增量)进行防御;在 GPT-5.1 上,SDM 在 5% 假阳性率(FPR)下达到 76% 的检测率(第 6.2 节)。
- 自适应伪装攻击:作者设计了插入良性降温对话(如天气、烹饪)的自适应 SLIP,形成锯齿状漂移轨迹,在面对 SDM 时将 ASR 从 26% 提升至 43%,但平均查询量上升至 14 至 18 次(第 6.2 节)。
树搜索策略与超参数消融
- BFS 对比 DFS:在 Claude-Sonnet-4.5 上的 50 次运行中,BFS 平均需要 7.9 次查询,DFS 需要 10.6 次查询(Figure 4a);作者指出 DFS 存在过度深入失败分支再回溯的情况,具有更重的长尾开销。
- 树深度与分支数:随着深度 d 从 1 增至 3,GPT-5.1 的 ASR 持续上升,弱对齐模型在 d = 1 时已处于高位(Figure 4b);分支因子 k 从 1 增至 3 带来明显增益,设定 k = 3 平衡了多样性与查询开销(Figure 4c)。
其他消融与分析
- 种子池有害比例(GPT-4o,Table 3):0% 比例查询数为 9.2 次(ASR 100.0%),50% 为 3.9 次(ASR 100.0%),100% 为 4.6 次(ASR 96.8%)。
- 种子池有害比例(Claude-Sonnet-4.5,Table 3):0% 比例查询数为 12.4 次(ASR 97.1%),50% 为 7.7 次(ASR 96.2%),100% 为 9.3 次(ASR 91.4%)。
- 词汇阈值 tau_word 消融(GPT-4o,Table 6):0.6 为 96.8%,0.7 为 98.6%,0.8 为 100.0%,0.9 为 98.1%。
- 词汇阈值 tau_word 消融(Claude-Sonnet-4.5,Table 6):0.6 为 91.7%,0.7 为 93.8%,0.8 为 94.8%,0.9 为 92.4%。
- JSON 修复前后解析成功率(Table 9):AdvBench 修复前平均 79.1%、修复后 99.1%;HarmBench 修复前 73.0%、修复后 98.8%。
- 人工评估精度验证(120 例,第 5.1.2 节):94.2% 确认有害,3.1% 边缘,2.7% 假阳性,标注者间一致性系数 kappa = 0.87。
有什么可以进一步探索的点?
作者指出方法仅在英语提示词上验证,防御监控不足以抵御自适应攻击,且表征代理与内部状态可能存在差异。
作者指出的局限与后续方向
- 语言与模态单一:SLIP 仅在英语提示词上进行评估,未在多语言或多模态模型上测试;作者指出,在形态丰富的语言中,基于词汇锚点的脚手架可能效果减弱(Limitations)。
- 防御机制仍不充分:作者指出 SDM 仍不足以应对自适应攻击,更稳健的防御可能需要针对多轮对抗样本进行模型级微调,而非仅依赖事后会话监控(Limitations)。
- 边缘案例评估依赖更大规模标注:自动化评审在边缘案例上的评估有待更大规模的人工标注来强化检验(Limitations)。
- 表征代理与模型内在特征可能存在差异:嵌入漂移分析和 SDM 均依赖静态句子编码器作为代理,目标模型的内部表征可能与该表层视角存在差异,从而影响基于嵌入空间的防御有效性(Limitations)。
实验覆盖范围
- 模型覆盖范围:主实验覆盖 11 个黑盒大语言模型,附录补充了 Vicuna-13B 和 Llama-2-7B-chat 共 2 个模型;论文未在多模态模型上进行测试。
- 基准数据集范围:实验覆盖 AdvBench(520 条提示词)与 HarmBench(200 条提示词)两个英文基准数据集,未报告非英语语言的表现。
- 防御基线覆盖范围:防御实验覆盖了 ICD、PromptGuard v2、Goal Prioritization、LlamaGuard-3 以及作者提出的 SDM 共 5 种防御。
- 样本与重复规模:主实验各设置重复 5 次取平均值;人工评估样本量为 120 例(GPT-5.1 与 Llama-3.1-8B-Instruct 各 60 例)。
- 未报告信息:论文未报告自适应攻击在全部 11 个模型上的完整表现,仅在 GPT-5.1 上测试了自适应策略;论文未报告针对其他词向量提取工具的对比分析。
总结一下论文的主要内容
论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。
- 研究定位与核心问题:论文针对大语言模型的多轮安全风险,提出并探究了“自我越狱”这一威胁模型,旨在无需外部对抗攻击模型生成载荷的前提下,仅利用目标模型自身潜在知识实现黑盒越狱。
- 方法核心机制:设计了基于词汇插入提示的算法 SLIP,通过良性安全数据构建框架诱导目标模型初始化种子样本对,随后在多轮对话树中采用广度优先搜索,计算逆词频与词向量距离以迭代插入缺失的关键词锚点,并在展开阶段通过样本索引规避单轮安全拦截。
- 主要实验结果:在 AdvBench 和 HarmBench 基准上对 11 个模型进行测试,SLIP 分别取得 94.7% 和 94.4% 的平均 ASR;在 GPT-4o、Gemini-2.5-Pro 等模型上达到 100% ASR,且平均单次成功仅需 7.9 次 API 查询,查询量少于已有基线。
- 高难度模型与例外:在对齐严格的 Claude-Opus-4.5 上 SLIP 取得 61.4%(AdvBench)和 68.7%(HarmBench)的 ASR,高于对比基线;而在 Claude-Sonnet-4.5 上 X-Teaming 取得更高 ASR(AdvBench 上 95.1% 对 94.8%),体现出模型间的非绝对优势。
- 防御评测与监控机制:评估显示现有多轮与单轮防御因缺乏跨轮记忆难以有效阻拦 SLIP;作者设计的会话级语义漂移监控器(SDM)在 5% FPR 下取得 76% 检测率,但加入良性对话的自适应伪装策略仍可使 ASR 回升至 43%。
- 作者结论与安全启示:作者认为,已对齐模型保留了有害能力的潜在表示,安全对齐在实践中主要压制了表面输出而非抹除能力,未来的模型安全防御必须从单轮文本过滤走向多轮会话意图追踪,并针对多轮对抗样本实施模型级微调。