跳到正文
原文
论文追踪· arXiv:2605.17971· Ziwei Wang, Jing Chen, Ruichao Liang et al.·本站收录 · 原文发表

Babel 利用混淆分布采样越狱 LLM 安全注意力

Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

Babel对四个商用模型做黑盒混淆采样越狱,Harmbench上GPT-4o的ASR为82.67%(Table 1)。

威胁模型攻击者仅有black-box访问,可通过商业API输入攻击提示词并获得输出,不能访问模型内部。

问题
闭源商用LLM仍可被越狱。作者称安全对齐依赖少量稀疏的safety heads,大量表示空间缺少监控;现有黑盒方法多靠模板或穷举,缺少机制解释,也难兼顾成功率与查询效率。
方法
Babel用BERT嵌入余弦相似度的补数量化混淆度,假定越狱混淆度落在区间Iq。有害查询经string、token、sequence混淆后嵌入无害请求;再以模型反馈做符号检验,迭代收窄采样分布。附录给出模板与混淆流程。
实验与结果
Harmbench上Babel对GPT-4o、Gemini-2.0-flash、Grok-3、Claude-3-5-haiku的ASR为82.67%、78.33%、95.67%、75.67%(Table 1)。作者称多数模型上ANR也更低。
局限与可以继续做的
作者称工作限于文本越狱,未系统研究其他模态或外部防御,并列为后续方向。实验为四个闭源模型、Harmbench 300条和四种基线;论文未报告主实验n1、n2、Lmax、重复次数和人工一致性。
实验设置gpt-4o-2024-11-20、Gemini-2.0-flash 等 · Harmbench · ASR、ANR
威胁模型
攻击者仅有black-box访问,可通过商业API输入攻击提示词并获得输出,不能访问模型内部。目标是使闭源商用LLM对Harmbench有害查询给出有害内容。温度设为1,不用system prompt。成功先由gpt-4o判定,再人工去掉假阳性。
被测模型
gpt-4o-2024-11-20Gemini-2.0-flashClaude-3-5-haiku-20241120grok-3
基准
Harmbench
指标
ASRANR
AI 导读研究者提出 Babel,一种黑盒越狱攻击框架,通过系统化的混淆采样与迭代反馈驱动的分布优化,利用 LLM 安全机制中安全对齐仅依赖少量稀疏分布注意力头、大部分表示空间监控薄弱的特性。作者用数学模型刻画有效文本混淆的边界,并据此解释观察到的越狱行为。在前沿商业模型上的评测显示,Babel 在平均 40 次查询内将 GPT-4o 的攻击成功率从 41.33% 提升到 82.67%,将 Claude-3-5-haiku 从 38.33% 提升到 78.33%,作者称其达到当前最优的攻击成功率与查询效率。

研究者提出 Babel,一种黑盒越狱攻击框架,通过系统化的混淆采样与迭代反馈驱动的分布优化,利用 LLM 安全机制中安全对齐仅依赖少量稀疏分布注意力头、大部分表示空间监控薄弱的特性。作者用数学模型刻画有效文本混淆的边界,并据此解释观察到的越狱行为。在前沿商业模型上的评测显示,Babel 在平均 40 次查询内将 GPT-4o 的攻击成功率从 41.33% 提升到 82.67%,将 Claude-3-5-haiku 从 38.33% 提升到 78.33%,作者称其达到当前最优的攻击成功率与查询效率。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    黑盒越狱要利用稀疏safety heads留下的监控空隙,并控制混淆强度。

    闭源LLM的黑盒越狱,缺少对稀疏safety heads所留监控空隙的可控利用。

    • 场景:作者称LLM已广泛商用,但安全机制难以跟上攻击;精心构造的提示词可绕过过滤器,引出有害或有偏内容。作者认为红队是评估并加固安全边界的诊断手段。
    • 现有不足:白盒攻击依赖梯度和内部参数,可迁移性低。黑盒方法多靠模板搜索或启发式试错;作者称它们忽略模型内部安全机制,因而缺少可解释性,也难兼顾效果与查询效率。
    • 核心观察:作者引既有工作称,安全对齐主要由少量稀疏attention heads(safety heads)实现,大量表示空间未被监控。在GPT-4o上(Figure 1),作者称适度混淆可让安全机制认不出有害行为,而模型仍给出有害输出;过强会破坏意图,过弱仍会被检出。
    • 威胁模型:
      • 目标:让闭源商用LLM对有害查询输出有害内容,而不是拒绝。
      • 知识:论文写为fully black-box与black-box,攻击者无内部参数与梯度。
      • 能力:经商业API提交攻击提示词并读取输出;温度设为1,不使用system prompt。
      • 受害系统:gpt-4o-2024-11-20、Gemini-2.0-flash、Claude-3-5-haiku-20241120、grok-3。
    • 本文做法:提出Safety Head-Bypass Jailbreaking Model,用混淆度区间刻画这条边界;据此实现黑盒框架Babel,以分布感知的混淆采样和反馈迭代利用该空隙。
  2. 有哪些相关研究?

    相关工作分成稀疏安全机制,以及忽视该机制的越狱方法。

    安全机制的稀疏结构

    • Zhou et al. [2024b]找出safety-critical attention heads:去掉它们会增加有害回复,但只改动可忽略比例的参数。论文还引述,去掉单个safety head会提高Llama-2-7b-chat被越狱的机会;Zhou et al. [2024a]称有害输入在较早层被识别,中间层的负向预测再被收成拒绝token。
    • Chen et al. [2024]报告不到1%的神经元稳定参与处理有害查询,安全对齐集中在紧凑参数子空间。
    • Wei et al. [2024]称安全关键区域只占参数空间的一小部分,剪枝或低秩修改即可扰乱,对下游效用影响很小。论文还转述,神经元级剪枝在小扰动下也会削弱对齐;LRM的后训练推理能力可能压制而非消除原有安全机制。

    越狱攻击

    • 白盒方法以Zou et al. [2023b]、Yang et al. [2025b]为代表,用梯度优化生成对抗后缀。论文称其可解释性高、可迁移性低,且需要内部参数和梯度。
    • 黑盒方面,手工提示词在论坛流传(reddit, 2025)。启发式搜索包括Liu et al. [2023]、Hughes et al. [2024];Pu et al. [2024]、Lin et al. [2025]借助模型感知或注意力机制做跨模型迁移;Liu et al. [2024b]、Zheng et al. [2024]按规则构造,可一次尝试完成越狱。论文称这些方法在开源和闭源模型上有效,但忽视内部安全机制,无法兼顾效果与效率。

    基线与数据

    • 主实验基线为Bon、PiF、FlipAttack、TAP,论文引用Hughes et al. [2024]、Lin et al. [2025]、Liu et al. [2024b]、Mehrotra et al. [2024]。第3.3节将Bon对应Hughes et al. [2024];参考文献标题中FlipAttack对应Liu et al. [2024b],Tree of Attacks对应Mehrotra et al. [2024]。数据集为Harmbench,300条有害查询。Bon的查询数被限制为50。GCG、AutoDAN、PAIR被作者称已被更新方法超越,未纳入评测。

    作者把本文与上述黑盒方法的区别放在:不从模板试错出发,而用数学越狱模型刻画safety heads覆盖空隙,再以分布优化的混淆采样在black-box下利用它。

  3. 论文如何解决这个问题?

    Babel量化混淆度,嵌入无害请求,再按反馈收窄采样分布。

    作者把越狱写成把有害语义移出safety heads的覆盖范围。Babel分三步:混淆有害查询、嵌入无害请求、按反馈把采样分布推向越狱区间内概率密度更高的区域。

    问题设定与混淆度

    • 黑盒下不能删除safety head。作者改为用文本混淆挪动语义,并形式化为Safety Head-Bypass Jailbreaking Model。
    • 混淆度用BERT嵌入的余弦相似度补数定义:

    Oq = 1 − (eq · eo)/(|eq||eo|) 数值越大,混淆越强。

    • 成功越狱被假定落在Iq=(aq,bq)。不要求各模型向量空间对齐,而是在这一量化下为每个目标估计区间。作者称区间内仍会有失败样本,但该错位对大规模统计预测的影响可忽略。
    • 为解释Bon的随机混淆,作者设混淆度服从正态;单次落入区间的概率为该正态在Iq上的积分,n次采样的ASRq写成1减(1-p)的n次方,数据集ASR为m条查询的平均。他们还写出Bon的ASR与n满足-log(log(ASR))=log a+b log n。每条查询生成7,200个样本。Figure 2、Figure 3未标明目标模型。

    有害查询混淆

    • 对象分string、token、sequence,以便分粒度调节混淆度。作者称string扰动对理解的影响通常小于token扰动。具体流程在附录B的Algorithm 2。
    • string含大小写转换、相邻字母替换、交换字符、删除空白。token用masking model预测后随机换成另一个token。sequence交换token,或在随机位置插入该模型预测的token。论文未给出masking model名称。
    • 每类有受影响token上限,对应当前混淆等级。大小写转换上限为查询字母数的一半。顺序固定为token、sequence、character,以免字符扰动改掉token。等级从1递增,直到越狱或达到Lmax。

    有害查询嵌入

    • 混淆查询被放进不应被拒绝的无害请求,以进一步压低safety heads触发。四类为Translation、Statistics、Transformation、Retrieval,分别要求模型先做翻译、统计、变换或检索,再回应请求。
    • 作者引用既有结果称,让模型以Sure起笔可以提升攻击表现,因此模板还约束开头方式。附录A给出完整模板和四类请求示例。
    • 作者给出的选择理由是:这些请求会把混淆查询当成有意义的语句,而不是随机字符。

    分布优化采样

    • 小规模采样在当前分布上取ns个样本(Algorithm 1记为n1)。区间中点写为μ0=(ar+br)/2,零假设为样本均值等于μ0。超过μ0的个数K在零假设下服从Binomial(n, 1/2),用双侧符号检验,α=0.05。作者称若不拒绝零假设,则高密度区与越狱区间重叠较大。
    • Algorithm 1同时看反馈类别:小规模中一旦出现Jailbreak就返回该提示词。否则统计拒绝数k1与无害回复数k2;仅当k1>K1且k2<K2时,用拒绝样本的最大混淆度和无害样本的最小混淆度估计(Dmin, Dmax),再做大规模采样。K1、K2为α/2下的二项拒绝域。
    • 大规模采样只保留相似度落在该区间的样本,并按反馈收紧区间。混淆度与所属区间不一致的计数达到阈值后,放弃当前等级。论文未给出主实验的n1、n2、Lmax和该阈值。输出类别至少包括Jailbreak、Reject、Harmless。
  4. 论文做了哪些实验?

    Table 1中Babel的ASR为75.67%至95.67%,Grok-3最高。

    实验设置

    • 目标模型:gpt-4o-2024-11-20、Gemini-2.0-flash、Claude-3-5-haiku-20241120、grok-3。温度均为1,无system prompt。设定为fully black-box,经商业API查询。Table 1将前三者简写为GPT-4o、Gemini-2.0-flash、Claude-3-5-haiku。
    • 数据:Harmbench,300条有害查询。
    • 基线:Bon、PiF、FlipAttack、TAP;保留原设置,只改目标模型和数据集。Bon查询上限50。GCG、AutoDAN、PAIR未纳入。
    • 指标:ASR;ANR,论文写作Aeverage Number of Requests。
    • 评审:gpt-4o自动评估有害性,提示词模板来自Hughes et al. [2024]。论文未写评审阈值,也未说明该gpt-4o是否与目标gpt-4o-2024-11-20为同一检查点。所有被标为有害的输出再人工复核,以去掉假阳性;论文未写是否复核被判无害的输出。
    • 重复:作者称评测整集ASR时每条查询并非只执行一次,故不做多次实验,结果不含方差。

    主结果

    据Table 1,Harmbench上的ASR(%)与ANR为:

    表格较宽,可左右滑动

    方法GPT-4oGemini-2.0-flashGrok-3Claude-3-5-haiku
    Babel82.67 / 2678.33 / 3895.67 / 1375.67 / 40
    Bon41.33 / 3515.67 / 4331.00 / 381.67 / 49
    PiF37.67 / 3672.67 / 2582.00 / 172.67 / 49
    FlipAttack26.67 / 160.00 / 145.33 / 138.33 / 1
    TAP35.33 / 4738.67 / 4177.67 / 322.33 / 48
    • 作者称四个基线在部分模型上ASR较高,但整体有限。Bon在查询受限时各模型都较差。PiF在Gemini-2.0-flash与Grok-3上为72.67%和82.00%,在其余模型较弱,作者称可迁移性有限。
    • 作者称Babel在四个模型上都取得最高ASR,并称达到state-of-the-art。摘要写GPT-4o从41.33%增至82.67%,与Table 1中Bon和Babel一致;摘要又写Claude-3-5-haiku从38.33%增至78.33%,且称平均40次查询内。Table 1中Babel对Claude-3-5-haiku为75.67%、ANR为40,38.33%是FlipAttack的ASR。引言与表的75.67%一致。
    • 作者据Figure 7称Grok-3的成功样本混淆度分布更低,因而其安全机制更容易被绕过,并称对比方法未能显示这一特征。Figure 7是四张density–Value图,正文未给出均值或峰值。

    查询效率

    • 作者把单次请求即可完成的方法排除出效率对比,称其效果和可扩展性有限。Table 1中FlipAttack的ANR在四模型上均为1。
    • 作者称Babel的每个请求既是越狱尝试也是采样点,因此在取得最高ASR时请求数仍然较低;Bon的请求来自随机搜索,PiF需在不同位置多次替换或插入token。
    • 按这一比较,Table 1中Babel的ANR在GPT-4o、Grok-3、Claude-3-5-haiku上低于Bon、PiF、TAP。Gemini-2.0-flash上PiF为25,低于Babel的38。作者写的是大多数模型上ANR最低。

    嵌入消融

    • 去掉嵌入模板作为baseline,比较各类无害请求。正文四类为Translation、Statistics、Transformation、Retrieval;Figure 5横轴写作Baseline、Retrieval、Translate、Count、Transform,并同时画ASR与ANR。作者称效果因模型而异,所选Retrieval综合最好,且在四个模型上优于该baseline。正文未给出各柱数值。
    • 作者称去掉harmful query embedding后,成功样本的混淆度分布提高(Figure 8),并据此称该方法能抑制安全机制且可迁移。Figure 8为四模型的density–Value图,正文未标注均值。

    采样消融

    • baseline关闭分布调整,最大请求数n0=50,请求均匀分到各等级。比较小规模采样规模n=6、10、15、20、25;大规模采样规模N为n的两倍。Figure 6横轴含Baseline (N=50)与这些n。
    • 作者称除Grok-3外,该方法在所有模型上ASR和效率优于该baseline。作者对Grok-3的解释是其整体安全性低于另外三个模型,所以优势不那么明显。
    • 作者称在GPT-4o和Claude-3-5-haiku上,分布优化采样使ASR随ANR近乎线性上升,而不是Bon的幂律。Figure 6未在正文给出各n的ASR数字。

    其他消融与分析

    • 预测实验:每条查询7,200个Bon混淆样本;Figure 3的R²在m=5、20、100、150时为0.824、0.863、0.986、0.998(n位于10^1至10^3)。论文未说明该实验的目标模型与数据集。
    • 式(3)为-log(log(ASR))=log a+b log n;正文又称m=150时-log ASR(n)的范围接近真实实验。Figure 3纵轴标注为log10(ASR(n))。论文未说明三种写法如何对应。
    • Figure 1的经验观察只在GPT-4o上进行,正文无ASR数字。Figure 2图例含normal fit,横轴Value标到0.05–0.30,纵轴density标到12;作者称近似正态并通过Kolmogorov-Smirnov检验,论文未报告检验统计量或p值。
    • 计算:80GB A100、CUDA 12.4运行BERT;另在Google Cloud 2核CPU上运行。论文未报告主实验总查询耗时。
    • Table 1的低ASR:Claude-3-5-haiku上Bon为1.67%、PiF为2.67%、TAP为2.33%。
    • 附录D给出四个模型的提示词与输出示例,论文称有害内容已隐藏;此处不复述示例。
  5. 有什么可以进一步探索的点?

    作者称分析限于文本越狱,未评外部防御,并列为后续方向。

    作者指出的局限与后续方向

    • 工作聚焦文本越狱,以便细分析LLM的内部安全机制(Limitations)。
    • 所得认识可能与其他模态或基于扩展的攻击有关,但系统探索超出本研究范围(Limitations)。
    • 未明确评估与现有外部防御策略的交互,主要目标是理解模型级安全行为(Limitations)。
    • 作者把上述扩展和评估视为后续研究方向(Limitations)。

    实验覆盖范围

    • 被测模型为gpt-4o-2024-11-20、Gemini-2.0-flash、Claude-3-5-haiku-20241120、grok-3,共4个;温度1,无system prompt,经商业API做black-box查询(Section 5.1)。
    • 数据集为Harmbench,300条有害查询;指标为ASR与ANR。有害性由gpt-4o自动判定,再人工复核被标为有害的输出(Section 5.1)。
    • 对比基线为Bon(查询上限50)、PiF、FlipAttack、TAP。作者说明GCG、AutoDAN、PAIR因已被更新方法超越而未纳入(Section 5.1)。
    • 消融包括四类无害请求嵌入(Figure 5)和分布优化采样的n=6、10、15、20、25(Figure 6)。混淆度预测实验对每条查询生成7,200个样本,Figure 3的m取到150;论文未说明该预测实验的目标模型。
    • 论文未报告主实验的n1、n2、Lmax、masking model名称、重复次数与方差,也未报告人工复核与gpt-4o判定的一致性。主实验不做多次重复是Section 5.1写明的做法。
  6. 总结一下论文的主要内容

    Babel以混淆分布优化做黑盒越狱,四模型ASR为75.67%至95.67%。

    Babel是面向闭源LLM的black-box越狱框架,用受控文本混淆利用稀疏safety heads未覆盖的表示空间。

    • 问题:作者称安全对齐主要由少量稀疏attention heads实现,有效混淆的边界很窄。现有黑盒方法被作者称为忽视这一机制,因而难同时提高ASR并减少查询。
    • 方法:BERT嵌入的余弦相似度补数定义混淆度,成功样本被假定落在区间Iq。混淆作用在string、token、sequence三层,查询再嵌入四类无害请求。α=0.05的符号检验决定当前分布是否对准区间中点,再在估计区间内加大采样并收紧边界。
    • 结果:Harmbench 300条、温度1、无system prompt时,Table 1中Babel的ASR/ANR为GPT-4o 82.67%/26、Gemini-2.0-flash 78.33%/38、Grok-3 95.67%/13、Claude-3-5-haiku 75.67%/40。同表Bon对GPT-4o为41.33%,对Claude-3-5-haiku为1.67%。作者称四模型ASR均为同表最高,并称达到state-of-the-art;作者称大多数模型上ANR更低,但Gemini-2.0-flash上PiF的ANR为25,低于Babel的38。
    • 作者结论:作者称该黑盒方法暴露了LLM安全机制中的漏洞,并为加强安全提供启示。Limitations写明只分析文本越狱,未评外部防御。
阅读原文arxiv.org