跳到正文
原文
arXiv:越狱、提示注入、投毒与防御· arXiv:2610.10742· William Hackett, Peter Garraghan·本站收录 · 原文发表 精选关注度58

BRANCH 方法绕过 6 套多扫描器护栏系统,攻击成功率 100%

BRANCH: Bypassing Multi-Scanner AI Guardrails

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

BRANCH对6个多扫描器护栏做绕过,120场景ASR为100%,平均查询比Exhaustive少72.13%。

威胁模型攻击者目标是生成bypass:同时躲开目标护栏全部scanner,并保留种子恶意意图。

问题
多扫描器护栏要同时检测多类恶意指令,作者认为共享潜表示会让压低一个scanner的扰动抬高另一个。既有单目标绕过主要评在单个scanner上,作者称还没有工作评估必须同时绕过系统内全部scanner的情形。
方法
BRANCH建搜索树,每节点只对当前最高拦截置信的scanner施加一组扰动,再用全部仍拦截scanner的置信和选择下一节点,直到没有任何scanner拦截。技术可替换;实验用11种既有扰动串成路径。
实验与结果
6个护栏系统、120个场景中,作者称BRANCH的ASR为100%,Exhaustive为80.8%,平均查询少72.13%,耗时2.9小时对13.1小时。绕过无额外优化时迁到32个未见护栏中的29个,ASR平均提高32.9个百分点。
局限与可以继续做的
作者指出种子每系统仅20条且按多scanner拦截筛选,全量对比约1,923.8小时;生成依赖逐scanner置信,查询预算还可再调,也未充分测生产LLM上的绕过效用。实验另覆盖11种扰动和32个未见护栏。
实验设置Meta Llama Guard 3 8B、Meta Llama Guard 7B 等 · PIGuard、LLM Guard 等 · ASR、Query Efficiency 等
威胁模型
攻击者目标是生成bypass:同时躲开目标护栏全部scanner,并保留种子恶意意图。访问为black-box access:可提交任意提示词,观察逐scanner拦截与置信,无权重、梯度、结构或训练数据。能力上不设查询预算或速率限制,可先攻开源或自托管护栏,再用于含未见类型的生产系统。
被测模型
Meta Llama Guard 3 8BMeta Llama Guard 7BMeta Llama Guard 3 1BMeta Llama Guard 4 12BGoogle ShieldGemmaDuoGuard 1.5BDuoGuard 0.5BProtectAI DeBERTa Base v1ProtectAI DeBERTa Small v2NVIDIA Llama 3.1 NeMoTron Safety 8B v3IBM Granite GuardianMeta Prompt Guard v1Vijil PI v2Vijil PI v1NVIDIA NeMoGuard Jailbreak DetectPrompt injection & jailbreak sentinel v2Unbiased toxic robertaAutonlp gibberish detector
基准
PIGuardLLM GuardVijil DomeGuardrails AISamsung GuardLlamaFirewallEnsemble Guardrail
指标
ASRQuery EfficiencyWall-Clock TimeSurface SimilaritySemantic PreservationAdversarial utility
AI 导读和推荐理由研究者提出 BRANCH,一种针对多扫描器护栏系统的绕过方法,通过分支树搜索对单个扫描器施加对抗扰动,再按整个护栏系统的总阻断置信度选择分支,把多目标绕过拆解为单目标优化。在 6 套护栏系统、120 个绕过场景中,BRANCH 达到 100% 攻击成功率,相比现有技术减少 72% 查询量、墙钟时间缩短 4.5 倍,同时保持语义相似度与既有方法相当。生成的绕过样本还迁移到 29 个未参与生成的护栏上,平均攻击成功率提升 32.9 个百分点,其中包含 8 个商业黑盒护栏,部分场景提升达 100%。作者称这是首个可靠绕过整套多扫描器护栏系统而非单个扫描器的方法,并指出其威胁模型假设攻击者能观察每个扫描器的阻断决策与置信度分数。

研究者提出 BRANCH,一种针对多扫描器护栏系统的绕过方法,通过分支树搜索对单个扫描器施加对抗扰动,再按整个护栏系统的总阻断置信度选择分支,把多目标绕过拆解为单目标优化。在 6 套护栏系统、120 个绕过场景中,BRANCH 达到 100% 攻击成功率,相比现有技术减少 72% 查询量、墙钟时间缩短 4.5 倍,同时保持语义相似度与既有方法相当。生成的绕过样本还迁移到 29 个未参与生成的护栏上,平均攻击成功率提升 32.9 个百分点,其中包含 8 个商业黑盒护栏,部分场景提升达 100%。作者称这是首个可靠绕过整套多扫描器护栏系统而非单个扫描器的方法,并指出其威胁模型假设攻击者能观察每个扫描器的阻断决策与置信度分数。

推荐理由论文给出多扫描器护栏系统的绕过方法与跨 29 个未见护栏的迁移数据,可用来评估自家护栏组合的鲁棒性。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    多扫描器护栏要求同时绕过全部scanner,单目标规避难以兼顾或查询代价很高。

    多扫描器护栏要求同时绕过全部scanner,单目标规避难以兼顾或查询代价很高。

    • 场景:作者称GenAI系统用护栏监视模型输入输出。单个scanner只检测一类内容,易被字符注入和词替换绕过;多scanner系统用联合决策补盲区,攻击者必须同时绕过每一个scanner。
    • 现有不足:作者假设多个scanner构成多目标优化。共享潜表示使越过一个决策边界的扰动可能抬高另一个scanner的置信;单目标技术把各路置信压成一个标量,造成scanner interference。
    • 观察:在LLM Guard上,3,191条PIGuard样本里20.15%在扰动前就激活至少两个scanner(Figure 1a)。PWWS与TextBugger的主导scanner分别切换14次与7次(Figure 2)。
    • 提出:作者提出BRANCH,用分支树把多目标拆成逐个scanner的扰动,并按全系统阻塞置信之和选支。作者称据其所知,这是首个绕过整个多扫描器系统、而非单个scanner的方法。
    • 威胁模型:
      • 目标:生成bypass,使目标系统中所有scanner同时不拦截,并保留种子的恶意意图。
      • 访问:作者称为black-box access。可提交任意提示词,观察每个scanner的拦截决定和置信;不能访问权重、梯度、内部结构或训练数据。
      • 知识:需要特定scanner与整个系统的拦截决定和置信。不需要知道被防护模型、其训练数据或所在AI系统。
      • 能力:作者假设不受查询预算或速率限制。可对开源或自托管护栏生成绕过,再用于生产系统,包括未见类型。
  2. 有哪些相关研究?

    相关工作覆盖单扫描器规避与护栏集成,作者称既有评测未要求同时绕过全部scanner。

    论文沿护栏形态、文本规避和护栏绕过三条线引用前人,实验对照是11种单目标技术加Exhaustive。

    护栏与扫描器

    • 检测手段:Ayyamperumal and Ge (2024)、Dong et al. (2024) 写护栏用文本分类、正则和模式匹配检测毒性、提示注入和越狱。Rebedea et al. (2023)、Zheng et al. (2024) 涉及可编程护栏与LLM-as-a-judge。
    • 分类scanner:Li et al. (2025)、Dubey et al. (2024)、Microsoft Corporation (2024) 被用来说明transformer(如BERT)微调分类器能泛化到未见输入。作者称这类scanner只覆盖所训练类别。
    • 多scanner系统:Protect AI (2025)、Vijil AI (2024)、Chennabasappa et al. (2025),以及Microsoft、Zeng et al. (2024)、Markov et al. (2023a),被引为把多个scanner合成一次决策的生产系统。作者称这使攻击者不能只打一个scanner的弱点。

    文本规避

    • 扰动来源:Alzantot et al. (2018) 用遗传算法演化输入;Garg and Ramakrishnan (2020)、Li et al. (2020) 用BERT masking替换token;Li et al. (2019)、Jin et al. (2020)、Gao et al. (2018) 做同形字、错拼或字符变换。
    • 词重要性:Jin et al. (2020)、Ren et al. (2019) 按删词后的置信变化排序,优先改高影响词。Morris et al. (2020) 的TextAttack被用作这些技术的实现框架。
    • 多分数与相关特征:Miettinen (1999) 被引来说明把多个分数压成一个标量会有取舍。Demontis et al. (2019) 被引来解释相关特征空间里,降低一个分类器置信的扰动可能抬高另一个。

    护栏绕过

    • 单scanner评测:Hackett et al. (2025)、Wang et al. (2026)、Zhou et al. (2026) 被放在近期护栏绕过里。Zhou et al. (2026) 把内容放到护栏输入窗口之外;Wang et al. (2026) 利用护栏分类器与LLM的表示不对称。作者指出这些研究评的是多个单scanner护栏,没有考虑必须同时躲开系统内全部scanner。
    • 分类器变异:Bassani et al. (2025) 讨论护栏模型对变异和对抗攻击的情况。Pruthi et al. (2019)、Kuleshov et al. (2018)、Wang et al. (2021) 被列为先用于文本分类器、后被用到护栏的技术。

    基线与基准

    • 基线方法:Table A.1的11种技术(TextFooler、DeepWordBug、TextBugger、PWWS、Pruthi、PSO、BAE、CLARE、IGA、Faster Alzantot、Kuleshov),以及11种都跑、任一成功即算成功的Exhaustive。
    • 基准:PIGuard的提示注入与越狱样本;Table 1的6个护栏系统;迁移阶段另用32个生成时未见的护栏。

    作者把本文放在“绕过整个多扫描器系统”而不是再优化单个scanner上,并称据其所知这是首个能可靠绕过更复杂护栏系统整体的方法。

  3. 论文如何解决这个问题?

    BRANCH用分支树逐个压制当前最高置信scanner,再按全系统阻塞置信之和选支。

    BRANCH用搜索树把“同时躲开所有scanner”拆成一串单scanner扰动,再用全系统仍在拦截的置信之和挑选下一分支。作者称它不绑定具体恶意指令,也不绑定某一种扰动技术。

    问题设定

    • 系统:护栏系统G含k个scanner。scanner s对提示词p给出拦截决定bs(p)∈{0,1}和置信cs(p)∈[0,1]。
    • 拦截规则:正文写,任一scanner因超过配置阈值而拦截,则系统拦截;没有任何scanner拦截则算绕过。实验用各系统默认阈值,没有默认则设为0.50。
    • 进度与目标:只累加仍在拦截的scanner置信,作为离绕过还有多远。当前目标scanner是仍在拦截者中置信最高的一个,节点只优化它,不管其他scanner置信如何变化。
    • 两个定义:总阻塞置信为C(p)=∑s∈ G bs(p)· cs(p),即仍拦截scanner的置信之和。目标scanner为σ∗(p)=argmaxs∈ G: bs(p)=1 cs(p)。

    搜索树

    • 节点:从种子P起树。节点保存提示词、目标scanner、C(p)和深度;边记录候选来自哪个节点。
    • 预算:实验取最大深度Dmax=120、最大扩展节点Nmax=120,每节点最多5,000次查询。单技术与Exhaustive的查询不设上限,直到该技术搜索耗尽。
    • 选点:每步取得扩展节点里C(p)最小者。Algorithm 1在找到任一绕过后提前返回。作者把通向绕过的分支称为optimal path。

    三阶段

    1. Bypass:对当前目标scanner跑一组扰动,称为bypass job。因为一次只面对一个scanner,原有单目标技术仍按自己的单一置信信号工作。
    2. Validate:候选重新送进整个护栏系统。全不拦截的进入成功集并停止;仍被拦截的记为blocked。
    3. Grow:树中未出现且仍被拦截的候选成为子节点,深度加1。下一轮用该候选自己的最高置信scanner做目标,从而把上一种技术的输出交给下一种。

    实验里的技术与判定

    • 技术集合:实验用Table A.1的11种技术,粒度分字符注入和词替换。论文把它们当作可替换集合,没有把某一种写成BRANCH的必要部件。
    • 两种对照:Individual是每种技术单独从种子跑。Exhaustive是11种都跑,任一成功即该场景成功。
    • ASR:成功躲开该系统全部scanner的提示词比例。查询效率是每次绕过尝试的平均查询数,wall-clock是平均耗时。
    • 不参与停止的指标:表面相似度是字符级序列比;语义保持是句向量余弦相似度(Reimers and Gurevych, 2019),论文未给出具体句向量模型名。对抗效用用消融后的Qwen 3 8B生成输出,再由gpt-5.6-terra按1–5分比较与原种子输出的相似度。
  4. 论文做了哪些实验?

    作者称120场景BRANCH的ASR为100%,查询219,138对Exhaustive的786,269。

    实验设置

    • 被测系统:Table 1的6个护栏:LLM Guard(8个scanner)、Vijil Dome(3)、Guardrails AI(3)、Samsung Guard(2)、LlamaFirewall(2)、自建Ensemble Guardrail(3)。Ensemble由提示注入/越狱、毒性、乱码三类开源模型组成(Rogue Security, 2025;Hanu and Unitary team, 2020;Jindal, 2021)。
    • 种子:PIGuard中先用3,191条提示注入与越狱样本做静态激活。主实验取被最多scanner拦截的20条,每系统20条,共120个场景。
    • 对照与预算:11种单技术与Exhaustive查询不设上限。BRANCH每节点最多5,000查询,Nmax=Dmax=120。
    • 判定:ASR为全部scanner都不拦截的比例。阈值用系统默认,否则0.50。另报平均查询、wall-clock、表面相似度、语义保持。
    • 效用评审:消融Qwen 3 8B出对照输出,gpt-5.6-terra打1–5分。论文未报告人工一致性,也未报告搜索的重复次数。
    • 机器:Ubuntu 20.04、128GB内存、Intel Xeon Gold 6336Y、两块A100(80GB),场景串行。

    主结果

    ASR相对每系统20条种子,据Table A.3。

    表格较宽,可左右滑动

    护栏系统BRANCHExhaustiveCLARE
    LLM Guard1008585
    Vijil Dome1009070
    Guardrails AI1009090
    Samsung Guard1009595
    LlamaFirewall1009585
    Ensemble Guardrail1003025
    • 作者称总ASR为100.0%对80.8%(Figure 4a),与上表六行平均一致。其余单技术总ASR:Kuleshov 58.3%,TextFooler 54.2%,TextBugger 40.8%,PWWS 37.5%,IGA 23.3%,DeepWordBug 22.5%,Faster Alzantot 15.8%,BAE 10.8%,Pruthi与PSO各3.3%。
    • 作者称没有Exhaustive成功而BRANCH失败的场景,BRANCH多覆盖23个场景(附录Figure A.3:97个共有、23个仅BRANCH)。Ensemble Guardrail上既有方法最低,作者归因于初始激活的scanner更多。
    • 平均查询为BRANCH 219,138、Exhaustive 786,269。作者称少72.13%,即3.58倍更少查询;摘要与结论写72%。耗时2.9小时对13.1小时,正文称4.51倍,摘要与结论写4.5倍。CLARE为5.8小时。

    语义保持与对抗效用

    • 测绕过相对种子的表面相似度、语义保持,以及消融Qwen 3 8B的输出是否仍像原种子。Table A.3的n是成功绕过条数,不是20条种子。
    • 语义保持BRANCH对Exhaustive:Guardrails AI 0.65±0.17(n=68)对0.81±0.13(n=62);LLM Guard 0.86±0.10(n=75)对0.87±0.10(n=78);LlamaFirewall 0.81±0.12(n=97)对0.82±0.11(n=112);Samsung Guard 0.83±0.11(n=56)对0.85±0.11(n=75);Vijil Dome 0.81±0.11(n=65)对0.84±0.10(n=78);Ensemble 0.72±0.16(n=53)对0.76±0.09(n=6)。正文把Vijil Dome写成0.83对0.85,与表中Samsung Guard一行相同,此处以表为准。
    • 作者称表面相似度平均0.60,Exhaustive为0.71。效用分不低于3的比例,BRANCH为85%、Exhaustive为90%;打满5分的为54%对51%(Figure 8)。作者称绕过仍保留种子意图。

    向未见护栏迁移

    • 全部BRANCH成功绕过被送到32个生成时未见的白盒与黑盒护栏。20条种子中,只要有一条派生绕过躲开该护栏,即算该种子转移成功。生成阶段不再优化。
    • 作者称29/32转移成功,逐scanner ASR从5%到100%;其中5个在每条种子上都被绕过,点名Meta Llama Guard 3 8B、NVIDIA NeMoGuard Jailbreak Detect、Vijil PI v2。平均ASR提高32.9个百分点。摘要写某些情况下攻击成功提高到至多100%。
    • 最大增幅作者写作上述Jailbreak Detect、Vijil PI v2与Azure Content Safety各90%。8个商业black-box不提供置信,作者给出的增幅为Lakera Guard 5%、Amazon Bedrock Guardrail 15%、Azure Foundry Guardrails 35%、Google Model Armor与Mistral Moderation 35%、Azure Prompt Shield 50%、Azure Content Safety 90%、OpenAI Omni Moderation 55%。同一段又把DuoGuard 0.5B与OpenAI Omni Moderation的55%放在“基线居中”一句,未分开写明。

    单目标技术的扫描器切换

    • 扰动前,LLM Guard对3,191条样本:32.28%不激活任何scanner,47.57%恰好一个,20.15%至少两个(Figure 1a)。Code激活1,287次,PromptInjection 1,100次,TokenLimit为0(Figure 1b)。
    • 一条种子上,PWWS用1,637次查询、主导scanner切换14次;TextBugger用1,033次查询、切换7次(Figure 2,图例阈值0.5)。作者称技术反复只压当前主导scanner,词重要性排序也只对初始主导scanner计算。

    其他消融与分析

    • 同预算反事实:作者称Exhaustive的ASR会从80.8%降到沿用CLARE时的75.0%,随机选技术则为53.9%(Section 6.1)。
    • 最优路径用量:BAE单独绕过13条、出现在路径上115次;Pruthi为4与41;Kuleshov为70与41(Figure 6)。
    • 表面相似度随深度:Guardrails AI从1.0到深度21的0.23;Samsung Guard到深度13的0.14(Section 6.2)。
    • 语义保持随深度:LLM Guard在深度2–10为0.85–0.88,更深为0.72–0.77(Section 6.2)。
    • 作者称各技术在Ensemble Guardrail上查询最高,正文未给分系统查询数。
    • 从来源看,Guardrails AI迁到Meta Llama Guard 3 1B与3 8B的ASR为70%与77%;Vijil Dome对Azure Foundry与NVIDIA Llama 3.1 NeMoTron Safety Guard 8B v3最高,后两者正文未给ASR(Section 6.3,附录Figure A.7)。
  5. 有什么可以进一步探索的点?

    作者指出种子仅20条/系统、依赖逐scanner置信,且未充分测生产LLM上的绕过效用。

    作者指出的局限与后续方向

    • 种子(Section 7):每系统20条、共120个场景,按被最多scanner拦截来选。全部对比耗时1,923.8小时,作者称约80天。无上限搜索限制了可评场景数。作者认为这批种子足以展示既有技术的困难,后续可换其他数据集的候选。
    • 查询预算(Section 7):每节点5,000次查询低于Exhaustive的无上限预算。作者认为可按父节点和所选技术再调预算,从而更少查询、更浅深度结束。
    • 可见性(Section 7):生成阶段假设能看到逐scanner置信和拦截决定。作者称在置信与激活被隐藏的strict black-box生产场景中会不那么有效;迁移实验说明可离线生成后再转移到未见目标。
    • 下游效用(Section 7):工作主要测能否绕过护栏。虽有语义保持、表面相似度和消融模型输出比较,作者称没有对生产LLM做充分实验,后续应评估绕过提示的效用,以及BRANCH和各技术对提示词ASR的影响。

    实验覆盖范围

    • 主结果为Table 1的6个护栏系统,PIGuard筛选出的每系统20条种子,共120个场景(Section 5、6.1)。
    • 对照为Table A.1的11种技术及Exhaustive;BRANCH预算为每节点5,000查询、Nmax=120、Dmax=120(Section 5)。
    • 迁移为32个生成时未见护栏,其中8个商业black-box不提供置信;转移按20条种子、至少一条派生绕过躲开该护栏来计(Section 6.3,Figure 9)。
    • 语义侧用表面相似度、句向量余弦相似度,以及消融Qwen 3 8B加gpt-5.6-terra的1–5分;论文未报告评审与人工的一致性(Section 5、6.2)。
    • 静态激活在LLM Guard的8个scanner上用3,191条PIGuard样本测量,附录Figure A.1给出6个目标的激活分布(Section 3)。
  6. 总结一下论文的主要内容

    BRANCH以分支树链式扰动绕过多扫描器护栏,作者称120场景ASR为100%且可迁移到未见护栏。

    BRANCH是面向多扫描器护栏的绕过方法:用搜索树把多种单目标扰动串起来,而不是一次优化所有scanner。

    • 作者要解决的是,生产护栏常由多个scanner联合拦截,攻击者必须同时躲开全部scanner。他们把困难归于共享潜表示,以及PWWS、TextBugger一类方法把多路置信压成一个标量后,主导scanner反复切换。
    • 搜索每步只扰动当前置信最高的拦截scanner,用阻塞置信之和选择下一节点,候选再对整个系统复检。实验把Table A.1的11种技术放进这棵树,方法本身不规定必须用哪一种。威胁模型是作者所称的black-box access:能读逐scanner拦截和置信,不能读权重或梯度。
    • 6个系统、每系统20条PIGuard种子、共120个场景中,作者称BRANCH的ASR为100.0%,Exhaustive为80.8%。平均查询219,138对786,269,正文称少72.13%,摘要与结论写72%。耗时2.9小时对13.1小时,正文称4.51倍,摘要与结论写4.5倍。
    • Ensemble Guardrail上Exhaustive为30%、CLARE为25%(Table A.3),是表中既有方法最低的系统。表面相似度作者称BRANCH平均0.60、Exhaustive为0.71;Guardrails AI上语义保持为0.65对0.81。
    • 不做额外优化时,绕过迁到32个未见护栏中的29个,作者称ASR平均提高32.9个百分点;摘要称某些情况提高到至多100%。其中8个是不提供置信的商业black-box。
    • 作者的结论是,单目标规避面对多scanner系统要么绕不过,要么计算代价很高;BRANCH可以在语义保持与既有方法相近的情况下提高绕过率。他们希望结果用于构造更复杂防御上的规避技术,并帮助实践者评估自己的护栏系统。
阅读原文arxiv.org