跳到正文
原文
论文追踪· arXiv:2606.16751· Qi Wang, Chengcheng Wan, Weijia He et al.·本站收录 · 原文发表

UNIATTACK:面向多层防御的自动化越狱攻击框架

Automated jailbreak attack targeting multiple defense strategies

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

UniAttack做单轮黑盒越狱,作者报告平均ASR 87.17%,多层防御上相对基线提升64.63%–248.82%。

威胁模型黑盒、单轮。攻击者只掌握公开输入输出类型、高层安全指南和历史查询行为,不知架构、参数、梯度、训练数据、系统提示词和过滤规则。

问题
单种黑盒攻击难同时压过多层防御,静态模板又跟不上模型更新。不限查询的试错还会把穷举失败和内在漏洞混在一起。作者要做单轮、低查询的多层安全评估。
方法
UniAttack从覆盖不同防御层的子攻击中抽出最小特征,用DeepSeek-V3.1浓缩、校验并改写成模板,再填入恶意查询做单轮探测。特征ASR须至少达到原子攻击的50%,模板须超过每一个来源子攻击。
实验与结果
作者报告AdvBench 520条上,9个LLM的UniAttack平均ASR为87.17%,相对基线平均提升64.63%–248.82%。Claude-3.5-Sonnet为35.57%;无审查Llama上LLM-FUZZER更高。
局限与可以继续做的
作者指出单轮设计测不到多轮漏洞,并假定无在线防御更新。辅助模型为最新DeepSeek与GPT系列,种子未必覆盖真实攻击。实验有9个目标模型和4个基线;未报告Judge-LLM型号与Detoxify阈值。
实验设置DeepSeek-Chat、DeepSeek-Reasoner 等 · AdvBench · ASR、T-CSA 等
威胁模型
黑盒、单轮。攻击者只掌握公开输入输出类型、高层安全指南和历史查询行为,不知架构、参数、梯度、训练数据、系统提示词和过滤规则。每次只提交一条完全自控的文本提示,可用辅助模型生成模板,不能多轮追问。目标是绕过输入过滤、对齐与输出拒绝,诱使模型生成违规内容。受害系统假定为不透明的三层防护。
被测模型
DeepSeek-ChatDeepSeek-ReasonerGPT-4.1-NanoGPT-3.5-TurboGemini-2.0-FlashGemini-2.5-ProClaude-3-HaikuClaude-3.5-SonnetDolphin-2.9-Llama3-8B
基准
AdvBench
指标
ASRT-CSAC-CSA
AI 导读研究者提出 UNIATTACK,一个从防御视角出发、系统构造黑盒攻击提示词的对抗测试框架。它从已有攻击中提取少量高影响攻击特征,用专门的攻击者 LLM 优化,再通过自动精炼组合成灵活模板,实现可跨多个模型和安全类别泛化的一次性攻击。评测显示,在部署多层防御机制的模型上,UNIATTACK 相比基线平均攻击成功率(ASR)提升 64.63%-248.82%,成本仅为基线的 0.03%-4.96%。

研究者提出 UNIATTACK,一个从防御视角出发、系统构造黑盒攻击提示词的对抗测试框架。它从已有攻击中提取少量高影响攻击特征,用专门的攻击者 LLM 优化,再通过自动精炼组合成灵活模板,实现可跨多个模型和安全类别泛化的一次性攻击。评测显示,在部署多层防御机制的模型上,UNIATTACK 相比基线平均攻击成功率(ASR)提升 64.63%-248.82%,成本仅为基线的 0.03%-4.96%。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    多层防御下单种黑盒攻击易失效,UniAttack用特征融合做单轮探测。

    黑盒越狱在多层防御下缺少可复用、低查询的系统评估。

    • 场景: 作者称 LLM 已进入医疗、军事、金融等场景,对齐后仍会被对抗提示绕过。RLHF 与 prompt decontamination 覆盖不全,对自适应攻击有泛化缺口。
    • 现有不足: 作者列了三点。单种攻击难同时压过输入过滤、对齐和输出审核;静态模板绑在特定版本上,更新后常要人工重做;查询不设上限时,失败分不清是结构漏洞还是穷举试错。
    • 核心观察: 作者认为,把互补的最小攻击特征写入同一提示,可在单轮内同时施压多层防御,且不依赖模型专属调参或防御内部知识。
    • 本文提出: UniAttack,基于融合的单轮 black-box 对抗测试框架。作者称这是首次把多种攻击策略融进统一框架。
    • 威胁模型:
      • 目标: 在 single-turn 中诱使目标 LLM 生成有害、违反策略的内容。既要绕过输入过滤、模型对齐和输出拒绝,也要评估其生成错误信息、违法活动、暴力、仇恨言论、隐私泄露或恶意代码的倾向。
      • 知识: black-box。只有公开的输入输出类型、披露的高层安全指南,以及历史查询中的经验行为。论文只考虑文本。不知架构、参数、梯度、训练或对齐数据、内部系统提示词、过滤规则和安全分类器逻辑。
      • 能力: 每次只提交一条完全自控的复杂提示,不能追问。一条提示内可同时使用多种提示工程手法,并可用辅助模型改写或生成模板。
      • 受害系统: 假定与商用系统一致的三层防护:输入过滤、模型对齐、输出控制(拒绝、敏感信息遮蔽、自我批评)。这些组件对攻击者不透明。
  2. 有哪些相关研究?

    相关工作分黑盒测试、纵深防御和其他威胁;作者把本文定位为特征融合。
    • 黑盒对抗测试: Goal Hijacking(Chen and Yao, 2024)、语义改写(Huang et al., 2025)、SequentialBreak(Saiem et al., 2025)及固定模板做直接改写或预设包装。论文称这类方法往往难以随防御边界演化而泛化;引言还称模型专属裁剪或迭代适配在组合防御下仍然窄而脆。
    • 迭代与演化: PAIR(Chao et al., 2025)、LLM-FUZZER(Yu et al., 2024)、Tree of Attacks(Mehrotra et al., 2024)用反馈或搜索提高效力。论文称查询成本高并受速率限制;树或图扩展仍是静态的,不用模型反馈发现新弱点。AutoDAN(Zhu et al., 2023)用选择与变异精炼提示,论文称稳定性不足。
    • 表层扰动: CIPHER(Yuan et al., 2023)用编码规避输入过滤,DAN(Shen et al., 2024)做角色扮演,另有自动 fuzzing。论文称这些工作多停留在表层利用。
    • 防御与对齐: 输入去污染(Kumar et al., 2023)、RLHF/RLAIF 与 Constitutional AI(Ouyang et al., 2022;Bai et al., 2022)、Llama Guard 式输出审核(Inan et al., 2023)构成纵深防御。论文称它们常靠模式匹配,出现未理解意图的反射式拒绝(Wei et al., 2023)。CoT、AutoDefense 和 DeepSeek-R1 的审议缓冲被论文称为另一类问题,与本文目标不同。
    • 其他威胁: 后门投毒、训练数据抽取、Sponge Attack、经不可信插件的间接提示注入。论文称 UniAttack 只做直接对抗提示,与这些工作正交。
    • 基线与基准: 实验基线为 LLM-FUZZER、PAIR、CIPHER、DEEPINCEPTION(Table 3)。数据集为 AdvBench(Zou et al., 2023)的 harmful behaviors,共 520 条。

    作者称,pilot testing 把繁重迭代前移为可控流水线,再用特征抽取与融合兼顾效果和成本;并称首次把多种攻击策略融进统一框架。

  3. 论文如何解决这个问题?

    UniAttack四阶段抽取并校验特征,再融成须超过各子攻击的单轮模板。

    UniAttack 把已有子攻击蒸馏成可复用特征,再融成一条单轮提示,用来同时施压多层防御。

    攻击初始化

    • 子攻击库: 按策略多样性、已报告的经验效果和可复现性挑选方法,并按防御层归类(Table 1)。输入层含目标劫持、语义改写、序列分解;中间层含上下文混淆、many-shot pressure;输出层含表示变换、伪装成无害。作者称清单不求穷尽,可再加入。
    • Pilot attack: 每轮至少选三种、覆盖不同防御层的子攻击,对专有模型 DeepSeek 和开源模型 Llama3 收集提示–回复对,作为后续抽取的输入。论文未说明该诊断集的规模。

    特征抽取与校验

    • 特征定义: 从复杂提示中抽出仍保留原对抗逻辑、去掉冗余上下文的最小可用指令。辅助模型为 DeepSeek-V3.1,经系统提示和 few-shot 调整。
    • 浓缩形式: 辅助模型只输出一句,或是直接核心指令(Type A),或是高层抽象策略(Type B);论文称它只做元分析,不生成具体实体或示例。Figure 4–6 给出浓缩、用例生成和模板改写的完整提示词。
    • 入库标准: 在相同模型与数据上,蒸馏特征的 ASR 须至少达到原方法 ASR 的 50%。超过五轮仍不达标则丢弃,并改选其他子攻击。用例生成同样使用 DeepSeek-V3.1。

    模板构造

    • 融合动机: 作者引用 Swiss cheese model,认为安全靠多层维持,评估应让一条探测同时打到各层的缺口。特征先合成种子模板,再由 DeepSeek-V3.1 按人工模板做 few-shot 改写。
    • 晋级条件: 模板的目标 ASR 必须超过每一个特征来源子攻击。未达标则把提示–回复对送回优化;五轮后仍不达标就更换 few-shot 种子。
    • 优化操作: 用高分模板做 in-context learning,消解内部语义冲突,并改写敏感词与恶意意图的表述。论文未给出最终模板条数。

    测试与成功判定

    • 实例化: 模板留占位符,填入查询集中的恶意意图,每条样本只做单轮交互。
    • 判定: 本地毒性分类器 Detoxify 做第一层筛查,绕过该层的输出再交给经指令调整的 Judge-LLM 做语义审计。只有被这条统一流水线标出的回复记为成功。报告含逐条结果和平均 ASR。论文未说明两级如何合并,也未给出 Detoxify 阈值或 Judge-LLM 的模型名。
  4. 论文做了哪些实验?

    作者报告平均ASR 87.17%;无审查Llama上LLM-FUZZER高于UniAttack。

    实验设置

    • 目标模型: Table 2 共 9 个。DeepSeek-Chat(V3.2-Advanced)、DeepSeek-Reasoner(V3.2-Thinking)、GPT-4.1-Nano、GPT-3.5-Turbo、Gemini-2.0-Flash、Gemini-2.5-Pro、Claude-3-Haiku、Claude-3.5-Sonnet 有多层防御;Dolphin-2.9-Llama3-8B 标为无审查。
    • 数据: AdvBench harmful behaviors 全部 520 条。论文写明每个攻击方法对每个目标模型生成 520 次测试。方法节又写每个优化模板映射到每条查询;论文未说明最终模板数,也未说明二者如何对应。
    • 基线: LLM-FUZZER、PAIR 为多轮,CIPHER、DEEPINCEPTION 为单轮(Table 3)。多轮方法的最大迭代预算 K=20;作者称 PAIR 原文写 20 次查询内成功,LLM-FUZZER 无此信息,故统一取 20。
    • 指标: ASR 为成功攻击占全部攻击的比例。T-CSA 为消耗 token 与成功攻击之比,C-CSA 为 LLM 查询次数与成功攻击之比。
    • 评审: UniAttack 与基线共用同一流水线:Detoxify 初筛,再由 Judge-LLM 审计。论文未说明 Detoxify 阈值、Judge-LLM 型号、重复次数。
    • 辅助模型: 方法节写特征与模板使用 DeepSeek-V3.1。Section 6.1 称评估中攻击者可用的辅助模型只有最新版 DeepSeek 和 GPT 系列,未给出该 GPT 的检查点。

    主结果

    下表为 Table 5 的 Full System。9 个模型超过 8 行,省略 DeepSeek-Reasoner:ASR 87.30%,T-CSA 286.3,C-CSA 1.14。基线的逐模型 ASR 大多只出现在 Figure 8,正文未逐格给出,故不填。

    表格较宽,可左右滑动

    模型ASRT-CSAC-CSA出处
    Gemini-2.0-Flash99.00%353.31.009Table 5
    DeepSeek-Chat98.65%253.41.01Table 5
    GPT-4.1-Nano98.46%396.01.01Table 5
    Llama-3-8B98.07%2551.02Table 5
    Gemini-2.5-Pro96.92%361.11.03Table 5
    GPT-3.5-Turbo96.35%404.71.03Table 5
    Claude-3-Haiku85.18%586.91.17Table 5
    Claude-3.5-Sonnet35.57%1405.42.81Table 5
    • 平均 ASR: 作者据 Figure 8 报告 UniAttack 平均 ASR 为 87.17%,相对基线平均(24.99%–52.95%)提升 64.63%–248.82%。摘要把这一提升限定在多层防御模型上;RQ1 把 87.17% 写成全部目标模型上的平均。
    • Claude-3.5-Sonnet: 作者称各基线在此失效,PAIR 的 ASR 为 2.11%,UniAttack 为 35.57%,并称相对最佳基线有 16.8 倍提升。
    • 成本: 作者称 GPT、DeepSeek、Gemini 上 T-CSA 低于 405;引言称成功攻击的 token 消耗仅为基线的 0.03%–4.96%,并在 1.01–2.81 次查询内找到漏洞。作者称基线 T-CSA 常到数万甚至数百万,论文未给出这些基线的逐模型 token 数。除两款 Claude 外,作者称 C-CSA 接近 1.0。

    多层防御对比

    • 测了什么: Table 4 比较 Llama-3 无审查与多层防御。后者包含 keyword filtering、safety alignment 和 refusal policies。论文未说明该防御版的检查点,以及三层如何叠加。
    • 结果: 无审查时 UniAttack 98.07%、PAIR 29.04%、CIPHER 92.88%、DEEPINCEPTION 71.73%、LLM-FUZZER 99.62%。多层防御后依次为 59.61%、5.77%、1.34%、10.57%、41.92%。
    • 作者解读: 作者称单策略会被某一层拦住,UniAttack 同时施压输入过滤、推理层和输出策略。LLM-FUZZER 降幅小于其他基线,作者将其归于多轮 fuzzing 的资源消耗,而不是特征更多。无审查设定下 LLM-FUZZER 高于 UniAttack。

    消融

    • 设置: Table 5 比较 Full System、w/o-Feature(固定预定义特征)、w/o-Template(直接用特征库造提示)、w/o-Both。表中“–”表示该配置对该模型无效。论文未说明消融是否使用全部 520 条。
    • 结果: 作者称 GPT-3.5-Turbo 上 w/o-Template 为 83.34%,w/o-Feature 降到 26.66%;DeepSeek-V3.2-Chat 上 w/o-Feature 85.00% 高于 w/o-Template 60.00%。Claude-3.5-Sonnet 上二者为 0.00% 和 9.00%,完整系统为 35.57%。w/o-Both 在 8 个有防御的模型上为 0.00%,在 Llama-3-8B 上为 62.30%。
    • 作者解读: 作者认为两个模块不单独普遍有效,只有同时使用才能在 GPT 与 Gemini 系列上超过 96%。作者称 DeepSeek 的过滤更会拦截特定语义模式,而不是底层结构逻辑。

    其他消融与分析

    • w/o-Feature 的 ASR:GPT-4.1-Nano 13.33%,Claude-3-Haiku 15.00%,Llama-3-8B 89.61%(Table 5)。
    • w/o-Template 的 C-CSA:Claude-3.5-Sonnet 为 10.32;其 T-CSA 为 5158.4(Table 5)。
    • w/o-Feature 在 GPT-4.1-Nano 的 T-CSA 为 2712.4、C-CSA 为 6.95;Claude-3.5-Sonnet 一行记为“–”(Table 5)。
    • 作者以 Figure 7 称,针对 GPT-4.1 的恶意代码请求,只做场景嵌套或只做编码的基线被拦住,融合模板引出了所请求内容。该例无单独成功率。
  5. 有什么可以进一步探索的点?

    作者指出单轮设计测不到多轮漏洞,辅助模型与种子的外推也不清楚。

    作者指出的局限与后续方向

    • 多轮漏洞: 单轮设计不能检测只在多轮交互中出现的漏洞,可能低估只能由连续攻击或恶意长对话暴露的问题(Section 6.1)。
    • 在线防御: 假定目标 LLM 保持稳定,不部署在线训练式防御(Section 6.1)。
    • 辅助模型: 评估只用最新版 DeepSeek 和 GPT 系列做特征抽取与模板构造,换用其他 LLM 时结果如何泛化不清楚(Section 6.1)。
    • 种子覆盖: 所选种子提示未必代表全部真实攻击提示和场景(Section 6.1)。
    • 防御方向: 作者在 Section 6.2 倡导把安全检查写入内部推理,分目标抽取、对抗意图审计、生成过程中的反思三步,而不是事后加外部过滤器。

    实验覆盖范围

    • 被测模型为 Table 2 的 9 个:两款 DeepSeek、两款 GPT、两款 Gemini、两款 Claude,以及 Dolphin-2.9-Llama3-8B。
    • 基线为 LLM-FUZZER、PAIR、CIPHER、DEEPINCEPTION;多轮方法的迭代预算为 K=20(Section 5.1)。
    • 评测集为 AdvBench harmful behaviors 全部 520 条,每个方法对每个目标模型 520 次测试(Section 5.1.6)。
    • 防御对比为 Llama-3 无审查,以及 keyword filtering、safety alignment、refusal policies 组成的多层防御(Table 4)。消融为 Full、w/o-Feature、w/o-Template、w/o-Both(Table 5)。
    • 论文未报告 Judge-LLM 的具体模型、Detoxify 阈值、重复次数、消融样本量、最终模板条数,以及最终实验采用的具体子攻击组合;辅助侧 GPT 的检查点也未报告。
  6. 总结一下论文的主要内容

    作者称特征融合的单轮攻击在ASR和token消耗上优于四个基线。

    UniAttack 是面向多层防御的单轮 black-box 越狱测试框架。

    • 问题: 单种攻击打不穿输入过滤、对齐和输出审核的组合;静态模板跟不上模型更新;不限查询又会把穷举试错和结构漏洞混在一起。
    • 做法: 从至少三种、覆盖不同防御层的子攻击抽出最小特征,由 DeepSeek-V3.1 校验到不低于原方法 ASR 的 50%,再组成必须超过每个来源子攻击的模板。模板填入 AdvBench 做单轮探测,成功与否由 Detoxify 加 Judge-LLM 判定。攻击者不知参数、梯度和内部规则。
    • 主结果: 作者报告平均 ASR 为 87.17%,相对基线平均 24.99%–52.95% 提升 64.63%–248.82%;摘要把该提升放在多层防御模型上。Table 5 中 Gemini-2.0-Flash 为 99.00%,Claude-3.5-Sonnet 为 35.57%(T-CSA 1405.4,C-CSA 2.81)。作者称后者相对最佳基线提升 16.8 倍,并给出 PAIR 为 2.11%。
    • 例外: Table 4 中无审查 Llama 上 LLM-FUZZER 为 99.62%,高于 UniAttack 的 98.07%。加上 keyword filtering、safety alignment 和 refusal policies 后,UniAttack 为 59.61%,同表基线最高为 LLM-FUZZER 的 41.92%。去掉特征抽取和模板构造后,8 个有防御模型的 ASR 为 0.00%,无审查 Llama 仍为 62.30%。
    • 成本与结论: 作者称成功攻击的 token 消耗仅为基线的 0.03%–4.96%,并在 1.01–2.81 次查询内找到漏洞。作者认为高 ASR 不必依赖大规模蛮力查询,并建议把安全检查写进模型推理,而不是只做表层模式匹配。
阅读原文arxiv.org