跳到正文
原文
论文追踪· arXiv:2510.09023· Milad Nasr, Nicholas Carlini, Chawin Sitawarin, Sander V. Schulhoff, Jamie Hayes, Michael Ilie, Juliette Pluto, Shuang Song, Harsh Chaudhari, Ilia Shumailov, Abhradeep Thakurta, Kai Yuanqing Xiao, And·本站收录 · 原文发表 精选关注度64

论文提出自适应攻击框架,击穿 12 项 LLM 越狱与提示注入防御

The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against Llm Jailbreaks and Prompt Injections

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

作者提出自适应攻击框架,采用梯度、强化学习、搜索与人工红队,使 12 种越狱与提示注入防御中多数 ASR 超过 90%。

威胁模型攻击者目标为诱导越狱输出有害内容或通过提示注入窃取数据与执行未授权工具调用。

问题
现有针对大模型越狱与提示注入的防御评估多采用静态有害提示词或未适配防御的低算力弱优化方法,无法准确反映防御在面对针对性设计的强攻击者时的真实表现。
方法
作者提出统一的自适应攻击框架(提议、评分、选择、更新循环),并分别实例化为基于梯度、强化学习(GRPO 优化)、搜索(MAP Elites 与大模型变异)以及人工红队四类自适应攻击。
实验与结果
作者评估了 12 种近期防御,自适应攻击在多数防御上的 ASR 达到 90% 以上;在 AgentDojo 选定场景中,人工红队在全部测试场景均达成攻击(ASR 达 100%)。
局限与可以继续做的
实验跳过了控制流完全独立于数据的规划执行型防御;未报告自动化搜索在多次独立重启下的表现;大模型评分器自身存在易被对抗样本规避与奖励破解的问题。
实验设置Gemini-2.5 Pro、GPT-5 Mini 等 · HarmBench、AgentDojo 等 · ASR、Utility 等
威胁模型
攻击者目标为诱导越狱输出有害内容或通过提示注入窃取数据与执行未授权工具调用。威胁模型涵盖完全掌握架构参数的 Whitebox、可获取 token 概率的 Blackbox (with logits) 以及仅能观察离散文本的 Blackbox (generation only)。假设攻击者知晓系统设计并拥有充足算力。
被测模型
Gemini-2.5 ProGPT-5 MiniLlama-3.3 70BMetaSecAlign 70Bgemini-2.5-pro-thinkinggemini-2.5-flashgemini-2.5-flash-thinkinggrok-4command-a-reasoninggpt-5-mediumgpt-5-lowgpt-5-mini-mediumgpt-5-mini-lowgemini-2.5PromptGuard-2 86M
基准
HarmBenchAgentDojoOpenPromptInjectAlpaca
指标
ASRUtilityMedian Num. QueriesAccuracy
AI 导读和推荐理由论文《The Attacker Moves Second》提出,当前 LLM 防御评估多依赖静态攻击串或未针对防御设计的弱优化方法,因而高估了鲁棒性。作者用梯度下降、强化学习、随机搜索和人工红队四类方法自适应地调整攻击策略,在 12 项近期防御上取得多数超过 90% 的攻击成功率,而这些防御原论文报告的数值大多接近零。在 AgentDojo 上,Spotlighting 与 Prompt Sandwiching 在静态攻击下攻击成功率低至 1%,改用搜索式自适应攻击后均超过 95%;MetaSecAlign 从静态基准的 2% 升至 96%;针对 Circuit Breakers 的 RL 攻击在 HarmBench 上达到 100%。作者据此提出四点经验:小型静态评测会误导、自动化评估有效但不足以保证鲁棒、人工红队仍最有效、模型自动评分器本身可被对抗攻击。

论文《The Attacker Moves Second》提出,当前 LLM 防御评估多依赖静态攻击串或未针对防御设计的弱优化方法,因而高估了鲁棒性。作者用梯度下降、强化学习、随机搜索和人工红队四类方法自适应地调整攻击策略,在 12 项近期防御上取得多数超过 90% 的攻击成功率,而这些防御原论文报告的数值大多接近零。在 AgentDojo 上,Spotlighting 与 Prompt Sandwiching 在静态攻击下攻击成功率低至 1%,改用搜索式自适应攻击后均超过 95%;MetaSecAlign 从静态基准的 2% 升至 96%;针对 Circuit Breakers 的 RL 攻击在 HarmBench 上达到 100%。作者据此提出四点经验:小型静态评测会误导、自动化评估有效但不足以保证鲁棒、人工红队仍最有效、模型自动评分器本身可被对抗攻击。

推荐理由论文用自适应攻击系统性击穿 12 项近期防御,并给出评估防御时该采用何种攻击强度的可迁移方法。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    作者认为现有大模型越狱与提示注入防御评估依赖静态测试集或未适配防御的弱优化方法,高估了防御的真实鲁棒性。

    当前大语言模型安全防御的评估方法存在缺陷,依赖静态测试集或未适配防御的弱攻击导致防御鲁棒性被系统性高估。

    • 问题出现的场景与重要性:在越狱(用户诱导模型违背安全对齐输出有害内容)和提示注入(第三方输入诱使模型违背用户意图执行未授权操作)防御中,准确评估防御强度对衡量大模型系统的安全性至关重要。
    • 现有评估方法的不足:作者指出,当前防御评估通常仅复用固定的已知攻击提示词数据集,或直接套用未经针对性适配的通用优化算法(如未调整的 GCG),且给予的计算预算较低。
    • 核心观察与假设:借鉴对抗机器学习与传统安全领域的经验,作者认为唯有显式针对防御机制调整攻击策略、且不受算力人为限制的自适应攻击者,才能衡量防御的本质强度。
    • 论文提出的方案:论文提出了一个统一的自适应攻击框架,涵盖梯度、强化学习、进化搜索与人工红队四类攻击,用于系统性评估并测试近期 12 种典型防御机制。
    • 威胁模型:
      • 攻击目标:针对越狱攻击诱导模型输出公开有害内容;针对提示注入攻击实现私有数据外传或通过工具调用破坏系统完整性。
      • 攻击者知识:涵盖三种设置,即完全掌握架构与参数的 Whitebox、可获取各 token 输出概率的 Blackbox (with logits),以及仅能获取离散生成文本的 Blackbox (generation only)。
      • 攻击者能力:攻击者知晓防御机制的设计细节,可向目标系统输入任意提示词或在工具调用返回结果中注入非受信数据。
      • 计算资源:假设攻击者拥有充足的计算资源(如使用 GPU 集群运行 24 小时),能够进行大规模迭代优化。
  2. 有哪些相关研究?

    论文梳理了对抗机器学习评估、大模型自动化攻击与人工红队研究,指出自动化攻击需针对防御自适应调整且算力需扩展。

    相关研究主要围绕对抗机器学习历史经验、大模型自动化攻击以及人工红队展开。

    • 对抗机器学习的自适应评估经验:

      • Athalye 等人(2018)与 Carlini & Wagner(2017a)——在图像对抗样本领域指出混淆梯度会产生鲁棒性假象,针对具体防御定制的自适应攻击打破了大量防御。
      • Croce & Hein(2020)与 Tramèr 等人(2020)——提出了无参数攻击集成与针对防御评估的自适应规范,指出固定测试集容易造成过拟合。
      • 隐私与后门防御评估(Aerni 等人,2024;Qi 等人,2023)——指出在成员推断与后门防御中,同样因缺乏自适应攻击而存在对防御效果的误判。
    • 大模型自动化越狱与提示注入攻击:

      • 基于梯度的离散优化(Zou 等人,2023;Guo 等人,2024)——提出了 GCG 与 COLD 等方法,将连续梯度映射至离散 token 空间以寻找对抗后缀,但计算开销大且超参数敏感。
      • 基于大模型辅助与搜索的攻击(Chao 等人,2023;Mehrotra 等人,2023;Andriushchenko 等人,2024)——利用大模型生成或改写候选提示词,在黑盒设置下进行树搜索或迭代优化。
      • 提示注入攻击研究(Greshake 等人,2023;Perez & Ribeiro,2022;Zhan 等人,2025)——形式化了间接提示注入威胁,并提出了自适应旁路方法。
    • 人工红队与众包安全挑战:

      • 众包攻防竞赛(Schulhoff 等人,2023;Toyer 等人,2023)——通过 HackAPrompt 和 Tensor Trust 等平台收集人类红队攻击,显示人类在发现复杂越狱上具有灵活性。
      • 前沿模型红队评估(Ahmad 等人,2025;Anthropic,2025)——OpenAI 与 Anthropic 在模型部署前组织人工红队评估以发现前沿风险。
    • 基线方法与基准数据集:

      • 评测基准包括测试越狱的 HarmBench,以及测试提示注入的 AgentDojo、OpenPromptInject 和 Alpaca(包含 davinci_003 任务)。
      • 对比基线涵盖 12 种防御原本采用的静态攻击提示词(如 AgentDojo 的静态重要指令模板),以及未经适配的弱优化攻击。
    • 本文定位:作者将本文定位为将对抗机器学习中自适应评估的核心原则系统性迁移至大模型安全领域,提出了统一的 PSSU 攻击框架并结合大规模算力与人工红队来重新检验现有防御。

  3. 论文如何解决这个问题?

    作者提出由提议、评分、选择和更新构成的统一自适应攻击循环,并实现为梯度、强化学习、进化搜索和人工红队四类方法。

    作者提出了一个统一的通用自适应攻击框架,将攻击过程形式化为多轮迭代优化循环,并分别构建了四类具体攻击方法。

    通用自适应攻击循环形式化

    攻击过程由提议(Propose)、评分(Score)、选择(Select)和更新(Update)四个步骤构成的迭代循环组织(Figure 2)。

    1. 循环机制:每一轮优化中,攻击者通过提议模块生成候选输入,随后利用评分函数评估目标系统反馈,挑选高潜力候选,并以此更新攻击生成策略。
    2. 核心定义:评分步骤通过目标预言机与判定函数量化攻击表现,其优化目标可表示为:

    maxx ∈ 𝒳 J(x, 𝒪(x)) 其中 x 为输入的对抗提示词或注入内容,𝒪(x) 为目标系统输出,函数 J 用于评估攻击成功率、可检测性与代价。

    强化学习攻击(RL-based Methods)

    将提示词生成建模为交互环境,使攻击策略根据系统反馈动态自适应。

    • 策略交互流程:攻击模型直接与受防御系统交互,针对每个测试样本先发送初始候选并获取模型响应;随后攻击模型结合响应与评分进行反思,提出新候选。该过程每轮进行 5 次尝试,单次会话以 5 次中的最高得分衡量攻击成功。
    • 策略更新算法:针对每个样本执行 32 个独立会话,并采用 GRPO(Group Relative Preference Optimization)算法跨会话更新攻击策略模型权重。
    • 评分设计:针对 RPO 和 Circuit Breakers,评分函数为模型在目标恶意 token 上的困惑度加上 HarmBench 分类器安全分;针对 StruQ 仅使用目标字符串的困惑度;针对 Data Sentinel 使用目标任务字符串困惑度与副模型秘密密钥困惑度的 1.5 倍之和。实验中使用无安全对齐的闭源模型作为攻击基础模型。

    搜索攻击(Search-based Methods)

    将对抗提示词优化建模为离散组合搜索问题,基于 OpenEvolve 框架实现模块化架构。

    • 控制器(Controller):采用 MAP Elites 算法,依据候选提示词的长度和多样性两个特征量化划分网格存储单元,每个单元维护一个表现最好的样本(Elite),并在不同岛屿(Islands)间维护候选池,随机选取历史样本供变异。
    • 变异器(Mutator):调用大模型 LmMutator(采用设置最大思考预算的 Gemini-2.5 Pro)执行变异;系统提示词包含角色设定、攻击任务(目标工具调用)与格式规则,用户消息传入控制器采样的 8 个历史候选及其评分。
    • 评分器(Scorer):结合目标系统的定性文本输出与独立裁判大模型给出的 1 至 10 分数值评分,为每个候选生成反馈并回传数据库。

    基于梯度与人工红队实现

    • 梯度攻击:遵循 GCG 方法在嵌入空间计算损失关于 token 嵌入的梯度并投影回离散 token;论文仅将此方法应用于 RPO 防御,并以模型负损失(-loss)作为评分机制。
    • 人工红队:组织了包含 500 多名参与者、总奖金 20000 美元的线上竞赛,设置了基于 AgentDojo 的 40 个挑战任务;参与者通过网页端输入提示词并实时查看智能体工具调用轨迹,环境自动判定注入任务是否达成,并以 5000 减去提交 token 数计分以鼓励短提示词。
  4. 论文做了哪些实验?

    实验测试了 12 种防御,自适应攻击在多数防御上 ASR 超过 90%,人工红队在选定场景达成 100% 成功率。

    实验设置

    • 被测模型:涵盖 Gemini-2.5 Pro、GPT-5 Mini、Llama-3.3 70B、MetaSecAlign 70B,以及人工红队涉及的 gemini-2.5-pro-thinking、gemini-2.5-flash、gemini-2.5-flash-thinking、grok-4、command-a-reasoning、gpt-5-medium、gpt-5-low、gpt-5-mini-medium、gpt-5-mini-low、gemini-2.5。
    • 评测基准:越狱评测采用 HarmBench;提示注入评测采用 AgentDojo(包含 Slack、Travel、Workspace 套件共 80 个样本,跳过 Banking 套件)、OpenPromptInject,以及基于 Alpaca 的 Davinci 任务(davinci_003_outputs.json)。
    • 对比基线:各防御原论文报告的静态攻击提示词(如 AgentDojo 的静态重要指令模板)或未适配的弱优化攻击。
    • 指标定义:攻击成功率(ASR,即达成注入或越狱目标的样本比例)、良性效用(Utility,即在无攻击时完成正常任务的比例)、首次成功的中位数查询次数(Median Num. Queries)。
    • 评审与判定方式:越狱判定采用 HarmBench 分类器评分;提示注入在 AgentDojo 环境中由环境判定注入任务工具调用是否执行成功(人工申诉由人类裁判复核);数据重定向任务由目标输出是否匹配恶意类别判定。
    • 样本量与重复预算:AgentDojo 自动化搜索评测 80 个样本,单样本最大查询预算为 800 次;RL 攻击每个样本执行 32 个独立会话,每个会话迭代 5 轮;人工红队包含 500 多名参与者针对 40 个挑战进行多轮提交。

    主结果

    下表呈现了 AgentDojo 基准上 4 种基础模型在不同防御下的搜索攻击 ASR 表现(数据源自 Table 7):

    表格较宽,可左右滑动

    模型无防御 ASRSpotlighting ASRPIGuard ASRPromptGuard ASRMELON ASR
    Gemini-2.5 Pro100%99%71%94%89%
    GPT-5 Mini75%47%49%75%71%
    Llama-3.3 70B100%99%61%99%95%
    MetaSecAlign 70B96%99%64%95%84%

    注:数据源自 Table 7 在 AgentDojo 上的搜索攻击 ASR 结果。受表格列数限制,Table 7 中其余防御(Prompt Sandwiching 为 69%–100%、Protect AI 为 81%–94%、Model Armor 为 56%–90%)未在此列出。

    • 防御在自适应攻击下保护能力减弱:作者称,大多数被测模型与防御组合在自适应搜索攻击下被突破,除 GPT-5 Mini 配备部分防御以及 PIGuard 面对较强模型外,多数组合的 ASR 均超过 80%(Table 7)。
    • 查询预算与收敛特征:作者报告多数场景下搜索攻击在 100 至 200 次查询内即找到有效触发词,并未耗尽 800 次查询上限,中位数查询次数在 13 至 110 次之间(Table 7)。
    • 静态与自适应评测对比反差:作者称,各模型在静态攻击下的 ASR 普遍偏低(如 GPT-5 Mini 在多项防御下静态 ASR 为 0%),但自适应攻击使成功率上升至 47%–100%,表明静态测试集给出了误导性的安全感(Table 7)。

    人工红队评估与查询次数对比

    • 测了什么:在 AgentDojo 环境中组织 500 多名参与者的红队攻防竞赛,针对 5 种防御和 10 种模型,并在 29 个重合场景中对比人工红队与自动化搜索攻击的查询效率(Figure 6)。
    • 实验结果:在选定的 29 个重合场景中,人工红队集体成功率达到 100%,表现最好的参与者仅需 50 次查询即可攻破场景;相比之下,无随机重启的自动化搜索攻击在 800 次查询预算下 ASR 为 69%(Figure 6、第 6 节)。
    • 作者解读:作者称人类专家的直觉与针对性探索仍是对自动化工具的重要补充,在应对动态交互环境时更为有效;但自动化搜索在无需人工介入下依然展现了可扩展的旁路能力。

    秘密知识与状态检测型防御的自适应绕过

    • 测了什么:针对依赖未知秘密假设的检测机制 Data Sentinel(蜜罐密钥重复任务)与 MELON(双重运行对比工具调用),分别采用 RL 攻击与基于防御知识的变异搜索攻击。
    • 实验结果:在 Data Sentinel 上,RL 攻击在情感分析与垃圾邮件检测任务上均达到 80% 以上的目标重定向准确率(第 5.4 节);在 MELON 上,未显式知晓防御的搜索攻击在 Llama-3.3-70B 上达到 76% ASR,而在赋予防御完整实现的自适应变异器下,ASR 达到 95%(第 5.4 节)。
    • 作者解读:作者称依赖隐藏信息假设的防御并不稳固,攻击者无需改变输出格式即可通过重新定义任务指令绕过检测;当攻击者知晓检测逻辑时,可通过在载荷中添加条件分支指令使验证运行与真实运行分离。

    过滤模型检测器的效用折损与误报代价

    • 测了什么:评测 Protect AI、PromptGuard、PIGuard 和 Model Armor 等外置独立检测器在自适应搜索攻击下的拦截表现及其对良性任务 Utility 的影响。
    • 实验结果:搜索攻击针对 Protect AI、PromptGuard、Model Armor(Gemini-2.5 Pro 底座)的 ASR 均超过 90%,对 PIGuard 达到 71%(Table 7);同时,过滤型防御降低良性效用,如 Gemini-2.5 Pro 上 Protect AI 与 PIGuard 的 Utility 降至 39.18%,而无防御时为 74.23%(Table 7)。
    • 作者解读:作者称外置分类器本身易受对抗扰动且无法有效区分无明显恶意意图的重定向触发词;若强行提高灵敏度会导致良性任务误报率升高并损害可用性。

    其他消融与分析

    • RPO 越狱防御在不同攻击变体下的表现:RL 攻击 ASR 为 98%,梯度攻击 ASR 为 96%(第 5.1 节)。
    • MELON 防御在攻击者不同知识水平下的表现:黑盒无防御知识搜索 ASR 为 76%,完全知晓防御实现的自适应搜索 ASR 为 95%(第 5.4 节)。
    • 搜索攻击在不同模型上的中位数查询次数(无防御):Gemini-2.5 Pro 为 13 次,Llama-3.3 70B 为 14 次,MetaSecAlign 70B 为 37 次,GPT-5 Mini 为 58 次(Table 7)。
    • 人工红队个体表现差异:完成全部 29 个场景的表现最好参与者 ASR 为 75%,其余两名完成全部场景的参与者 ASR 低于自动化搜索的 69%(第 F.2 节)。
    • 进化算法结构消融:作者对比了 MAP Elites 孤岛模型与单一数据库进化算法,最终采用表现更优的 MAP Elites 孤岛模型且未对后续超参数进行调优(第 D 节)。
  5. 有什么可以进一步探索的点?

    作者指出需探索计算开销更小的自适应攻击、改进搜索并行性、规范人工红队流程,并降低评分器被绕过风险。

    作者指出的局限与后续方向

    • 降低强攻击的计算开销:作者在第 3 节指出,未来研究在多大程度上能够以更少计算资源实现本文所展示的强自适应攻击是值得探索的方向。
    • 开发更稳定的自适应评估流程:作者在第 6 节 Lesson #2 指出,当前的强化学习与搜索攻击相比图像对抗攻击(如 PGD)仍不够稳定,呼吁社区继续开发更鲁棒的自适应评估算法。
    • 改进搜索算法的并行化机制:作者在第 G.1 节指出,当前搜索攻击在 100 至 200 次查询后容易陷入平滞,推测更好利用并行性的搜索算法可能比单纯增加顺序迭代次数更受益。
    • 规范人工红队评估的控制变量:作者在第 F.2 节指出,人类攻击者在不同场景上投入的精力并不均衡,若要求所有人类参与者在每个场景使用相同尝试次数,对比结果将更具参照性。
    • 针对规划后执行防御的基准设计:作者在第 G.1 节指出,规划后执行型防御因控制流独立于数据导致现有攻击必然失败,未来需要通过子采样构建控制流不完全依赖数据的场景以展开评估。
    • 模型自动评分器的安全性缺陷:作者在第 6 节 Lesson #4 指出,用于自动化安全评估的分类器模型自身也是机器学习模型,容易受到对抗样本攻击与奖励破解影响。

    实验覆盖范围

    • 被测防御机制涵盖提示词工程、对抗训练、外置过滤模型与秘密知识 4 大类共 12 种防御,跳过了 Tool Filter、CaMeL、IPIGuard 等规划后执行防御(第 5 节、第 G.1 节)。
    • 提示注入评测覆盖 AgentDojo(包含 Slack、Travel、Workspace 套件共 80 个样本,未测试 Banking 套件)、OpenPromptInject 与 Alpaca,越狱评测覆盖 HarmBench(第 B.1 节)。
    • 自动化搜索攻击的单样本最大查询预算设定为 800 次,且实验中仅运行单次尝试,未执行多次随机重启(第 6 节、第 F.2 节、Table 7)。
    • 论文未报告强化学习攻击所使用的无安全对齐闭源基座模型的具体模型名称或版本(第 A.2 节)。
    • 搜索攻击的变异器固定采用 Gemini-2.5 Pro 并设定最大思考预算,论文未测试其他变异模型对攻击效果的影响(第 D 节)。
  6. 总结一下论文的主要内容

    论文构建了多类自适应攻击全面测试 12 种大模型防御,指出静态评估存在误导性,呼吁将自适应攻击与人工红队作为评估标准。
    • 一句话定位:这是一项系统性检验大模型越狱与提示注入防御真实鲁棒性的实证研究,提出了通用的自适应攻击框架与评估范式。
    • 要解决的问题:当前学术界与工业界对大模型防御的评估普遍依赖静态恶意提示词集合或低算力的通用未适配算法,导致评估结果无法反映防御面对真实自适应攻击者时的有效性。
    • 方法要点:
      1. 形式化了由提议、评分、选择和更新构成的 PSSU 自适应攻击循环。
      2. 实现了基于梯度的坐标下降(GCG)、基于强化学习的策略优化(GRPO)、基于 MAP Elites 与大模型变异的组合搜索,以及奖金激励的众包人工红队四种攻击变体。
    • 关键实验发现:
      1. 自适应攻击在 12 种防御机制上均打破了原始论文报告的接近零成功率,多数防御的 ASR 达到 90% 以上(Figure 1)。
      2. 在 AgentDojo 基准上,自动化搜索攻击在 Gemini-2.5 Pro 与 Llama-3.3 70B 结合提示词防御(Spotlighting、Prompt Sandwiching)时达成 95% 至 100% 的 ASR(Table 7)。
      3. 针对外置过滤模型(Protect AI、PromptGuard、Model Armor),搜索攻击 ASR 普遍超过 90%,且过滤模型使良性任务效用从 74.23% 降至 39.18%(Table 7)。
      4. 针对依赖秘密知识的 MELON 防御,知晓防御逻辑的自适应搜索达成 95% ASR;在人工红队测试中,人类攻击者在全部 29 个重合场景中达成 100% 成功率(第 5.4 节、Figure 6)。
    • 作者的结论与启示:作者认为在静态基准上报告接近零 ASR 并不代表防御具备鲁棒性,防御评估应像计算机安全领域一样,假设攻击者知晓防御机制并投入充足算力进行自适应旁路;同时,作者称当前阶段人工红队仍是自动化评估的重要补充,未来防御设计应追求简单可解释并便于人工审计。
阅读原文arxiv.org