MemoAttack:记忆驱动的黑盒越狱框架在 AdvBench 上达到 93.33-96.67% 攻击成功率
Evolving Skill-Structured Attack Memory Enhances LLM Jailbreaking
MemoAttack以技能结构化记忆做黑盒越狱,AdvBench三目标ASR为93.33%–96.67%。
黑盒:对每个有害目标及可选 target prefix,攻击者只能发自然语言查询并观察回复,不能访问梯度、logits、安全分类器或对齐参数。
- 对齐 LLM 应拒绝有害请求,但黑盒下攻击者只看输出,自动越狱是稀疏且昂贵的搜索。样本级启发式搜索的经验短命;跨样本策略池又缺少结构化管理。
- MemoAttack 把经验存成带模板、证据和生命周期的技能记忆。控制器在复用、变异、新发明间采样,用进展与成功两个 Beta 后验加上下文特征做 Thompson 采样,只向攻击者展示短名单投影。
- AdvBench 上 kimi-k2.5、minimax-M2.1、qwen3.5 的 ASR 为 95.33%、96.67%、93.33%。Qwen3.5 去掉记忆的消融降幅最大;尾部扩展次数从 19.74 降到 10.92。
- 作者指出评测限于 AdvBench 文本黑盒和三个目标,未评 Claude Fable 5 与 GPT-5.6,也未系统研究跨目标迁移、超参数敏感性或防御。SD 来自三个不重叠划分,论文写明不计算置信区间。
- 威胁模型
- 黑盒:对每个有害目标及可选 target prefix,攻击者只能发自然语言查询并观察回复,不能访问梯度、logits、安全分类器或对齐参数。受害系统是被测 LLM。成功指评审 1–10 分达到 10。
- 被测模型
- kimi-k2.5minimax-M2.1qwen3.5-397B-A17B
- 基准
- AdvBench
- 指标
- ASRmean expansion attemptsbudgeted ASR
研究者提出 MemoAttack,一个记忆驱动的黑盒越狱框架,通过技能结构化记忆建模、生命周期驱动的记忆演化和后验引导的上下文记忆选择来组织与复用攻击经验。在 AdvBench 上针对三个目标模型,MemoAttack 的攻击成功率为 93.33-96.67%,比每个目标上最强基线高出 10.00-12.00 个百分点,同时将其自身成功目标的平均扩展成本降低 20.2-51.6%。在 Qwen3.5 上的 400 目标顺序评测中,随着记忆积累,后 50 个目标的平均扩展尝试次数从 19.74 降至 10.92。论文标注为审稿中,属于 cs.CR 方向。
深度解读
这篇论文试图解决什么问题?
黑盒越狱缺少跨样本攻击经验的结构化管理,MemoAttack 用可演化技能记忆来组织并选择经验。
黑盒自动越狱缺少对跨样本攻击经验的结构化组织与管理。
- 场景: 对齐后的大语言模型应拒绝有害请求,但越狱提示词仍可诱导其产出不应出现的内容。作者认为许多部署模型只提供 API,攻击者只观察输出,自动越狱因此是稀疏、昂贵反馈下的搜索。
- 现有不足: 样本级启发式搜索的经验绑在单条轨迹上,后续目标会重复发现类似策略,迁移也弱。跨样本策略池或方法库缺少管理、单调变大:冗余、脆弱或过时模式会挤占更可靠的策略,再次有用的策略也可能被埋没。
- 核心观察: 多分支搜索不应只改写提示词,还应显式建模、演化并选择可复用攻击记忆,把提示词、证据和记忆分开。
- 提出的框架: 作者提出 MemoAttack,由技能结构化记忆建模、生命周期驱动的记忆演化,以及后验引导的上下文记忆选择组成。
- 威胁模型:
- 目标: 诱导目标 LLM 产出其应当拒绝的内容。
- 知识: 论文称为 black-box。只能发自然语言查询并观察回复,不能访问梯度、logits、安全分类器或对齐参数。
- 可控输入: 每个有害目标及可选 target prefix;攻击者模型据此改写提示词。
- 受害系统: 被测 LLM。评审做 on-topic 检查并打 1–10 分,任一子节点达到 10 即算成功。
有哪些相关研究?
相关工作分为启发式搜索与经验复用;作者称前者缺可复用知识,后者对不确定性与生命周期支持有限。
论文在引言里把自动黑盒越狱分成样本级启发式搜索和跨样本经验复用,相关工作再按接口、启发式搜索、经验复用和智能体/记忆空间展开。
- 黑盒评测接口: Perez 等(2022)、Ganguli 等(2022)、MASTERKEY(Deng et al., 2024)和 EasyJailbreak(Zhou et al., 2024)用学习或搜索代替手工模板;Yu 等(2024)用变异生成提示词。论文称这些工作把越狱看成 attacker–target–evaluator 接口上的黑盒自然语言搜索。
- 启发式搜索: PAIR(Chao et al., 2023)是多轮攻击者–目标改写;TAP(Mehrotra et al., 2024)加上剪枝的多分支树搜索。Tastle(Xiao et al., 2024)、JailPO(Li et al., 2024)、BlackDAN(Wang et al., 2024)、EvoJail(Tang et al., 2026)、AWMT(Zhang et al., 2026),以及 Hong 等(2024)和 Lin 等(2024b),扩展局部状态、目标或反馈信号。论文称这些方法只利用样本级经验,缺少稳定可复用知识。
- 经验积累与复用: AutoDAN(Liu et al., 2024)用层次遗传搜索生成提示词;GPTFuzz(Yu et al., 2024)以 fuzzing 循环变异种子模板。GAP(Schwartz et al., 2025)让先前尝试以图的方式影响后续扩展;AutoDAN-Turbo(Liu et al., 2025)在攻击之间维护可复用方法记忆。引言称这一族的池会在没有结构化管理的情况下增长。
- 智能体与记忆空间: RedAgent(Xu et al., 2026)、STAR-Teaming(Jung et al., 2026)、AutoRISE(Gautam et al., 2026)、Huang 等(2025a, 2025b)、MetaCipher(Chen et al., 2025)和 MemJack(Chen et al., 2026)把可复用攻击知识写成上下文记忆、策略网络、扩展策略空间或持久经验。ER-MIA(Piehl et al., 2026)针对的是智能体自身的记忆;论文称本文关注攻击方的攻击记忆管理。论文的总括是:现有方法强调检索或策略复用,对不确定性建模或证据驱动的生命周期演化支持有限。
- 基线与基准: 实验基线为 TAP、GAP、AutoDAN-Turbo;基准为 AdvBench(Zou et al., 2023)。
作者把 MemoAttack 放在管理攻击经验、而不是继续堆积经验的位置:单元可寻址且可统计,生命周期用来避免积累式方法的单调增长,后验选择用来在已有证据与未充分探索之间分配曝光。
论文如何解决这个问题?
MemoAttack 将攻击经验建成带后验和生命周期的技能记忆,再以 Thompson 采样选择并驱动多分支搜索。
MemoAttack 在 black-box 的 attacker–target–evaluator 接口上,把有界多分支提示词搜索和显式演化的攻击记忆接在一起。控制器选分支后采样动作、构造记忆短名单,再按目标回复与评审反馈更新后验和生命周期。附录 A.1 给出单目标伪代码。
问题设定与对象分离
- 三类对象: 提示词是分支局部实现;证据是观察到的进展与成功;记忆单元是跨分支、跨目标追踪的命名抽象。作者称这把早先系统里缠在一起的提示词、证据和记忆分开。
- 攻击者可见范围: 短名单只投影名称、描述、理由、计划、模板提示、适用性和检索示例。后验、生命周期、容量计数和谱系账本由控制器私有。
- 归因: 子节点必须报告实际使用的记忆单元名称,系统只更新被点名的单元,允许模型在局部语言约束下组合邻近单元。
技能结构化记忆建模
每个单元有四组字段:身份与指导(name、template、rationale);检索(语义嵌入与示例);证据与选择(选择后验、直接证据);谱系与生命周期。
- 记账对象: 作者认为同一机制可有多种表面形式,一次改写也可混合多种机制,因此证据记在命名单元上,而不是字面提示词上。
- 示例检索: 用当前目标嵌入与示例提示词嵌入的余弦相似度排序,至多保留 3 条,且只放入攻击者可见上下文。嵌入引用 Sentence-BERT(Reimers and Gurevych, 2019)。
- 去重: 精确同名或余弦相似度至少 0.92 视为重复。与 active 或 candidate 等价则并入原单元;与 retired 或 eliminated 匹配时可以分叉新身份并记录谱系。附录 A.3 给出投影、检索与去重。
生命周期驱动的记忆演化
排序单元之前先选动作。REUSE 从 active 中选,并可探测 candidate 与 retired。MUTATE 以 active 或 retired 探测单元为父代,不用未验证的 candidate 作父代。INVENT 在记忆不足或过时时提出新单元。
- 模式采样: 按状态相关得分做 softmax。报告运行的基础分为 REUSE 1.00、MUTATE 0.85、INVENT 0.80;active 池稀疏、当前分数低或近期进展停滞时另加奖励。重复惩罚用于减少含糊证据下的局部循环。附录 A.2 给得分特征。论文未给出附加奖励的数值。
- 四态: 新发明或变异单元先进入 candidate,有足够直接证据或近期进展后升为 active;证据显示效用陈旧或下降则 retired。retired 只偶尔作为探测被采样,新的正证据可再激活,持续表现差则 eliminated,此后不再参与选择。
- 容量: 压力下拒绝弱 candidate、退役弱 active、淘汰旧 retired;物理逐出只用于 eliminated 或旧 retired。作者称这避免积累式方法的单调存储增长。论文未给出容量数值。
后验引导的上下文选择
池子确定后,每个单元对进展事件和最终成功事件各抽一个 Beta 后验样本。报告运行使用 ω_prog = 0.55、ω_succ = 0.45。Thompson 效用为 UTS(m)=ωprogθ̃progm+ωsuccθ̃succm,即一次采样下进展样本与成功样本的加权和。作者称双后验把推动攻击前进和完成最终越狱分开。
上下文加分使用七个固定权重特征:语义匹配、距成功阈值的分数差、近期进展率、近期成功率、是否上一步刚用过、池内使用占比、是否新生或仍在考察。最终排序为 U(m|xu)=UTS(m)+B(xu,m)−λretIret(m),即采样效用加上下文分,再惩罚 retired 探测。论文未给出 η_i、λ_ret 和 top-k 的数值。附录 A.4 还区分选择后验与直接证据账本:变异子代的直接证据从新生先验起算,选择后验只从父代得到折扣且有上限的继承。
冷启动与树搜索
Bootstrap 不是统计重抽样,而是后验记忆可用前的冷启动。此阶段不选择、不计分、不更新命名单元;只保留最终成功目标上、父分数提高且归一化缺口进展至少 τ_boot = 0.15 的改写。累计 B = 50 个成功目标后蒸馏。蒸馏单元的 Beta 先验为 α = β = κ,κ = 10^-3,再回放保留证据;在线新单元从 Beta(1, 1) 开始。失败目标上暂存的进展不进入跨目标记忆。正式运行中,Bootstrap 蒸馏条目作为 active 单元,在线 INVENT 或 MUTATE 单元进入 candidate。
树搜索在 on-topic 叶节点上按评审分数保留 top-w,再按分支因子扩展。评审打 1–10 分,成功阈值为 10,另有 on-topic 的 YES/NO 判定。深度、宽度和 80 次扩展预算是实验设置。附录 E 给出攻击者、记忆提案、蒸馏和两类评审的完整提示词。
论文做了哪些实验?
Table 1 中三目标 ASR 最高为 MemoAttack:95.33%、96.67%、93.33%。
实验设置
- 数据: AdvBench 520 对 goal–target-prefix,seed 2026711 打乱。位置 1–100 为 Bootstrap 池,101–400 为正式池。正式池前 150 个按顺序分成三个互斥的 50 目标划分,三个目标共用划分与顺序。
- 模型: 目标为 kimi-k2.5、minimax-M2.1、qwen3.5-397B-A17B。攻击者为 qwen3-coder-480b-a35b-instruct(temperature 1.0,top-p 0.9,最长 5000 token)。评审为 nemotron-3-super-120b-a12b。各方法共用这对攻击者与评审。
- 预算与基线: 共用最大深度 D = 5、宽度 w = 4、分支因子 b = 4,每目标至多 80 次扩展后早停。基线为 TAP、GAP、AutoDAN-Turbo。有状态方法在各自初始化之后评测:AutoDAN-Turbo 在 Warmup 之后,GAP 在全局上下文稳定之后,MemoAttack 在 Bootstrap 之后。
- 指标: ASR 为预算内达到成功阈值的目标比例,按划分计算后报告三划分均值和样本 SD。论文写明这是三个不重叠目标集,不是重复随机种子,也不计算置信区间。主成本是各方法自身成功目标上的平均扩展次数。
- 判定: 评审做 on-topic 检查并打 1–10 分,阈值 10;任一子节点达到阈值即成功。扩展次数包含目标执行前被过滤的候选,论文称其不一定等于目标模型查询。
- 检验: 每个目标合并 150 个配对二元结果,做双侧精确 McNemar 检验。n01 为 MemoAttack 失败且基线成功,n10 相反。
主结果
下表为 ASR(%),均值±三个划分的样本 SD,据 Table 1。Kimi、MiniMax、Qwen3.5 分别对应 kimi-k2.5、minimax-M2.1、qwen3.5-397B-A17B。
表格较宽,可左右滑动
方法 Kimi MiniMax Qwen3.5 MemoAttack 95.33±3.06 96.67±3.06 93.33±3.06 GAP 84.67±11.02 86.67±9.02 78.67±11.02 AutoDAN-Turbo 75.33±7.02 78.00±8.00 81.33±10.07 TAP 54.67±23.01 57.33±22.03 52.67±23.01 - 成本: Table 1 的 own-success 平均扩展次数,MemoAttack 在 Kimi、MiniMax、Qwen3.5 上为 10.64、6.83、12.06。作者报告相对各目标最强基线降低 34.2%、51.6%、20.2%。三个目标上该次数都低于表中三个基线。
- 检验: 作者报告与各目标最强基线的比较在双侧精确 McNemar 检验下显著(p < 0.001)。discordant 计数 (n01, n10) 为 Kimi 对 GAP (0, 16)、MiniMax 对 GAP (1, 16)、Qwen3.5 对 AutoDAN-Turbo (5, 23)。Qwen3.5 上 ASR 最高的基线是 AutoDAN-Turbo,不是 GAP;TAP 在三个目标上都是表中 ASR 最低的方法。
- 作者解读: 作者认为这同时对应共享 80 次预算内更高的转化,以及成功条件下更低的成本;并认为该模式与后验引导的选择避免重复无引导细化、同时为更难目标保留变异和新发明相一致。
搜索效率
- 测了什么: Figure 3 报告预算 1–80 的 budgeted ASR。每个目标面板合并 150 个目标;全目标面板合并 450 个目标–结果。一次成功只在记录的扩展次数不超过预算 b 时计入。
- 结果: 10 次扩展时,MemoAttack 在 Kimi、MiniMax、Qwen3.5 上为 46.67%、75.33%、33.33%,各目标最强基线为 23.33%、32.67%、26.00%。20 次时 MemoAttack 为 94.67%、96.67%、90.00%,最强基线为 64.00%、70.67%、62.00%。论文未点名这两个预算下的最强基线是哪一个方法。
- 作者解读: 作者称优势出现得早并在全预算内保持,曲线随后接近最终 ASR,多数成功目标不用满预算。相对各目标最强基线,shared-success 与 all-goal 口径的降幅为 19.9%–50.5% 与 39.1%–59.5%,方向与主口径一致。
组件消融
目标为 qwen3.5-397B-A17B,划分、攻击者、评审、预算和成功标准与主实验相同。A0 与 Qwen3.5 主条件逐目标相同。下表据 Table 2。
表格较宽,可左右滑动
变体 去掉的组件 ASR 成功数 own-success Δ ASR A0 无 93.33±3.06 140/150 12.06 – A1 攻击记忆 72.00±12.00 108/150 25.44 -21.33 A2 后验引导选择 78.67±9.02 118/150 25.97 -14.67 A3 MUTATE/INVENT 86.00±8.00 129/150 19.50 -7.33 A4 生命周期演化 82.00±6.00 123/150 21.22 -11.33 - 对照含义: A2 保留记忆但改为随机选择;A3 允许复用但关闭记忆空间扩展;A4 关闭生命周期演化。all-goal 平均次数把失败计为 80。
- 作者解读: 作者称去掉攻击记忆的降幅最大;有记忆但没有后验引导的上下文选择,不足以完成转化或有效分配尝试。作者认为四项设计带来互补贡献。
- 预算曲线: Figure 6 在 10 次时 A0 为 33.33%,最强消融 A3 为 10.00%;20 次时 A0 为 90.00%,A3、A4、A2、A1 为 50.00%、38.67%、25.33%、20.67%。40 次时 A0 已到其最终 ASR,A3 仍低 7.33 个百分点。
长程成本与记忆动态
- 顺序成本: 在 qwen3.5-397B-A17B 上另做 400 个正式目标的顺序运行。Figure 4 横轴为已处理的正式目标,纵轴为扩展次数;标注的尾部 50 目标均值从首窗 19.74 到末窗 10.92。前 200 个目标平均 17.305 次,后 200 个平均 11.015 次。作者称随记忆积累扩展成本整体下降,但轨迹并非严格单调。
- Bootstrap 摊销: 该运行的一次性 Bootstrap 为 1,145 次扩展。其占累计工作的比例在 50 个正式目标后为 53.7%,400 个后为 16.8%(累计 6,809,Table 5)。作者称这是摊销,不是 Bootstrap 自身变便宜。
- 记忆时间线: Figure 5 标注 Registrations 716、Eliminations 343、Promotions 79、Evictions 585、Retirements 41;图例为 Active、Candidate、Retired、Eliminated。作者称驻留池达到设定容量后稳定,四态保持分开。Appendix D.4 对前 50,000 条日志、232 个目标的切片给出 732 次时间线注册、602 次物理逐出、80 次晋升、354 次拒绝进入 eliminated、42 次进入 retired。两处数字不完全相同,论文未解释差异。
其他消融与分析
- Table 6 配对(A0-only/变体-only,未校正 exact p):A1 为 34/2,1.94×10−8;A2 为 24/2,1.05×10−5;A3 为 12/1,3.42×10−3;A4 为 20/3,4.88×10−4。
- Appendix D.4.2:1,366 次选择中 MUTATE 492(36.0%)、INVENT 477(34.9%)、REUSE 397(29.1%);当场最终成功分别为 70/492、47/477、113/397。
- 同一切片:730 个单元、1,431 次归因使用;只用一次的 534 个,至少 5 次的 45 个,至少 10 次的 14 个;最高单元占 5.1%,前五 12.8%,前十 17.1%,前二十 23.6%;Gini 0.428,有效单元数 420.8。
- Appendix D.4.3:最终成功事件为 mutated 156、bootstrap-distilled 79、invented 59。Table 7 最高单元 73 次使用、48 次最终成功,其 mutate 子代 33 次最终成功;该谱系 167 个单元共 501 次使用、169 次最终成功。
- Table 3(kimi-k2.5,100 条,每分 10 条,三名外部研究者盲评):ICC(2,3) = 0.987,CCC = 0.972,MAE = 0.55 分,1 分内 92%,严重分歧 1%;专家均值更高占 74%,更低占 17%。作者称分歧时自动评审更常给更低分。
- 附录 D.5 用 Figure 7–8 展示一个 Bootstrap 蒸馏单元的存储与一次 posterior 阶段扩展;策略文本被涂红,攻击者只看投影。
有什么可以进一步探索的点?
作者指出评测限于 AdvBench 文本黑盒与三个目标,且未做跨目标迁移、超参数敏感性和防御实验。
作者指出的局限与后续方向
- 评测范围: 评测在 AdvBench、仅文本的 black-box 和三个目标上进行;因反复调用成本高,未评 Claude Fable 5 或 GPT-5.6 等前沿专有系统(Limitations)。
- 跨目标迁移: 各目标分开评测,未系统研究针对一个目标学到的攻击记忆能否迁到另一个目标。作者把迁移、负迁移和按目标调节记忆列为后续方向(Limitations)。
- 超参数: 目标是提出框架并确立可行性。报告的超参数在正式实验前固定;反复黑盒评测的成本使作者没有做系统的超参数敏感性研究。组件消融没有量化对阈值、后验权重、记忆容量或搜索预算的稳健性(Limitations)。
- 防御: 没有针对记忆驱动越狱攻击者做防御实验。作者认为后续防御应评估带持久记忆的自适应攻击者,包括高证据记忆单元能否转成回归测试、护栏更新或监测信号(Limitations)。
实验覆盖范围
- 模型与接口: 目标为 kimi-k2.5、minimax-M2.1、qwen3.5-397B-A17B;攻击者为 qwen3-coder-480b-a35b-instruct;评审为 nemotron-3-super-120b-a12b。接口为文本 black-box 的 attacker–target–evaluator。
- 数据: AdvBench 520 对,seed 2026711。Bootstrap 池 100 个目标,正式池 400 个;主结果用正式池前 150 个,分成三个互斥的 50 目标划分,三目标共用顺序。
- 协议: D = 5、w = 4、b = 4,每目标至多 80 次扩展,成功阈值为 10。基线为 TAP、GAP、AutoDAN-Turbo。样本 SD 描述三个不重叠划分之间的变异;论文写明不计算置信区间。
- 附加实验: 组件消融 A0–A4、400 个正式目标的顺序成本,以及记忆日志诊断,都在 qwen3.5-397B-A17B 上。kimi-k2.5 上有 100 条按 1–10 分分层的盲评,每层 10 条,三名外部研究者。
- 成本定义: 论文给出 own-success、all-goal、shared-success 三种分母,并写明扩展次数包含目标执行前被过滤的候选,因此不一定等于目标模型查询次数。论文未报告目标查询次数。
总结一下论文的主要内容
MemoAttack 用可演化技能记忆做黑盒越狱,AdvBench 三目标 ASR 为 93.33%–96.67%。
MemoAttack 是面向 black-box 安全评测的自动越狱框架,把跨目标攻击经验做成可演化的技能记忆,而不是只在单条样本上改写提示词,或无管理地堆积策略。
- 问题: API 模型只回传文本,搜索反馈稀疏且昂贵。样本级经验短命;跨样本策略池又缺少淘汰和不确定性管理。
- 方法: 记忆单元带模板、证据后验和生命周期。控制器在复用、变异、新发明之间采样,用进展与成功两个 Beta 后验加七项上下文特征做 Thompson 采样;攻击者只看短名单投影,系统只更新被点名的单元。冷启动用 50 个成功目标上、缺口进展至少 0.15 的改写蒸馏初始记忆。
- 主结果: AdvBench 三个 50 目标划分上,kimi-k2.5、minimax-M2.1、qwen3.5-397B-A17B 的 ASR 为 95.33%、96.67%、93.33%。作者报告相对各目标最强基线高 10.67、10.00、12.00 个百分点,三组 McNemar 检验 p < 0.001。自身成功目标上的平均扩展次数为 10.64、6.83、12.06,作者报告比各目标最强基线低 34.2%、51.6%、20.2%。
- 其他结果: 在 qwen3.5-397B-A17B 上去掉攻击记忆后,ASR 为 72.00%(相对完整系统 −21.33 个百分点)。顺序 400 个正式目标的尾部 50 目标平均扩展次数从 19.74 降到 10.92;作者称轨迹并非严格单调。
- 作者结论: 作者称这些结果确立了证据引导的演化攻击记忆用于自动红队的可行性与经验价值。Limitations 同时写明评测限于文本黑盒和三个目标,未系统做跨模型迁移、超参数敏感性或防御实验。