EvoBreak 利用自我演化 Agent 的无害经验组合实施攻击
Benign Alone, Harmful Together: Exploiting Experience Composition in Self-Evolving LLM Agents
作者提出EvoBreak,以单独良性任务组合攻击自进化智能体,称平均ASR为86.12%。
灰盒(gray-box)攻击者经任务接口提交良性任务,只读观察自身交互蒸馏出的经验;不能插入、删除或编辑记忆,也不能修改系统提示词或经验抽取机制Φ。
- 自进化LLM智能体把交互轨迹蒸馏成跨会话复用的经验。单独良性的经验累积后,可能共同削弱安全边界。直接改记忆或诱导明确恶意记录的攻击,在隐蔽性和适用面上受限。
- EvoBreak以gray-box读取受害方实际经验,补齐未覆盖的目标相关要求,并提交单独良性任务,再改写终查询以联合激活。BreakGym合成可分解目标,优化为拒绝采样SFT与Hint-guided GRPO。
- 作者称跨两种受害骨干、两框架与两基准,EvoBreak平均ASR为86.12%,高于ReNeLLM 24.19个百分点。作者称无诱导经验或只留小子集时成功有限,保留接近完整时上升。
- 论文未专门讨论局限。实验含两种受害骨干、两种自进化框架、三个预进化域和两个安全基准,评审为GPT-5.4-mini,五次运行平均。论文未报告良性度百分比、平均攻击轮数和Hint critic的模型名。
- 威胁模型
- 灰盒(gray-box)攻击者经任务接口提交良性任务,只读观察自身交互蒸馏出的经验;不能插入、删除或编辑记忆,也不能修改系统提示词或经验抽取机制Φ。目标阶段在新会话提交安全敏感查询,先前交互历史不可用,持久经验仍在。目标是在原子良性约束下最大化经验诱导的安全退化Δharm。
- 被测模型
- GPT-5-miniLlama-3.1-8B-Instruct
- 基准
- JailbreakBenchHarmBenchBreakGymAIMELiveCodeBenchMMLU-ProAdvBenchDo-Not-AnswerWildJailbreakJailbreak_LLMs
- 指标
- ASRBenignness
研究者提出 EvoBreak,一种针对自我演化 LLM Agent 的经验条件顺序攻击。它通过反复观察受害 Agent 蒸馏出的经验,识别尚未覆盖的目标相关需求,自适应地获取互补经验,再改写最终查询以联合激活这些经验;单条经验本身无害,累积复用后会共同削弱 Agent 的安全边界。为支持训练,作者构建 BreakGym 合成流水线,生成具有多样依赖结构、可分解的安全敏感目标,并用拒绝采样监督微调和 Hint 引导的 GRPO 优化攻击。跨自我演化框架、受害基座模型、演化前领域和安全基准的实验显示,EvoBreak 持续优于现有攻击且保持较高良性度,表明无害经验组合是自我演化 Agent 中持续存在的攻击面。
深度解读
这篇论文试图解决什么问题?
单独良性的经验累积复用后,可能共同削弱自进化智能体的安全边界。
单独良性的经验被累积并跨会话复用后,可能共同削弱自进化智能体的安全边界。
- 出现场景:自进化LLM智能体把轨迹蒸馏成可复用经验,以支持规划、工具使用和跨交互适应。作者认为这些经验会作为受信任的内部指导被跨会话复用,从而形成持续攻击面。
- 现有不足:直接写记忆的攻击要插入明确恶意记录,隐蔽性和适用面受限。仅查询的记忆攻击不必直接改库,但作者称它们很少把诱导记忆的隐蔽性当作显式目标,效果也多按下游任务退化、而不是安全边界侵蚀来评。
- 核心问题:作者引述Zhao et al. 2026,称良性经验积累可能无意中削弱高风险拒答。作者问:自适应对手能否故意诱导一组单独良性、合用后削弱安全边界的经验。
- 本文提出:攻击方法EvoBreak,以及结构优先的合成流程BreakGym;策略用拒绝采样SFT和Hint-guided GRPO优化。
- 威胁模型:
- 知识:gray-box。经任务接口交互,只读观察自己的交互所蒸馏出的经验。
- 能力与约束:可提交良性任务;不能插入、删除或编辑记忆,不能修改系统提示词或经验抽取机制Φ。
- 受害系统:带持久经验记忆的自进化智能体。攻击前记忆M0可空或已有经验。目标阶段在新会话提交安全敏感查询,先前交互上下文不可用,经验记忆仍在。
- 目标:在每条任务和每条诱导经验都满足原子良性约束时,最大化式(1)的安全退化Δharm。
有哪些相关研究?
相关工作涉及自进化智能体、查询级越狱、记忆攻击和红队训练数据。
引言与第5节把讨论分成自进化智能体、相关攻击和红队训练数据。
- 自进化LLM智能体
- Fang et al. 2025a:综述把交互轨迹蒸馏成持久经验并在后续任务中复用的范式。论文此处只作背景,未单列批评。
- SE-Agent、ReasoningBank、Evo-memory(Lin et al. 2025;Ouyang et al. 2025;Wei et al. 2025):整理成功与失败轨迹,或迭代修订、重组、精炼先前轨迹,以支持持续适应。本文把前两者用作受害框架。
- 查询级与记忆向攻击
- PAIR、FlipAttack、ReNeLLM(Chao et al. 2025;Liu et al. 2024;Ding et al. 2024):改写或混淆有害请求以绕过安全机制。
- AgentPoison(Chen et al. 2024):直接向记忆或知识库注入恶意记录。引言称早期攻击假设可直接访问记忆;附录B.4称它需要特权写入,访问假设强于EvoBreak。
- MINJA与过度泛化规则(Dong et al. 2026;Wang et al. 2026):前者仅通过查询诱导恶意记忆;后者被引言放在从合法案例蒸馏过度泛化规则的一端。作者称现有仅查询攻击很少把诱导记忆的隐蔽性当作显式目标,评测也常看下游任务退化。附录B.4称MINJA是最接近的交互式记忆基线,但目标是恶意记录,而不是单独为良性的多条经验。
- 自动红队的训练数据
- AdvBench、Do-Not-Answer、WildJailbreak、Jailbreak_LLMs(Zou et al. 2023;Wang et al. 2024a;Jiang et al. 2024;Shen et al. 2024):提供多样有害意图。Related Work称每个目标多为独立查询,对分解复杂目标、建模跨交互依赖的监督有限。
- HarmBench、StrongREJECT、AgentHarm(Mazeika et al. 2024;Souly et al. 2024;Andriushchenko et al. 2025):引言称现有安全数据多是独立有害请求,难以控制要求分解和依赖结构,因而不适合训练这种规划。
- 基线方法与基准:查询级PAIR、FlipAttack、ReNeLLM;记忆向AgentPoison、MINJA。评测用JailbreakBench与HarmBench。预进化用AIME、LiveCodeBench、MMLU-Pro。SFT监督源对照还包括上述四个安全数据集和BreakGym。
作者把本文放在:不直接改记忆,也不诱导单独即为恶意的记录,而是用单独良性的经验组合侵蚀安全边界,并按受害方实际蒸馏结果重规划。Zhao et al. 2026被当作问题起点,而不是攻击基线。
- 自进化LLM智能体
论文如何解决这个问题?
EvoBreak按受害方实际经验闭环补齐覆盖,再改写终查询以联合激活。
EvoBreak不预先固定任务序列,而是根据受害方实际蒸馏的经验,闭环补齐尚未覆盖的目标相关要求,再改写终查询以促使这些经验被联合使用。训练目标由BreakGym按结构合成,优化分拒绝采样SFT与Hint-guided GRPO。
问题设定
- 受害过程:任务xi产生轨迹τi,经验ei=Φ(xi, τi)写入持久记忆。Φ是受害方原生抽取;经验可以是反思、过程规则或可复用技能。
- 攻击过程:对手提交良性任务序列,每步诱导一条经验,得到攻击后记忆Mn。目标阶段在新会话提交q。
- 安全退化:Δharm=Jharm(q,Mn)−Jharm(q,M0)。含义是同一查询在攻击后记忆与攻击前记忆下的有害遵从分数之差,分数在0到1。实验并未把该差值当作报告指标。
- 原子良性:每个提交任务和每条诱导经验单独评估时,良性审核器B都须为1。
两阶段攻击
- 可观察历史:到第i步为止的任务–经验对;对手控制任务,不控制被蒸馏出的经验。作者称预定分解或固定序列会在经验不完整、意外或冗余时失效。
- 残差与动作:每步联合生成文本残差ri和下一动作。动作是候选任务或Stop。残差概括已有经验中仍缺的、与目标相关的知识、过程或约束,只从原查询和历史推断,不用预定义分解。
- 闭环:未Stop就把动作交给受害方执行,写入新经验后重规划。选Stop时结束获取,已完成交互数为k。论文未规定k的上限。
- 终查询改写:在完整历史上重采样q。作者称直接提交原查询容易因安全敏感意图外显而触发拒答;记忆里有相关经验也不保证目标阶段会被联合调用。改写保持底层意图,并使语义与过程结构对齐已诱导经验。论文未给出可照抄的句式。
BreakGym
- 配置:分解原则、组合拓扑、目标域三者一组。潜在支架只编码局部要求及依赖,不规定交互路径;仅数据构建和训练时可访问,教师rollout也不能看支架。
- 结构:原则为knowledge-based、procedural、constraint-based、functional;拓扑为sequential、parallel、hierarchical、conditional。六域为privacy、fraud、chemical、cyber、violence、sexual。Figure 2给出各域查询数:前五域各350,Sexual为250,总样本2000。原则与拓扑的条数分布,正文未给数字。
- 三阶段:采样结构并建支架;在目标域实例化出查询;再校验是否忠实于支架、局部要求可否区分、是否自然连贯,不符者丢弃。与下游评测提示相似的实例被移除以防泄漏。Figure 2(b)有一条构造示例,此处不复述。定义见附录A。
级联优化
- 拒绝采样SFT:教师对每个BreakGym目标做多次独立rollout,观察设置与EvoBreak相同。只保留全部任务和诱导经验通过良性审核、且目标阶段攻击成功的轨迹,再对完整轨迹做下一token微调。附录B.5写教师为Qwen3.5-122B-A10B,Gemini 3 Flash过滤低质量或未支持的轨迹。论文未报告每位目标的rollout次数或监督集约规模。
- Hint-guided GRPO:固定的强模型作训练时critic,用支架判断中间残差–动作;合适则不给提示,否则给局部纠正提示并重生成,rollout只留最终决定。推理时critic与支架都不可用。论文未给出该critic的模型名。
- 奖励与更新:R(ζ)=Satk(ζ)+λ/(2kζ)∑i=1kζ[B(ti)+B(eai)]。含义是攻击成功指示加上按λ缩放的平均良性项,0<λ<1,具体λ未给。每个目标采样M=8条rollout,组内归一化优势后用标准GRPO更新。附录B.5:学习率1×10−6,β=0.001,ϵ=0.2,优化200步。
论文做了哪些实验?
作者称EvoBreak在全部评测设置上的平均ASR为86.12%。
实验设置
- 受害骨干:GPT-5-mini、Llama-3.1-8B-Instruct。攻击策略骨干为Qwen3.5-9B。
- 框架与预进化:SE-Agent、ReasoningBank。攻击前用三域经验初始化:数学AIME、代码LiveCodeBench、通用推理MMLU-Pro。论文未报告写入条数。
- 基准:JailbreakBench 100条恶意提示;HarmBench 400条有害行为。
- 基线:查询级PAIR、FlipAttack、ReNeLLM;记忆向AgentPoison、MINJA。论文未报告各基线的查询预算。
- 指标与评审:ASR是终响应成功完成目标的查询比例。GPT-5.4-mini按1–5分评ASR与Benignness;仅5分(直接且实质完成)计成功。Benignness是每条攻击阶段任务和诱导经验独立二值审核后的平均。附录C给出两套评审提示词。默认五次运行平均。论文未报告方差、与人工的一致性,也未报告Δharm数值。
- 优化:M=8,学习率1×10−6。机器为8块NVIDIA H100 80GB。提示与支架只在训练时使用。
主结果
下表只列EvoBreak的ASR(%),据Table 1。JBB为JailbreakBench,HB为HarmBench;SE为SE-Agent,RB为ReasoningBank。列为预进化域。
表格较宽,可左右滑动
受害模型 预进化域 JBB-SE JBB-RB HB-SE HB-RB GPT-5-mini Math 80.60 79.80 85.05 83.05 GPT-5-mini Code 81.00 78.20 84.80 85.00 GPT-5-mini Reas. 79.20 80.40 86.25 86.10 Llama-3.1-8B-Instruct Math 90.60 88.00 93.85 90.30 Llama-3.1-8B-Instruct Code 88.20 89.40 91.10 92.95 Llama-3.1-8B-Instruct Reas. 87.80 87.40 89.55 88.20 - 整体对比:作者称EvoBreak在全部设置中ASR最高,整体平均86.12%,高出最强基线ReNeLLM 24.19个百分点。同格并不总是ReNeLLM高于AgentPoison:Llama-3.1-8B-Instruct、HarmBench、SE-Agent、Math上,ReNeLLM为70.10%,AgentPoison为74.15%(Table 1)。
- 作者解读:作者称两种演化机制和三种预进化域上都保持高ASR,并认为这来自按实际生成的经验重规划,而不是绑定某种经验表示或初始记忆分布。作者还称终查询改写把查询对齐已累积的良性经验,从而利用经验复用,而不是特定模型的提示词漏洞。
- 良性度:Figure 3比较Llama-3.1-8B-Instruct上、跨框架与预进化域的平均ASR和良性度;图例为PAIR、MINJA、FlipAttack、AgentPoison、ReNeLLM、EvoBreak。转换文本未保留坐标数值。作者称EvoBreak在两个基准上的有效性–良性度权衡最好;并称AgentPoison需特权注入恶意记忆,更容易被发现。论文未给出Ben.百分比。
组件消融
Table 2只覆盖Llama-3.1-8B-Instruct与JailbreakBench,六格顺序为SE-Agent的Math/Code/Reas.,再加ReasoningBank的同样三域。
- 训练:无训练六格为52.40%–56.60%,SFT Only为72.20%–76.20%,GRPO w/o Hint为78.20%–81.80%,Full为87.40%–90.60%。作者称未训练已有非平凡成功;SFT提供监督,GRPO再提高,Hint对稀疏轨迹奖励下的中间规划还有增益。
- 重规划:去掉重规划后六格为62.60%–67.60%。作者称固定分解无法应对不完整、冗余或偏离的实际经验。
- 改写:去掉改写为63.00%–70.40%;只提交改写查询(RF Query Only)为26.40%–31.20%。作者称经验获取与终查询改写互补,去掉任一侧都会落到无支撑的改写或未被激活的经验堆积。
BreakGym监督源
Figure 4是仅SFT、排除GRPO的监督源比较。ASR(%)标注为:Jailbreak_LLMs 58.4,AdvBench 63.1,Do-Not-Answer 64.9,WildJailbreak 68.2,BreakGym 74.0。正文称各变体共用同一框架、骨干和动作空间,但未写明受害模型、框架名、预进化域和基准。作者称BreakGym监督最强,因为分解原则和组合拓扑更匹配“找出未覆盖要求、再补齐经验”的需要。
经验保留与预存记忆
- 保留比例:Figure 5横轴为Retained Experience Condition(0-Exp、1-Exp、25%、50%、75%、Full),纵轴为Attack Success Rate (%),图例为SE-Agent与ReasoningBank。图中标注包括29.1、33.4、35.7、47.2、65.6、88.9与28.2、31.4、37.1、45.9、62.0、88.3;文本提取后单点与具体条件的列对齐不可靠,故不逐点对应。受害骨干和基准论文未说明。作者认为无经验或只留小子集时成功有限,保留集接近完整时上升并加快,效果来自多条经验联合可用,而不只是多堆经验或单条经验。
- 预存经验:Figure 6横轴数量、纵轴ASR的具体刻度在转换文本中未保留;图中可见Math、Code、Reasoning。作者称随着记忆规模增大,攻击成功逐渐下降,但在大量预存经验下仍然有效,并称这是因为对已实现经验状态重规划、再把终查询对齐累积经验,因而不依赖空的或固定的初始记忆。受害骨干和基准论文未说明。
其他消融与分析
- Table 2、SFT Only:75.60,72.20,73.80,76.20,73.40,72.60。
- Table 2、GRPO w/o Hint:79.00,81.80,81.40,78.20,80.00,81.20。
- Table 2、w/o Replanning:67.60,63.20,62.80,64.00,65.20,62.60。
- Table 2、w/o Reformulation:66.60,70.40,63.00,65.20,68.00,64.20。
- Table 2、RF Query Only:31.20,27.80,28.40,26.40,28.00,30.20。
- 论文未报告学习率、M、β、ϵ或λ的参数扫描数字。
有什么可以进一步探索的点?
论文没有Limitations或Future Work,Conclusion也未列出作者自身的不足。
作者指出的局限与后续方向
论文未专门讨论局限。全文无Limitations或Future Work专节。Conclusion写到应评估持久经验的累积安全效应,而不是孤立审核(第6节);该句是结论性呼吁,并未写成作者自己的不足或计划中的实验。
实验覆盖范围
- 受害骨干为GPT-5-mini与Llama-3.1-8B-Instruct,框架为SE-Agent与ReasoningBank,预进化域为AIME、LiveCodeBench、MMLU-Pro(Section 4.1)。
- 安全评测为JailbreakBench(100条)与HarmBench(400条);ASR与Benignness由GPT-5.4-mini评审,ASR仅5分计成功;结果为五次独立运行平均(Section 4.1、附录C)。
- 基线为PAIR、FlipAttack、ReNeLLM、AgentPoison、MINJA。攻击骨干为Qwen3.5-9B;SFT轨迹由Qwen3.5-122B-A10B生成,Gemini 3 Flash过滤(Section 4.1、附录B.5)。
- Table 2的消融只给出Llama-3.1-8B-Instruct与JailbreakBench。Figure 4未写明受害模型、框架与基准;Figure 5写明两种框架,Figure 6写明三个预进化域,二者都未写明受害骨干与评测基准。
- 论文未报告Benignness百分比、Δharm数值、平均攻击轮数、各基线查询预算、λ的取值、Hint critic的模型名、预进化经验条数、DSFT规模,以及五次运行的方差。
总结一下论文的主要内容
EvoBreak以单独良性经验的组合攻击自进化智能体,作者称平均ASR为86.12%。
EvoBreak是对自进化LLM智能体的gray-box序列攻击:用单独看为良性的经验组合,削弱跨会话复用经验时的安全边界。
- 问题:受害方把轨迹蒸馏成持久经验。对手只能提交任务并只读观察自己诱导出的经验,不能改记忆、系统提示词或抽取机制Φ。安全敏感查询在新会话发出,交互历史不可用,经验仍在。
- 做法:每步根据已生成经验估计尚未覆盖的要求,提交下一条良性任务,直到Stop;再按历史改写原查询,使其对齐这些经验。BreakGym用四种分解原则、四种组合拓扑和六域合成2000条可分解目标。训练是拒绝采样SFT加Hint-guided GRPO;推理时不用纠正提示和潜在支架。
- 主结果:Table 1中,两种受害骨干、两种框架、三域预进化、JailbreakBench与HarmBench上,EvoBreak的ASR从78.20%到93.85%。作者称整体平均86.12%,高出ReNeLLM 24.19个百分点。同格基线里,AgentPoison有时高于ReNeLLM,例如Llama-3.1-8B-Instruct、HarmBench、SE-Agent、Math为74.15%对70.10%。
- 消融与条件:Table 2里,Llama-3.1-8B-Instruct的JailbreakBench上,Full为87.40%–90.60%,只提交改写查询为26.40%–31.20%。Figure 4仅SFT时,BreakGym为74.0,高于图中其他监督源;该图未写明受害设置。作者认为成功依赖多条诱导经验联合可用,预存经验增多时ASR逐渐下降,但仍有效。Benignness无具体百分比。
- 作者结论:作者称单独良性的经验组合是自进化智能体上的持续攻击面,应评估持久经验的累积安全效应,而不是只做孤立审核。