跳到正文
原文
论文追踪· arXiv:2608.27439· Junjie Zhang, Hui Liu, Kecheng Chen, Xianbo Mo, Changsheng Chen, Haoliang Li·本站收录 · 原文发表

RedEvoAgent:以经验驱动技能演化的自动红队智能体

RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

RedEvoAgent演化攻击技能做黑盒红队;Table 1a的ASB、MiniMax-M2.5上ASR为93.2%。

威胁模型black-box目标智能体Mtar=(mtar,htar),mtar为目标模型,htar为执行harness。

问题
产品级harness中的越狱可能引发有害工具调用和持久状态改变。固定攻击只覆盖有限机制;按相似度检索整条轨迹可能复用误导经验,并占用上下文、不便审计。
方法
RedEvoAgent是black-box红队智能体:用工具箱改写提示并查询目标。训练划分上测量各工具、记录轨迹,并以Deciding-Tool Attribution标出直接导致成功的工具;验证棘轮只保留验证分数严格更高的技能。
实验与结果
比较覆盖ASB、AgentHarm、Claude Code、Codex和三种目标模型,对照含固定工具、RedCodeAgent与MAJIC。作者称RedEvoAgent不低于最强单工具;Table 1里仅Claude Code上AgentHarm、MiniMax-M2.5的HarmScore 20.8低于MAJIC的22.6。
局限与可以继续做的
论文未专门讨论局限。实验含三种目标模型、两种harness、两个基准,以及技能消融、组件消融、棘轮轮数和零样本迁移。未报告重复次数,也未写明Prompt Substitution的辅助LLM。
实验设置MiniMax-M2.5、DeepSeek-V4-Flash 等 · Agent Security Bench (ASB)、AgentHarm 等 · ASR、HarmScore 等
威胁模型
black-box目标智能体Mtar=(mtar,htar),mtar为目标模型,htar为执行harness。攻击者智能体在ReAct循环中按技能调用工具箱改写提示或QUERY_TARGET;演化时Mtar、攻击者模型、循环与工具箱冻结,只更新技能s。外部judge按基准原生分数打分。
被测模型
MiniMax-M2.5DeepSeek-V4-FlashQwen3.5-35B
基准
Agent Security Bench (ASB)AgentHarmClaude CodeCodex
指标
ASRHarmScoreRRaverage attack-tool calls per case
AI 导读研究者提出 RedEvoAgent,一个黑盒红队智能体,将跨案例的攻击轨迹蒸馏为简洁、人类可读的攻击技能。该技能通过工具有效性画像和 Deciding-Tool Attribution 进行更新,并用验证棘轮只保留能提升验证表现的更新。在多个基准、目标模型和目标执行环境上的实验显示,RedEvoAgent 优于固定攻击和智能体攻击基线,提升了工具效率,并可跨攻击模型与目标执行环境迁移。

研究者提出 RedEvoAgent,一个黑盒红队智能体,将跨案例的攻击轨迹蒸馏为简洁、人类可读的攻击技能。该技能通过工具有效性画像和 Deciding-Tool Attribution 进行更新,并用验证棘轮只保留能提升验证表现的更新。在多个基准、目标模型和目标执行环境上的实验显示,RedEvoAgent 优于固定攻击和智能体攻击基线,提升了工具效率,并可跨攻击模型与目标执行环境迁移。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    产品级black-box智能体需要可演化的可读攻击技能,而不是固定攻击或整条轨迹检索。

    产品级 black-box 智能体上的越狱可能造成有害工具使用和持久状态改变,固定攻击与整条轨迹检索都不足以支撑可审计的自动红队。

    • 场景:作者称 Claude Code、Codex 等产品级 harness 可改本地文件、传输数据并调用外部 API。成功越狱因此可能带来破坏性工具使用和系统状态的持久改变,而不只是不安全文本,所以需要可扩展的对抗评测。
    • 现有不足:改写类方法(如 FlipAttack)和预定义空间优化(如 GCG、AutoDAN)只探索攻击空间的有限子集。RedCodeAgent 按语义相似度检索成功轨迹作先验;作者认为检索会有偏,单次工具选择对最终成功的贡献往往不清楚,误导经验会被复用,整条轨迹还占用上下文并难以人工审计。
    • 观察:作者认为把跨案例轨迹蒸馏成简短、人类可读的攻击技能,可降低上下文开销并提高可解释性,并称这与一般智能体任务上高层技能摘要优于相似度检索的证据一致。
    • 方法:提出 black-box 红队智能体 RedEvoAgent。它用可演化的攻击技能编排工具箱;更新信号来自工具有效性画像和 Deciding-Tool Attribution,验证棘轮只保留验证集上提升攻击表现的修订。
    • 威胁模型:
      • 目标:学习技能 s,使攻击者智能体对目标的基准原生分数最大。
      • 知识:论文将设定写为 black-box。演化期间目标智能体、攻击者模型、执行循环和工具箱冻结,只更新 s。
      • 能力:在 ReAct 循环中调用越狱工具改写当前提示,或用 QUERY_TARGET 提交并读取目标回复,直到成功或达到最大轮数。
      • 受害系统:Mtar=(mtar, htar),即目标模型加执行 harness。实验中的 harness 为 Claude Code 或 Codex。
  2. 有哪些相关研究?

    作者称这是首个用相对留出验证来演化单一自然语言编排技能的自动红队方法。

    固定机制的越狱

    • 单机制搜索:GCG(Zou et al., 2023)做梯度搜索,AutoDAN(Liu et al., 2024)做进化搜索,PAIR(Chao et al., 2025)用 LLM 迭代精炼,TAP(Mehrotra et al., 2024)做树结构 black-box 搜索。引言称这类方法只探索攻击空间的有限子集。

    多工具编排与经验复用

    • 数值状态:JailbreakOPT(Shi et al., 2026)把多种攻击打包成工具,用 contextual bandit 平衡探索与利用。MAJIC(Qi et al., 2026)按反馈更新伪装策略之间的马尔可夫转移概率。
    • 轨迹检索:RedCodeAgent(Guo et al., 2026)把攻击方法做成可顺序调用的工具,并检索与当前任务相似的成功轨迹,以指导工具选择和提示优化。
    • 作者的区分:三者都复用过去经验,但 RedCodeAgent 存在案例级轨迹里,JailbreakOPT 和 MAJIC 分别存在 bandit 策略和转移矩阵里。作者称检索轨迹增加推理时的上下文开销,而这些数值状态不把学到的攻击偏好写成可解释指导。另一些经验系统使用可检索自然语言策略、结构化经验池、文本/代码混合库或技能化记忆(Liu et al., 2025a; Wang et al., 2025; Zhang et al., 2025b; 2026)。作者称它们没有对完整编排产物做相对于现任版本的留出验证。AutoRedTeamer(Zhou et al., 2025)则在入库前用绝对 ASR 阈值验证新实现的攻击算子。

    从经验演化技能文档

    • Trace2Skill(Ni et al., 2026):并行抽取单条轨迹中的教训,再分阶段合并成统一技能。其实验中,统一技能优于检索单次过往情节的记忆基线,且测试时不必检索。
    • SkillOpt(Yang et al., 2026):根据打分 rollout 对单一技能文档提出有限的增、删、改,只在留出验证集提升时接受候选。本文的 minibatch 大小和编辑上限取自其默认值。
    • SkillOpt-Lite(Shen et al., 2026):探索已存轨迹、抽取跨案例共有模式,并独立验证每次候选更新。

    基线方法与基准

    • 基线:No Jailbreak;孤立工具 GCG、AmpleGCG、AutoDAN、Template(来自 GPTFuzzer)、FlipAttack、RolePlay(取自 RedCodeAgent 的 LLM 角色扮演改写);以及自动红队方法 RedCodeAgent 与 MAJIC。
    • 基准:Agent Security Bench(ASB)与 AgentHarm。目标执行 harness 为 Claude Code 与 Codex。

    作者称,据其所知,本文是首个通过 incumbent-relative held-out validation 演化单一自然语言工具编排技能的自动红队方法:候选必须在独立验证集上超过当前技能才被保留。

  3. 论文如何解决这个问题?

    RedEvoAgent把轨迹与工具画像蒸馏成技能,验证棘轮只留下验证集上严格变好的版本。

    RedEvoAgent 在冻结的 black-box 目标、攻击者模型、执行循环和工具箱上,只演化一份 Markdown 攻击技能。训练划分决定技能学什么,验证划分决定哪一版留下,测试划分只评最终接受的技能。

    问题设定与形式化

    • 对象:目标智能体 Mtar=(mtar, htar)。攻击者 Matt(s)=(matt, hatt(s, T)) 在 ReAct 框架中先优化提示再攻击。工具箱 T 含 K 个越狱工具,技能 s 提供编排指导。
    • 单例结果:对原始提示 x,技能 s 产生轨迹与基准原生分数 rx(s),由外部 judge 根据目标回复评定。
    • 目标:在提示集合 D 上最大化平均分数 JD(s)=1/(|D|)∑x∈ Drx(s)。ASB 的划分是 80/40/280,AgentHarm 是 40/20/148,分别对应训练、验证、测试。
    • 接受规则:候选只有在验证分数严格高于当前最优时才替换,即 s∗i=ŝi 当且仅当验证集上严格更好,否则保留上一版。

    攻击者架构与工具箱

    • 动作:每一轮要么调用一个越狱工具改写当前提示,要么 QUERY_TARGET,把当前提示提交给目标并把回复当作观察。每个动作占一轮。实验中的交互预算为 B=20。
    • 七个工具:GCG、AutoDAN、AmpleGCG、Template、FlipAttack、RolePlay,以及作者提出的 Prompt Substitution。后者用一个辅助 LLM 在保持同一意图的前提下改写失败提示;论文未写明该辅助模型是哪一个。
    • 技能位置:s 是插入攻击者系统提示的 Markdown 文档,概括测得的工具有效性和高层编排启发式。Figure 1 给出从查询、轨迹收集到候选技能接受或拒绝的流程。
    • 替代模型:GCG 与 AutoDAN 在白盒替代模型 Qwen2.5-7B-Instruct 上优化,AmpleGCG 使用公开的 Llama-2-7B-chat 生成器;优化后的提示再提交给 black-box 目标。作者称这是目标权重不可用时这些工具的标准迁移协议。

    经验收集

    • 工具画像:技能演化前,每个工具在训练划分上单独测量。et 是该工具在训练提示上的平均基准分数,全体 et 组成工具有效性画像。作者的理由是不同模型–harness 配对对不同工具的抵抗不同。
    • 轨迹:从空技能开始,在训练划分上运行当前技能,记录工具调用、候选提示、QUERY_TARGET、目标回复和分数。只有候选被接受后才重新收集。
    • Deciding-Tool Attribution:把成功轨迹记到紧挨成功 QUERY_TARGET 之前的那个越狱工具上。作者的理由是,攻击者自有偏好会让某些工具频繁出现在成功轨迹中,即便真正打出成功查询的是后一个工具;若把共现当成贡献,技能会强化这种偏好并可能导致策略坍缩。作者称共现低时该机制的影响可能不大,选择偏差强时则用于稳住演化。Figure 2 用一条训练轨迹说明:连续变换之后,首个成功查询紧跟 FlipAttack,因而把决定工具记为 FlipAttack;同图摘录把工具优先级和攻击策略写入技能。具体提示原文不复述。

    验证棘轮

    • 为何不直接采用改写结果:作者称轨迹里既有有效策略,也有失败尝试、冗余步骤和攻击者偏好造成的虚假模式;Reflect 与 Rewrite 也可能写入无效或过拟合规则。因此不直接采用新技能。
    • 合成:训练轨迹分成 minibatch。作者引用的理由是,单条轨迹容易只给出轶事式修补,一次看完全部训练集会把相互冲突的教训混进同一次更新。Reflect 并行分析各 minibatch 并提出修订,Rewrite 合并建议,并对当前技能只做有限编辑。实验取 SkillOpt 的默认 minibatch 大小 8、编辑上限 L=6,最多 R=4 轮。
    • 注入与拒绝记录:工具画像只在第一轮、当前技能为空时注入。拒绝上下文 C 记录自上次接受以来被拒绝的候选及其验证分数,供后续修订避开已失败的修改方向。
    • 棘轮:候选在验证划分上独立运行。严格超过当前最优才接受,并在新技能下重收集训练轨迹、清空 C;否则保留原技能和原轨迹,把候选及分数追加进 C。Reflect 与 Rewrite 只读训练划分上的画像和轨迹;验证划分只提供选择用的标量,测试划分只评最终 s* 一次。候选按 ASB 的 ASR 或 AgentHarm 的 HarmScore 选择。
  4. 论文做了哪些实验?

    Table 1里RedEvoAgent多数设置高于对照,仅一处HarmScore低于MAJIC与RedCodeAgent。

    实验设置

    • 目标:MiniMax-M2.5、DeepSeek-V4-Flash、Qwen3.5-35B,各自配 Claude Code 或 Codex。主攻击者模型是 GPT-4o mini,循环预算 B=20。
    • 数据:ASB 有 400 例(10 个智能体 × 40 个攻击者工具),无提示变体扩充,划分 80/40/280。AgentHarm 有 52 个基础行为及四种提示变体,共 208 例,划分 40/20/148。§3.1 规定测试划分只评最终接受的技能;Table 1 标题未再写划分名称。
    • 演化模型:MiniMax 与 DeepSeek 的技能演化用 Claude Opus 4.8;Qwen 用 Codex GPT-5.6 Terra,high reasoning effort。R=4,minibatch 8,编辑上限 L=6,分层抽样,seed=42。
    • 基线:No Jailbreak 是不用攻击工具、也不走攻击者循环的单次原始提示查询。孤立工具为 GCG、AmpleGCG、AutoDAN、Template、FlipAttack、RolePlay。自动红队基线为 RedCodeAgent 与 MAJIC。
    • 指标:ASB 的 ASR 是目标执行攻击者目标的案例比例,用 ASB 原生子串检查。HarmScore 按 AgentHarm 评分协议,取每例 grader checks 的均值,范围 [0, 1],以百分比报告。RR 是目标明确拒绝请求的案例比例。Table 2 另报每例平均攻击工具调用次数。论文未写明 AgentHarm grader 的模型,也未报告重复次数或人工一致性。
    • 优化后端:GCG、AutoDAN 的白盒替代模型是 Qwen2.5-7B-Instruct;AmpleGCG 用 Llama-2-7B-chat 生成器。随后提交 black-box 目标。

    主结果

    下表只摘 Table 1 的 ASR(ASB)或 HarmScore(AgentHarm),单位为百分比。表注称加粗标出该行 ASR 或 HarmScore 最高者;这里不沿用加粗。省略四行,见表后。

    表格较宽,可左右滑动

    设置(Table 1)No JailbreakFlipAttackRedCodeAgentMAJICRedEvoAgent
    ASB ASR,MiniMax-M2.5,Claude Code72.5%91.8%76.4%74.2%93.2%
    ASB ASR,DeepSeek-V4-Flash,Claude Code83.9%94.3%90.7%94.6%99.3%
    ASB ASR,Qwen3.5-35B,Claude Code82.8%83.9%79.6%80.6%87.1%
    ASB ASR,MiniMax-M2.5,Codex63.2%81.1%75.3%71.0%92.8%
    ASB ASR,DeepSeek-V4-Flash,Codex97.1%94.6%98.6%98.9%100.0%
    AgentHarm,MiniMax-M2.5,Claude Code9.2%18.6%20.9%22.6%20.8%
    AgentHarm,DeepSeek-V4-Flash,Claude Code47.7%67.9%37.5%45.5%74.3%
    AgentHarm,Qwen3.5-35B,Claude Code5.1%5.7%9.6%11.1%15.1%
    • 作者的比较:作者称不同目标智能体抵抗不同工具,没有单一工具对全部组合成功,因此需要组合工具。作者称 RedEvoAgent 在每个设置上不低于最强孤立工具;点名的两例是 AgentHarm、DeepSeek-V4-Flash、Claude Code 的 74.3 对 FlipAttack 的 67.9,以及 ASB、MiniMax-M2.5、Codex 的 92.8 对 FlipAttack 的 81.1。FlipAttack 不是每行最高的孤立工具:Claude Code、ASB、Qwen3.5-35B 上 RolePlay 为 84.9%,FlipAttack 为 83.9%。
    • 与自动红队基线:作者称相对 RedCodeAgent 和 MAJIC,多数设置更高,且只在 MiniMax-M2.5、AgentHarm、Claude Code 上略低于 MAJIC(20.8 对 22.6)。Table 1a 同一行 RedCodeAgent 为 20.9,也高于 20.8。作者在结论中称全部实验设置上都优于现有自动红队方法;这一句与该行不一致。同表还写,该设置下 RedCodeAgent 的检索轨迹没有超过 FlipAttack(37.5 对 67.9 HarmScore)。
    • 低于无攻击的工具:作者称许多行上 GCG、AmpleGCG、AutoDAN 低于 No Jailbreak,因为迁入的后缀或模板前缀在产品级 harness 中更异常、提高拒绝,而 FlipAttack、RolePlay 一类语义伪装更强。同表的 RR 并不总随 ASR 反向变化:ASB、MiniMax-M2.5、Claude Code 上 RedEvoAgent 为 93.2%/6.1%,FlipAttack 为 91.8%/3.9%。省略行的 RedEvoAgent 为:ASB、Qwen3.5-35B、Codex 94.6%;AgentHarm、MiniMax-M2.5、Codex 21.7%;AgentHarm、DeepSeek-V4-Flash、Codex 74.4%;AgentHarm、Qwen3.5-35B、Codex 20.9%。

    技能贡献

    • 测了什么:Table 2 在 ASB 与 AgentHarm、Claude Code 与 Codex 上比较 No Skill、Human Skill 和演化技能,只含 MiniMax-M2.5 与 DeepSeek-V4-Flash,不含 Qwen3.5-35B。No Skill 用默认系统提示、不插入技能文档;Human Skill 插入改写自 RedCodeAgent 攻击者提示的通用人工指导。
    • 结果:作者称演化技能在每个已评设置上攻击表现最高,且每例攻击工具调用最少。例如 ASB、MiniMax-M2.5、Claude Code 为 77.5/3.0、78.3/3.2、93.2/1.8;AgentHarm、DeepSeek-V4-Flash、Claude Code 为 34.3/3.0、40.5/3.0、74.3/2.2。斜线后是平均攻击工具调用次数。
    • 例外:Human Skill 并非总高于 No Skill。AgentHarm、MiniMax-M2.5 上,Claude Code 为 13.1/4.2 对 15.4/3.9,Codex 为 13.5/4.1 对 15.5/3.9。作者未对此单独解释。

    经验组件与棘轮轮数

    • 组件:Table 3 在 ASB 测试集、MiniMax-M2.5、Claude Code 上去掉单项经验。完整系统 ASR 93.2%;去掉工具画像、轨迹收集、Deciding-Tool Attribution 后分别为 76.9%、85.0%、87.5%。作者报告的降幅为 −16.3、−8.2、−5.7。作者称没有画像时缺少这一先验、工具选择是盲目的;没有轨迹就看不到工具如何组合与排序;没有归因时,攻击者原有偏好会被写回技能。轨迹收集关闭时,归因不适用。
    • 轮数:Figure 3 的横轴是最大棘轮轮数 R,R=0 为 No Skill;纵轴在 ASB 上是 ASR,在 AgentHarm 上是 HarmScore。论文只给出部分读数:ASB/MiniMax 接受 R1 和 R3,测试 ASR 93.2;AgentHarm/DeepSeek 接受到 R3,测试 HarmScore 74.3;ASB/DeepSeek 在 R1 后验证 ASR 达到 100,其后轮次停止,测试 ASR 99.3。
    • 例外:AgentHarm/MiniMax 上,R4 把验证 HarmScore 从 18.5 提高到 28.1,但相对 R2 把测试 HarmScore 从 28.8 降到 20.8。作者检查接受的技能后认为,一种可能解释是 R4 从广泛、单次覆盖不同工具转向反复采样 FlipAttack 和 RolePlay;更集中的策略在验证划分上得分更高,但向更广的测试行为推广较差。作者称更多样的验证划分是一种可能的补救。图注称门控只用验证分数,拒绝候选不做测试。

    零样本迁移

    • 测了什么:Table 4 取用 GPT-4o mini 和 Claude Code 为 MiniMax-M2.5 演化的技能,不重新演化,固定目标模型与 ASB 测试集,改攻击者模型或目标 harness。
    • 结果:攻击者换成 Qwen3-8B 时,No Skill 89.7%,迁移技能 95.3%(表中增益 +5.6);换成 Qwen3-4B 时为 83.3% 与 90.6%(+7.3)。harness 从 Claude Code 换到 Codex 时,No Skill 80.8%,迁移技能 90.5%(+9.7)。作者称这保留了直接为 Codex 演化的技能所达到的 92.8% ASR 中的大部分,因而技能在演化时所用的攻击者模型和 harness 之外仍然有用。
    • 何时有用:§4.5 无新数字。作者称技能在工具箱抵抗不均、不同工具暴露互补弱点时最有用;当 No Jailbreak 或某一孤立工具已接近饱和时,剩余空间很小。作者称跨目标结果与该模式在定性上一致。

    其他消融与分析

    • 论文没有再报告其他数值消融;GCG/AutoDAN/AmpleGCG 的替代模型与迁移协议见 §4.1。
    • 论文未报告统计显著性检验、重复次数、总查询次数;效率指标是 Table 2 的每例平均攻击工具调用次数。
    • Prompt Substitution 的辅助 LLM 名称未写明。
  5. 有什么可以进一步探索的点?

    论文未设局限或未来工作专节。

    作者指出的局限与后续方向

    论文未专门讨论局限,也没有 Limitations、Discussion 或 Future Work 专节。Conclusion 写新攻击工具可以加入同一评测与演化流程,但表现依赖工具箱的强度与多样性;该句没有被标成局限或后续工作。

    实验覆盖范围

    • 目标与环境:Table 1 覆盖 MiniMax-M2.5、DeepSeek-V4-Flash、Qwen3.5-35B,以及 Claude Code、Codex 两种目标执行 harness,基准为 ASB 与 AgentHarm。
    • 划分与预算:ASB 为 400 例、划分 80/40/280;AgentHarm 为 208 例、划分 40/20/148。主攻击者是 GPT-4o mini,循环预算 B=20;技能演化最多 R=4,minibatch 8,编辑上限 L=6,seed=42。
    • 对照与消融:攻击对照含 No Jailbreak、六种孤立工具、RedCodeAgent 和 MAJIC。Table 2 的技能比较只含 MiniMax-M2.5 与 DeepSeek-V4-Flash;Table 3 只在 ASB 测试集、MiniMax-M2.5、Claude Code 上做组件消融。
    • 迁移:Table 4 的源技能由 GPT-4o mini 在 Claude Code、MiniMax-M2.5 上演化,目的端攻击者是 Qwen3-8B 与 Qwen3-4B,目的端 harness 是 Codex,基准为 ASB 测试集。
    • 论文未报告的项目:重复次数、AgentHarm grader 的模型名称、评审与人工的一致性、Prompt Substitution 的辅助 LLM,以及总查询次数。GCG 与 AutoDAN 在 Qwen2.5-7B-Instruct 上优化,AmpleGCG 使用 Llama-2-7B-chat 生成器,再把提示提交 black-box 目标。
  6. 总结一下论文的主要内容

    RedEvoAgent用验证棘轮演化可读攻击技能,在两种产品级harness上多数设置高于固定工具与红队基线。

    RedEvoAgent 是面向产品级 black-box 智能体的自动红队方法,用一份可演化、人类可读的攻击技能编排多个越狱工具。

    • 问题:作者认为 Claude Code、Codex 一类 harness 使越狱可能造成有害工具使用和持久状态改变。固定攻击只覆盖有限机制;按相似度检索整条成功轨迹可能复用误导经验,并增加上下文开销、降低可审计性。
    • 做法:攻击者在 ReAct 循环中按技能调用工具箱或查询目标,预算 B=20。训练划分上单独测量工具,并收集轨迹;Deciding-Tool Attribution 把成功记到紧邻成功查询的工具,以避免把共现当成贡献。Reflect 与 Rewrite 生成候选技能,验证棘轮只接受验证分数严格更高的版本。GCG、AutoDAN、AmpleGCG 先在替代模型上产生提示,再迁移到 black-box 目标。
    • 主比较:ASB 与 AgentHarm、三种目标模型、两种 harness 上,作者称 RedEvoAgent 不低于最强孤立工具。Table 1 的例子包括 Claude Code、ASB、MiniMax-M2.5 的 ASR 93.2%,Codex、ASB、DeepSeek-V4-Flash 的 100.0%,以及 Claude Code、AgentHarm、DeepSeek-V4-Flash 的 HarmScore 74.3%。同一表中,Claude Code、AgentHarm、MiniMax-M2.5 上 RedEvoAgent 为 20.8%,低于 MAJIC 的 22.6% 和 RedCodeAgent 的 20.9%。
    • 技能与迁移:Table 2 中演化技能在已评设置上攻击分数最高、平均工具调用最少;Human Skill 在 AgentHarm、MiniMax-M2.5 上低于 No Skill。去掉工具画像后,ASB 测试集、MiniMax-M2.5、Claude Code 的 ASR 从 93.2% 降到 76.9%。零样本迁移到 Codex 的 ASR 为 90.5%,No Skill 为 80.8%(Table 4)。
    • 作者结论:作者称演化技能明确记录工具优先级和攻击策略,并可跨攻击者模型与目标 harness 迁移;新工具可以进入同一流程,但表现依赖工具箱的强度与多样性。作者称复现的目标执行 harness 可为后续智能体红队研究提供可复用基础设施。结论中“全部设置上优于现有自动红队方法”与 Table 1 的 20.8% 一行不一致。
阅读原文arxiv.org