跳到正文
原文
论文追踪· arXiv:2609.02786· Qinghua Mao, Wanying Qu, Dadi Guo, Leitao Yuan, Qingyu Liu, Yu Li, Guanxu Chen, Yanwei Fu, Xi Lin, Xia Hu, Dongrui Liu·本站收录 · 原文发表

SafeEvolve:基于智能体经验的 Harness-Policy 协同演化安全对齐框架

SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment

论文速读

对齐/训练方法

据论文 PDF 整理(AI 生成),以原文为准

SafeEvolve 用轨迹证据协同演化安全 harness 与策略。Qwen3.5-4B 在 AgentDojo 上 ASR 从 2.37% 降到 0.79%,良性效用从 59.79% 升到 61.86%。

问题
LLM 智能体的安全同时受基座策略和外部 harness 影响,失败可出现在最终回复和多步轨迹中。单独更新 harness 或只优化策略,都难以同时维持运行时控制与内在安全。
方法
SafeEvolve 用已完成的 on-policy 轨迹驱动 harness 与策略协同演化。Harness 侧把轨迹证据编成可审计、可回滚的安全提示词和分层技能更新;策略侧先做 harness-use SFT,再用验证器分解的安全-效用奖励做 harness-augmented RL。
实验与结果
在 AgentDojo、AgentDyn 和 AgentHarm 上,作者称 SafeEvolve 的安全-效用权衡优于 SFT、DPO、GRPO、MetaSecAlign 和 AgentAlign。Qwen3.5-4B 的 AgentDojo ASR 从 2.37% 降到 0.79%,AgentHarm harmful score 从 56.45 降到 12.27。
局限与可以继续做的
作者指出递归仍是一阶的,搜索与更新日程固定;开放式演化还需要不可改写的安全锚点、独立验证器和回归预算。主实验骨干为两个 4B 模型,跨策略迁移评测了 1.7B、4B 和 8B,论文未报告统计显著性检验。
实验设置Qwen3.5-4B、Qwen3-4B-Instruct-2507 等 · AgentDojo、AgentDyn 等 · ASR、Utility 等
威胁模型
工具调用智能体面临恶意查询与环境注入两条对抗通道。攻击者可控制用户请求或环境观测的一部分,不能控制模型参数或已注册工具 API。
模型
Qwen3.5-4BQwen3-4B-Instruct-2507Qwen3.5-1.7BQwen3.5-8B
基准
AgentDojoAgentDynAgentHarm
指标
ASRUtilityU-AttackHarmful scoreRefusalBenign score
AI 导读全文 266 字

SafeEvolve 是一个经验驱动的智能体安全对齐自演化框架,通过已完成 on-policy 轨迹中的安全经验驱动 harness 与 policy 的持续协同演化。harness 侧将轨迹级安全证据转化为安全提示词与分层技能的有界组件级更新,policy 侧采用两阶段 SFT-RL 范式,用 harness 增强的 RL 与验证器分解奖励塑造多步探索中的自主安全行为。在 Qwen3.5-4B 上,SafeEvolve 在 AgentDojo 实现 ASR 降低 3 倍,同时将良性效用从 59.79% 提升至 61.86%。

深度解读

6 个问题,约 9,300 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    单独改 harness 或只训策略都难以兼顾运行时控制与内在安全,SafeEvolve 用轨迹证据让二者协同演化。

    如何把已完成轨迹中的安全经验,同时变成可审计的运行时 harness 和更安全的策略行为。

    • 场景:作者认为 LLM 智能体经 harness(指令、技能、记忆等模型外部可编辑组件)与环境交互,风险既出现在有害最终回复,也出现在多步执行轨迹,例如不安全工具调用,或跟随被注入指令的计划。
    • 现有不足:作者称,外部 harness(指令、技能、运行时护栏)可能超出弱冻结策略的执行能力,并在多步执行中与动作脱节;只更新策略则是在固定 harness 下优化,静态训练基底难以覆盖新失败模式,且参数中的安全能力难以跨模型迁移。
    • 核心假设:已执行轨迹含有风险模式,但原始轨迹不能直接变成可泛化的安全能力;把轨迹级证据外化为有界 harness 更新,再内化进策略,才能形成持续的安全自改进。
    • 提出方法:作者提出 SafeEvolve,用 on-policy 轨迹驱动 harness 与策略的持续协同演化:harness 侧更新安全提示词和分层技能,策略侧用两阶段 SFT-RL 把这些工件内化。
    • 威胁模型:
      • 受害系统:通过自然语言动作和工具调用与外部环境交互的多步 LLM 智能体。
      • 恶意查询:用户指令本身表达有害意图,可能诱导有害内容或不安全工具调用,包括隐私泄露或未授权操作。
      • 环境注入:用户目标良性,但网页、文件或工具输出中的对抗指令可能把智能体引向数据泄露或未授权动作。
      • 攻击者知识与能力:攻击者可控制用户请求,或环境观测的一部分;论文写明不能控制模型参数或已注册工具 API。论文未写 white-box、black-box 或 no-box。
  2. 有哪些相关研究?

    相关工作分智能体安全对齐与经验驱动演化两条线;SafeEvolve 把经验用于安全上的 harness-策略协同演化。

    智能体安全对齐

    • 响应级对齐:Ouyang 等(2022)、Bai 等(2022)、Rafailov 等(2023)主要对齐最终回复,例如拒绝有害请求并保留有用性。
    • 轨迹级风险与诊断:Zhang 等(2025a)、Debenedetti 等(2024)、Li 等(2026c)、Andriushchenko 等(2025)、Xie 等(2025)指出工具使用智能体还有间接提示注入、有害工具使用和隐私泄露;Liu 等(2026c;b)的诊断框架评估执行过程中的安全。
    • 模型级对齐:Zhang 等(2025b)、Yin 等(2026)、Jiang 等(2026)、Fu 等(2026)、Li 等(2026b)用面向安全的训练、轨迹偏好优化或中间步修正更新策略。论文指出这些方法主要在固定或隐式运行时上下文下更新策略。

    经验驱动的智能体演化

    • Harness 演化:Lin 等(2026a)、Chen 等(2026b;a)、Qu 等(2026)持续改进提示词、记忆、工具、中间件或其他外部组件以提升后续表现。
    • 经验外化再蒸馏:Xia 等(2026)、He 等(2026)、Wang 等(2026)、Lu 等(2026)把可复用经验抽象为技能等外部知识,再用强化学习或自蒸馏写回策略。

    基线方法与基准

    • 基线方法:通用训练为 SFT、DPO(Rafailov 等,2023)、GRPO(Shao 等,2024);安全对齐为面向提示注入鲁棒性的 MetaSecAlign(Chen 等,2025b),以及面向更安全智能体行为的 AgentAlign(Zhang 等,2025b)。
    • 基准/数据集:AgentDojo(Debenedetti 等,2024)、AgentDyn(Li 等,2026c)评环境注入;AgentHarm(Andriushchenko 等,2025)评恶意多步用户请求。训练环境是用 LLM 生成的有限状态 Python 模拟器。

    作者把本文定位为同一套经验驱动演化思路,但对象是安全而不是能力:积累可复用安全经验,经安全 harness 外化,再内化进策略,形成持续安全对齐。

  3. 论文如何解决这个问题?

    SafeEvolve 先把轨迹失败编成有界、可回滚的 harness 更新,再用两阶段 SFT-RL 在演化后的 harness 下内化安全行为。

    SafeEvolve 是一个持续循环:冻结策略在当前 harness 上产生轨迹,轨迹证据驱动有界 harness 更新;演化后的 harness 再经两阶段 SFT-RL 写进策略。作者写明式 (2) 只描述期望的系统行为,并不作为单一联合优化求解。

    问题设定与安全 harness

    • 交互:任务 x 来自分布 D。第 t 步策略观察历史 ht 和 harness 渲染的上下文,发出回复或结构化工具调用 at,得到观测 ot+1。轨迹在停止动作或最大视野 T 结束。
    • Harness:式 (3) 把 harness 写成 H := (I, T, S, Π, Φ, Γ),分别对应指令、可用工具、检索到的技能、权限与动作策略、指令优先级与信息流约束、渲染与执行控制器。给定 x 和初始状态 D0,执行得到轨迹 τH 和最终输出 y。
    • 可演化部分:工具与环境接口固定。Csafe(H) 是暴露给执行循环的安全相关组件;实现中主要是安全提示词和检索到的安全技能。

    观测驱动的 harness 演化

    • 证据:在冻结策略 πθ0 与当前 harness Hk 上收集 Devo,含轨迹、任务类型奖励 R(τ)、成功类别或失败桶 bi,以及领域、场景、攻击类型、工具族、任务类型等元数据 mi。这些轨迹不更新 πθ0。
    • 有界变异:提议器只选一个组件 ckj 生成变异 Δkj,其余组件不变,得到候选 harness。父子 harness 在同一批任务和环境上比较。
    • 接受规则:内部 rollout 面板上,候选的平均任务类型回报不低于父代加 δ,且门控 G 不拒绝。G 拒绝在内部 rollout 上使安全、清洁任务效用或执行质量回退的候选。接受的编辑带证据和回滚元数据,形成可追溯的 H⋆。δ 的具体数值论文未在正文给出。

    分层技能与 harness-use SFT

    • 技能库:S⋆ = {Sg, Sk, Sm},分别是任务无关的安全原则、任务/工具特定流程、反复出现的错误修正。每回合只检索 Sx = Retrieve(S⋆, x, mx, h1),与安全提示词 P⋆ 一起渲染进上下文,并在该回合内固定。
    • 冷启动:在演化后的 Runtime SkillBank 下收集 rollout,保留通过任务类型安全与效用验证器的轨迹,只对助手回复和工具调用做 SFT,损失为式 (10)。系统指令、用户消息、渲染技能和工具观测只作上下文。作者称这一步让策略学会使用相关技能、忽略无关或缺失的技能上下文,并在识别到不安全环境指令后继续良性执行。

    验证器分解奖励与策略优化

    • 奖励:规则验证器给出任务完成的效用分 U(τ)、基于风险是否成功的安全分 S(τ),并把解析失败和无效工具调用罚为执行无效。任务类型 z(x) ∈ {clean, query, injection}。清洁任务奖励为 U(τ);恶意查询奖励为 S(τ);环境注入为 λU U(τ) + λS S(τ) + λUS U(τ)S(τ)。三个 λ 在所有骨干和训练运行中固定,论文称具体值在附录 A.5。
    • 优化:每个任务在 P⋆ 和 Sx 下采样一组 G 条轨迹,用组内相对优势(式 12)和带 clip 与 KL 的目标(式 13)更新。奖励在轨迹级赋值,更新改变中间工具调用、拒答和恢复决策的动作概率。参考策略 πref 固定。

    持续协同循环与训练设置

    • 循环:每批 rollout Dr 由显式的策略-harness 对 (πθr, Hr) 生成。当前批在活跃 harness 下更新策略;近期窗口 Dr−w:r 的证据用于提议并验证下一轮 harness。
    • 训练规模:骨干为 Qwen3.5-4B 与 Qwen3-4B-Instruct-2507。每次运行 200 个 rollout step;每批 32 个任务,每个任务提示词采样 8 条 rollout,每次更新 256 条轨迹。最大提示词长度 4096 tokens,学习率 1×10−6。技能库含 general、task-specific 和 common mistakes。
  4. 论文做了哪些实验?

    两个 4B 骨干上,SafeEvolve 在 AgentDojo 上 ASR 最低,并在 AgentHarm 上同时压低 harmful score、提高 refusal。

    实验设置

    • 被测模型:主实验骨干为 Qwen3.5-4B 和 Qwen3-4B-Instruct-2507。跨策略 harness 迁移另评测由 Qwen3.5-4B 演化出的 harness 在其他规模基座策略上的表现,正文写 1.7B、4B 和 8B 目标;Figure 6 未给出这些目标的完整模型名。提议器消融比较 GPT-5.5、DeepSeek-Chat 和 GLM-5.1。
    • 基准:AgentDojo 与 AgentDyn 评环境注入下的工具使用;AgentHarm 评有害多步用户请求,作为主要恶意查询基准。论文未写这三项基准的样本条数。训练任务套件含清洁任务、环境注入任务和恶意查询任务,环境为 LLM 生成的有限状态 Python 模拟器。
    • 基线:SFT、DPO、GRPO 使用同一环境奖励;GRPO 不用演化后的 harness。安全对齐基线为 MetaSecAlign 和 AgentAlign。
    • 指标:AgentHarm 报告 harmful score、harmful refusal、benign score。AgentDojo 与 AgentDyn 报告 utility、utility under attack(U-Attack)、ASR。论文未写 ASR 或分数的计算公式、评审模型或判定阈值,奖励来自规则验证器。
    • 训练重复:正文给出 200 rollout steps、每批 32 任务、每提示词 8 条 rollout。论文未报告评测重复次数或随机种子数。

    主结果

    Table 1 的百分比与分数如下。作者称 SafeEvolve 在两个骨干上取得更好的安全-效用权衡;表中 AgentHarm 的 benign score 并不总是高于基线。

    表格较宽,可左右滑动

    方法Dojo ASR↓ / Util↑Dyn ASR↓ / Util↑Harm↓ / Ref↑ / Ben↑
    Base(Qwen3.5-4B)2.37 / 59.796.88 / 15.0056.45 / 28.98 / 83.09
    SafeEvolve(Qwen3.5-4B)0.79 / 61.864.51 / 15.0012.27 / 83.83 / 71.31
    AgentAlign(Qwen3.5-4B)2.29 / 61.866.83 / 15.0034.94 / 53.61 / 79.85
    GRPO(Qwen3.5-4B)1.77 / 30.935.36 / 11.6763.82 / 25.14 / 85.30
    Base(Qwen3-4B-Instruct-2507)13.38 / 44.3319.60 / 20.0034.96 / 7.39 / 43.57
    SafeEvolve(Qwen3-4B-Instruct-2507)2.42 / 60.824.87 / 25.0015.47 / 71.93 / 63.43
    AgentAlign(Qwen3-4B-Instruct-2507)2.69 / 18.564.60 / 5.002.85 / 87.50 / 15.84
    MetaSecAlign(Qwen3-4B-Instruct-2507)8.62 / 56.7010.62 / 20.0024.79 / 2.87 / 34.18

    据 Table 1。Dojo、Dyn 列为 ASR 与 Utility;Harm 列为 Harmful、Refusal、Benign。U-Attack 未列入该表。Qwen3.5-4B 上 AgentDojo ASR 最低的是 SafeEvolve(0.79),低于 SFT/DPO 的 1.53、GRPO 的 1.77、MetaSecAlign 的 1.97。Qwen3-4B-Instruct-2507 上 AgentHarm harmful score 最低的是 AgentAlign(2.85),其 AgentDojo Utility 为 18.56、AgentHarm Benign 为 15.84,均低于 SafeEvolve。

    • 作者解读:作者称 SafeEvolve 在两个骨干上 AgentDojo ASR 最低,在 Qwen3.5-4B 上 AgentHarm 安全最强,并在 Qwen3-4B 上把 AgentDyn utility 提高到基座之上(25.00 对 Base 的 20.00)。SFT 与 DPO 降低注入 ASR,但对恶意查询的防御有限;GRPO 改善部分安全指标,同时工具使用效用下降。
    • 例外:Qwen3.5-4B 上 SafeEvolve 的 AgentHarm Benign 为 71.31,低于 Base 的 83.09;AgentDojo U-Attack 为 56.77,低于 Base 的 60.04。Qwen3-4B-Instruct-2507 上 GRPO 的 AgentHarm Harmful 为 57.11,高于 Base 的 34.96,Refusal 为 2.27,低于 Base 的 7.39。
    • 摘要与正文数字:摘要写 Qwen3.5-4B 在 AgentDojo 上 3× ASR 下降,且良性效用从 59.79% 到 61.86%。Table 1 中该设置 ASR 从 2.37% 到 0.79%。引言同时写 ASR 从 2.37% 到 0.79%,AgentHarm harmful score 从 56.45 到 12.27,refusal 从 28.98% 到 83.83%。

    冻结策略的 harness 与协同演化

    • 只改 harness:Table 2 冻结策略。Qwen3.5-4B 上,Evolved skills 的 AgentDojo ASR 为 0.92、Utility 为 64.95,AgentHarm Harmful 为 16.80、Refusal 为 76.97;Evolved prompt 的 AgentDojo ASR 为 1.27,AgentHarm Harmful 为 43.49、Refusal 为 48.85。Qwen3-4B-Instruct-2507 上,Evolved skills 的 AgentDojo ASR 为 2.03,Evolved prompt 为 5.77,Base 为 13.38。作者称检索到的流程指导比单一全局提示词更有用,且无需训练即可提高安全。
    • Figure 3:作者报告,在 Qwen3.5-4B 上,仅模型 RL 把 AgentDojo utility under attack 从 60.04 降到 26.48,AgentHarm harmful score 从 56.45 升到 63.82。与演化提示词协同演化把 harmful score 降到 33.88,同时 AgentDojo utility under attack 降到 41.97。与演化技能协同演化保留 56.77 的 utility under attack,AgentDojo ASR 从 2.37 到 0.79,harmful score 到 12.27。相对仅 harness(技能)的 16.80 和 0.92,协同演化分别为 12.27 和 0.79。图中未标注的端点不写。
    • 技能库动态:Figure 4 中活跃技能库从 26 条增至 47 条,增长主要来自 task-specific 和 common-mistake,general skills 保持固定。作者称右图的绝对 attacked reward 轨迹上,门控保留改进或维持已接受路径的编辑,并剪掉被拒绝候选;图注写接受的编辑涉及含糊的预订 ID、被引用的删除目标、缺失工具参数、嵌套来源中的精确目标,以及避免编造更新字段。论文未给出该图的具体奖励数值。

    检索、提议器与跨策略迁移

    • 检索:Table 3 的列是 AgentDojo 与 AgentDyn 的 U-Attack、ASR,以及 AgentHarm 的 Harm、Ref。论文未写明这张表的策略是冻结还是已训练。Default retrieval 为 60.72 / 0.92、17.06 / 4.38、16.80 / 76.97;No skill-bank retrieval 为 60.04 / 2.37、15.45 / 6.88、56.45 / 28.98,与 Table 1、Table 2 中 Qwen3.5-4B Base 的对应数字相同,但表标题未写模型。General skills only 的 AgentDojo ASR 为 0.74、U-Attack 为 56.19,AgentHarm Harm 为 30.59、Ref 为 65.71。No dynamic-skill priority 的 AgentDojo ASR 为 0.90,AgentHarm Harm 为 32.03、Ref 为 64.00。作者称通用技能已能降低 ASR,但牺牲 AgentDojo 效用,且在 AgentHarm 上更弱;没有动态技能优先级时,注入 ASR 变化小,有害遵从上升、拒答下降。
    • 提议器:Figure 5 比较 GPT-5.5、DeepSeek-Chat、GLM-5.1 相对 base harness 的安全-效用移动。作者称三个提议器都离开基点,朝向更低的攻击或有害遵从,并保持或提高配对的效用轴;AgentHarm 上三者聚在比 base harness 更安全的区域。作者称 GPT-5.5 偏向更高的 AgentDojo utility,DeepSeek-Chat 给出最低的 AgentDojo ASR,AgentDyn 上效用和 ASR 的提议器差异更大。图中未标注具体坐标,论文未报告这些点的数值。
    • 迁移:Figure 6 把 Qwen3.5-4B 上演化的 prompt 或 skill bank 直接用于其他基座策略,不再训练或重新演化。作者称 1.7B 上迁移最弱:prompt 与 skill 略提高 AgentDojo 鲁棒性,但不能修复接近零的 AgentDyn utility;4B 上演化技能库同时改善环境注入 ASR、AgentHarm harmful score 和良性 AgentHarm 行为;8B 上各基准安全改善,但 attacked utility 可能下降。图中数值论文未在正文列出。

    其他消融与分析

    • 失败桶:Figure 7 比较父 harness 与被接受候选。作者称被接受更新主要减少执行恢复类失败:不必要追问、发现注入后立即停止、达到轮次上限、任务完成前结束;这些减少主要出现在 important-instruction、direct-attack、ignore-previous 等被攻击设置。主要权衡是 safe-but-incomplete 小幅增加。论文未给出各类失败的频数。
    • 定性案例:Figure 8 为同一酒店预订任务上 Qwen3-4B 的成对轨迹。作者称两条轨迹都检索评分并完成原预订,因而只看最终工具路径会掩盖差异;base 策略在可见决策文本中重复观测里的注入推荐,skill-augmented 策略把外部指令视为无权威并保持原用户请求。附录给出另一条 AgentHarm 成对轨迹,说明技能增强策略拒绝有害用户目标且不为此调用工具。
    • 在线更新的回退:附录 D 提到 Table 7,称在线更新改善部分指标的同时在其他指标上回退。正文摘录未给出 Table 7 的数字,此处不写具体数值。
  5. 有什么可以进一步探索的点?

    作者认为当前协同演化仍是固定日程下的一阶递归,开放式任务还需要不可改写的安全约束。

    作者指出的局限与后续方向

    • 一阶递归:附录 D 写,每个策略-harness 对产生的轨迹会告知后继,但因搜索和更新日程固定,递归仍是一阶的。后续可做成多时间尺度的元演化,同时优化 harness 工件、策略参数,以及协调二者演化的元策略。
    • 快慢循环:同一节提出快循环 harness 把新风险外化为可审计规则,较慢的策略循环内化反复出现的安全行为,元控制器按不确定性、复现和成本调节更新时机。
    • 纵向评测:附录 D 写,要展示真正的自改进,需要纵向、多代评测,而不是静态基准;未来协议应跟踪策略-harness 谱系,衡量持续安全收益、最坏情况回退、后向保持和计算效率。作者引用 Lin 等(2026b)的说法:生成 harness 更新不同于有效执行这些更新。
    • 开放式任务:附录 D 写,静态攻击分布本身限制了演化智能体能发现的安全边界。后续可合成可执行风险环境,并协同演化红队对手、安全课程和智能体防御。
    • 评测漂移与奖励投机:同一节写,不受约束的开放式演化会提高 evaluator drift 和 reward hacking 的风险,智能体可能优化内部代理而没有达成真正安全;Table 7 被作者用来说明在线更新改善选定指标的同时在其他指标上回退。
    • 可控边界:附录 D 写,演化动态应受不可演化的安全锚点、独立验证器、最坏情况安全下限和固定回归预算约束;候选更新应沙箱化并保留完整来源,高影响变更需要人工监督,评测器保持不可改写。

    实验覆盖范围

    • 主结果模型:Table 1 的训练与评测骨干为 Qwen3.5-4B 和 Qwen3-4B-Instruct-2507,各比较 Base、SFT、DPO、GRPO、MetaSecAlign、AgentAlign、SafeEvolve。
    • 基准与指标:评测环境为 AgentDojo、AgentDyn、AgentHarm,指标为 Utility、U-Attack、ASR、Harmful、Refusal、Benign;训练环境为 LLM 生成的有限状态 Python 模拟器,任务类型为 clean、environment-injection、malicious-query。
    • 消融:Table 2 冻结策略,比较 Base、Evolved prompt、Evolved skills。Figure 3 在 Qwen3.5-4B 上比较 model-only RL、harness-only、Coevo-Prompt、Coevo-Skill。Table 3 比较四种技能检索设置。Figure 5 的提议器为 GPT-5.5、DeepSeek-Chat、GLM-5.1。
    • 迁移与机制:Figure 6 的源 harness 在 Qwen3.5-4B 上演化,目标为 1.7B、4B、8B 基座策略且不再训练。Figure 4 记录技能库从 26 到 47 条及接受/拒绝。Figure 7、Figure 8 分析失败桶和成对轨迹。
    • 论文未报告:正文未报告评测重复次数、ASR 的判定模型,以及 δ、三个 λ、G 和 KL 系数 βKL 的具体数值;这些系数被写为在附录 A.5 或由门控定义。论文未报告统计显著性检验。
  6. 总结一下论文的主要内容

    SafeEvolve 用轨迹证据协同更新安全 harness 和策略,在两个 4B 模型的智能体安全基准上改变安全与效用。

    SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。

    • 问题:智能体安全同时取决于基座模型和外部 harness。作者认为只演化 harness 可能超出弱策略的执行能力,只优化策略又绑在固定 harness 上,且安全参数难以跨模型迁移。威胁来自恶意用户查询,以及网页、文件、工具输出中的环境注入;攻击者不能控制模型参数或已注册工具 API。
    • 方法:冻结策略的 rollout 先定位到单个组件,只改安全提示词或分层技能中的一项,并用内部回报与回退门控决定接受或回滚。策略在演化后的提示词和检索技能下,先做通过验证器的轨迹 SFT,再按清洁、恶意查询、环境注入三类奖励做组相对策略优化。
    • 主结果:Table 1 中,Qwen3.5-4B 的 AgentDojo ASR 从 2.37% 到 0.79%,Utility 从 59.79% 到 61.86%,AgentHarm harmful score 从 56.45 到 12.27,refusal 从 28.98% 到 83.83%,benign score 从 83.09 到 71.31。Qwen3-4B-Instruct-2507 的 AgentDojo Utility 从 44.33 到 60.82,ASR 从 13.38 到 2.42。
    • 对照:冻结策略时,演化技能在 Table 2 上已降低两个骨干的 AgentDojo ASR。Figure 3 中,Qwen3.5-4B 仅用 RL 时 AgentDojo utility under attack 从 60.04 到 26.48。AgentAlign 在 Qwen3-4B-Instruct-2507 上 harmful score 为 2.85,低于 SafeEvolve 的 15.47,同时 AgentHarm benign score 为 15.84。
    • 作者结论:作者称协同演化得到可用的安全 harness 和更安全的智能体行为,并在环境注入与恶意查询上形成比所列基线更强的安全-效用权衡。附录 D 把当前循环称为固定日程下的一阶递归,并认为开放式演化需要不可改写的评测器、安全下限和回归预算。
阅读原文arxiv.org