防御arXiv 2609.02786
SafeEvolve:基于智能体经验的 Harness-Policy 协同演化安全对齐框架
提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
- arXiv
- 2609.02786
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Qwen3.5-4B、Qwen3-4B-Instruct-2507、Qwen3.5-1.7B 等 4 个
摘要SafeEvolve 用轨迹证据协同更新安全 harness 和策略,在两个 4B 模型的智能体安全基准上改变安全与效用。
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。