防御arXiv 2609.05903
EvoSafeHarness:为 Agent 自动演化模型与领域专属安全护栏
为冻结模型与目标域自动搜索可部署的 Agent 安全 harness
- arXiv
- 2609.05903
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Sonnet 4.6、GLM-5、Kimi-K2.5 等 11 个
为冻结模型与目标域自动搜索可部署的 Agent 安全 harness
提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。
提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改
SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。
训练自博弈红队智能体 GPT-Red,规模化生成提示注入与越狱攻击