防御arXiv 2609.05903
EvoSafeHarness:为 Agent 自动演化模型与领域专属安全护栏
为冻结模型与目标域自动搜索可部署的 Agent 安全 harness
- arXiv
- 2609.05903
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Sonnet 4.6、GLM-5、Kimi-K2.5 等 11 个
为冻结模型与目标域自动搜索可部署的 Agent 安全 harness
提出 SN-Guided Diffusion,利用安全神经元实现离线越狱
论文系统评估了扩散大语言模型(DLLM)在安全对齐中的双重角色——既作为白盒攻击目标,又作为黑盒越狱生成的对抗工具。
训练自博弈红队智能体 GPT-Red,规模化生成提示注入与越狱攻击