攻击arXiv 2607.26115
OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
- arXiv
- 2607.26115
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 黑盒
- 测试
- GPT-5.6、GPT-5.5、GPT-5.4 等 8 个
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱