攻击arXiv 2607.26115·7月29日OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击arXiv2607.26115发表7月29日层应用层场景AI Agent攻击者黑盒测试GPT-5.6、GPT-5.5、GPT-5.4 等 8 个攻击提示注入技术自动化搜索+1+1深度解读完整解读
防御arXiv 2609.05903·9月5日EvoSafeHarness:为 Agent 自动演化模型与领域专属安全护栏提出 EvoSafeHarness,为冻结模型与目标域自动搜索安全 harnessarXiv2609.05903发表9月5日层应用层场景AI Agent测试Sonnet 4.6、GLM-5、Kimi-K2.5 等 10 个防御权限与审批攻击提示注入组件权限与沙箱+2+2深度解读完整解读