防御arXiv 2609.05903·9月5日EvoSafeHarness:为 Agent 自动演化模型与领域专属安全护栏为冻结模型与目标域自动搜索可部署的 Agent 安全 harnessarXiv2609.05903发表9月5日层应用层场景AI Agent被测模型Sonnet 4.6、GLM-5、Kimi-K2.5 等 11 个防御指令与数据隔离攻击提示注入组件权限与沙箱+2+2深度解读完整解读
攻击arXiv 2607.26115·7月29日OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体训练自博弈红队智能体 GPT-Red,规模化生成提示注入与越狱攻击arXiv2607.26115发表7月29日层应用层场景AI Agent攻击者黑盒被测模型GPT-5.6、GPT-5.5、GPT-5.4 等 8 个攻击提示注入技术自动化搜索+1+1深度解读完整解读