攻击arXiv 2607.26115·7月29日OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击arXiv2607.26115发表7月29日层应用层场景AI Agent攻击者黑盒攻击提示注入技术自动化搜索+1+1深度解读完整解读
防御arXiv 2609.38239·9月29日推理层安全:防御对抗性推理与基础设施滥用用 SCM 合成会话并训练检测器识别推理层滥用arXiv2609.38239发表9月29日层基础设施层场景模型与 API被测模型gradient-boosted detector (GBDT/XGBoost)防御检测与过滤攻击越狱+1+1深度解读完整解读