攻击arXiv 2607.26115
OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
- arXiv
- 2607.26115
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 黑盒
- 测试
- GPT-5.6、GPT-5.5、GPT-5.4 等 8 个
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹