GPT-Red:解锁面向鲁棒性的自我改进
GPT-Red: Unlocking Self-Improvement for Robustness
AI 导读
OpenAI 训练了内部自动化红队模型 GPT-Red,用自我对弈强化学习生成提示注入攻击,并将其纳入生产模型训练以提升鲁棒性。OpenAI 称 GPT-5.6 Sol 在最难的直接提示注入基准上失败次数比四个月前最好的生产模型少 6 倍,在 GPT-Red 的直接提示注入上仅 0.05% 失败。在 Dziemian 等人 2025 年的间接提示注入竞技场上,GPT-Red 对 GPT-5.1 的攻击成功率为 84%,人类红队为 13%。GPT-Red 还攻破了 OpenAI 办公室的自动售货机 Agent 和基于 GPT-5.4 mini 的 Codex CLI Agent 的数据外泄场景。早期 GPT-Red 发现的 Fake Chain-of-Thought 攻击在 GPT-5.1 上成功率超 95%,在 GPT-5.6 Sol 上已低于 10%。
推荐理由
OpenAI 公开了用自动化红队模型在训练中生成提示注入攻击的做法,并给出 GPT-5.6 Sol 的鲁棒性提升数据。