攻击arXiv 2607.26115
OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
- arXiv
- 2607.26115
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 黑盒
- 测试
- GPT-5.6、GPT-5.5、GPT-5.4 等 8 个
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
测量间接提示注入对类型化概率决策的动作劫持
作者在 jev-1.13.0 上研究 decision hijacking:不可信内容能否在用户任务和可选动作都不变时,把类型化决策推向攻击者目标。
提出 Search Harness,把间接提示注入做成测试时搜索
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
提出跨目标课程强化学习,生成间接提示注入以劫持智能体
该研究针对强化学习自动化提示注入红队在攻击前沿大模型时的冷启动问题,提出了一种基于目标模型鲁棒性递进的课程强化学习方法。
提出 AdaLCPI,把间接提示注入拆成片段嵌入工具返回并自适应优化