攻击arXiv 2607.26115
OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
- arXiv
- 2607.26115
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 黑盒
- 测试
- GPT-5.6、GPT-5.5、GPT-5.4 等 8 个
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
提出 AHA 自动科研循环,发现生产级智能体的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出计划注入攻击,植入良性表述的有害计划以逃避思维链监控
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹