OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
完整解读提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
完整解读提出 AHA 自动科研循环,发现生产级智能体的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出 LLMLeak,把机密编进报错 URL,借聊天机器人网页抓取外传
LLMLeak 研究一种隐蔽外传:本地恶意软件已拿到机密,却因为网络限制或监控不能直接连接攻击者,于是把秘密放进看起来像排障文档的 URL,让良性聊天机器人的网页抓取工具在访问时把秘密带出去。
提出 JailbreakSkill,用可演化技能自动搜索并复用越狱提示
完整解读提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
完整解读提出工具智能体的状态攻击 DART 与预执行防御 SAGE