跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.01168· Kaiyan Wen·· 2026-09-01

CRACK:用多智能体辩论越狱多层安全过滤的 T2I 模型

Jailbreaking Text-to-Image Models Through Cracks: Navigating Heterogeneous Safety Filters via Multi-Agent Debate

AI 导读

论文提出 CRACK,一个通过多智能体辩论自适应搜索越狱提示的框架,用于绕过文本过滤器、图像分类器和跨模态检测器组成的多层安全栈。作者先提出 Detection Surface 几何框架,刻画异构 T2I 安全过滤器诱导的决策边界,指出成功规避由跨层冲突形成的稀疏非凸区域决定,绕过某一层过滤器的改动可能提高在另一层的暴露度。CRACK 将越狱搜索拆分为探索、诊断和仲裁,由 Attack Agent、Defense Agent 和 Judge Agent 迭代生成提示词变异、获取分层诊断反馈并通过奖励引导优化变异策略,在保留原始有害意图的同时适应不断变化的跨层约束。

阅读原文arxiv.org