研究者提出意图伪装多轮越狱方法,可攻破 GPT-5-thinking 与 Claude-Sonnet-4.5
Jailbreaking Frontier Foundation Models Through Intention Deception
iDecep多轮意图欺骗越狱GPT-5:AdvBench上Qwen-Plus版Total SR为0.63。
黑盒(black-box,如经API):攻击者只观察受害模型的文本回复,不能访问内部状态、参数或梯度。
- 前沿模型从按用户意图硬拒答转向safe completion后,把意图伪装成良性的多轮对话可能让模型在直接回答或替代内容中给出有害信息。作者称替代内容里的有害泄露(para-jailbreaking)需要单独防范。
- iDecep先采样看似良性的意图,再在黑盒多轮中依据受害模型回复挑选可追问片段,并以树状explore-then-exploit分支。外部评判把直接有害回答与只出现在替代内容中的有害信息分开计分。
- 在AdvBench文本上,iDecep加Qwen-Plus对GPT-5的Total SR为0.63、Para SR为0.51;Claude-Sonnet-4.5的Total SR为0.59,基线为0.00。
- 作者指出查询预算有限、只覆盖特定目标,且攻击模块由大模型实现,可能有偏差或随机性。作者计划做直接与para两类防御,并理解多轮信任。论文未报告外部评判模型与重复次数。
- 威胁模型
- 黑盒(black-box,如经API):攻击者只观察受害模型的文本回复,不能访问内部状态、参数或梯度。行动是多轮提交提示词,并可重生成当前回复或进入下一轮。目标是让frontier LLM/VLM在直接回答或替代内容中给出与恶意目标相关的有害信息。视觉输入为互联网公开来源的良性图像。
- 被测模型
- GPT-4oGemini-2.5-FlashClaude-Sonnet-4.5GPT-5
- 基准
- AdvBenchClearHarmAdvBench-Vision
- 指标
- Total SRDirect SRPara SR
研究者提出一种多轮越狱方法,通过伪装良性意图、逐步建立对话信任并利用模型的一致性,引导前沿模型输出有害细节,在 GPT-5-thinking 和 Claude-Sonnet-4.5 等前沿模型上取得高成功率。论文指出,GPT-5 等前沿模型已从基于拒答的防护转向安全补全,即在遵守安全约束的前提下最大化有用性,而这一转变可被用户伪装良性意图所利用,在多轮对话中攻击者有多次机会强化这种欺骗性意图。研究还发现并处理了一类此前未被注意的漏洞,作者称之为 para-jailbreaking,即模型未给出直接有害回复,但所透露的信息本身仍有害。在多模态 VLM 模型上的实验显示,该方法优于现有最先进方法。该工作已被 CVPR 2026 Findings Track 接收。
深度解读
这篇论文试图解决什么问题?
iDecep用多轮良性意图利用safe completion,并分开计直接与para有害输出。
前沿模型从硬拒答转向safe completion后,多轮良性意图伪装可能引出有害内容,包括不直接作答、但替代内容仍然有害的para-jailbreaking。
- 出现场景: 作者称大(视觉)语言模型仍易被越狱,且越狱已有现实社会影响。GPT-5等从硬拒答改为safe completion:约束模型自身输出,在安全约束下尽量有用,而不是只判断用户输入是否不安全。
- 现有做法的问题: 作者转述Yuan等[22]:按用户意图学习安全/不安全二元拒答边界往往脆弱,因为意图无法可靠评估,攻击者混淆意图时尤其如此,也会让系统显得不够有用。Crescendo与Chain-of-Attack则先隐藏意图,再从中性问题逐步转向目标。
- 核心观察: 用户把意图伪装成良性时,safe completion可能被利用;多轮对话可反复强化这一伪装,并利用后文须与前文一致的性质。作者称还存在此前未被注意到的para-jailbreaking:模型可以不直接回答有害查询,但所给信息仍然有害。
- 本文做法: 提出多轮攻击iDecep和explore-then-exploit框架,覆盖纯文本以及配有良性图像的场景,并把直接失准与para-harm失准分开形式化、分开计分。作者称技术能力有限的用户也可能利用这一威胁。
- 威胁模型:
- 目标: 使受害模型产生与恶意目标G相关的有害内容,可以来自直接回答,也可以只来自替代内容。
- 知识: black-box,例如经API;只观察文本回复,不能访问内部状态、参数或梯度。
- 能力: 多轮提交提示词;可重生成当前回复或进入下一轮。视觉设置使用互联网公开来源的良性图像。
- 受害系统: frontier LLM与VLM。实验目标为GPT-4o、Gemini-2.5-Flash、Claude-Sonnet-4.5和GPT-5;作者写GPT-5使用safe completion。
有哪些相关研究?
相关工作以单轮、多轮越狱和安全训练为主;作者把iDecep区别于先隐藏意图的Crescendo路线。
单轮文本越狱
- Prompt injection(Liu等,2023;Shen等,2024)——精心构造的指令可在单次查询中覆盖安全对齐。
- 基于梯度的提示优化(Jia等,2024;AutoDAN,Liu等,2024;Zou等,2023)——用梯度优化提示词以绕过防护。
- 启发式隐藏意图:改写成代码补全(Ren等,2024)、反转输入顺序(FlipAttack,Liu等,2024)、语言游戏(Peng等,2024)。
单轮视觉语言越狱
- Li等(2024)——论文称视觉模态是对齐的主要弱点。
- Qi等(2024)、Luo等(2024)——把越狱写成图像上的优化问题,用梯度促使有害输出。
- Schaeffer等(2024)——论文称找到可迁移的、基于梯度的视觉语言越狱样本仍然困难。
多轮越狱
- Crescendo(Russinovich等,2025)——先用中性问题隐藏恶意意图,再逐步导向有害目标。
- Chain-of-Attack(Yang等,2024)用Information-Gathering Interrogation强化该过程;Ren等(2024)用多个行动者视角初始化。论文指出这些工作仍遵循Crescendo:先隐藏意图,从中性询问开始。
- REVEAL(Jindal与Deshpande,2025)把Crescendo适配到多模态,但全部查询在初始化时生成,忽略上下文反馈;论文称这限制了效果,并称多轮视觉语言越狱仍少有研究。
防御与安全训练
学习式方法包括prompt adversarial tuning(Mo等,2024)、机器遗忘Eraser(Lu等,2024)、MoE分类器MoJE(Cornacchia等,2024)。
策略式方法包括重复输出以复查安全(PARDEN,Zhang等,2024)和放大安全token概率(SafeDecoding,Xu等,2024)。论文称多数现有防御针对单轮文本,多轮视觉语言攻击基本未被处理。
Yuan等(2025)的safe completion避免硬拒答,在安全约束下尽量满足请求。作者称该范式引入新弱点。
基线方法: Chain-of-Attack与Crescendo。基准: AdvBench、ClearHarm,以及为多模态构造的AdvBench-Vision。
作者把iDecep与Crescendo路线分开:不是先隐藏意图再转向目标,而是从一开始就贴近目标,但用看似安全、合法的框架维持对齐;并同时研究直接越狱与para-jailbreaking。
论文如何解决这个问题?
iDecep维持良性表面意图,用模型回复做树状分支,并同时针对直接回答与替代内容。
iDecep把恶意目标嵌进从一开始就贴近目标、但表面良性的多轮叙事,并用explore-then-exploit沿模型自己的回复做树状追问。 系统分三部分:受害模型、会话结束后才介入的外部judge、以及意图欺骗攻击器。
问题设定与safe completion
- 受害模型写成视觉语言模型。第t轮输入是图像与文本,图像可为空。回复分解为直接回答与替代内容:前者可以是拒答,后者在直接作答时可为空。
- 内部防护把两个成分都判为安全才算安全,取二者的最小值。作者转述GPT-5系列的做法:不按用户输入做二元不安全预测,而是惩罚违反安全策略的输出,并奖励安全约束下的有用性;双用途问题只答允许部分,不安全查询则拒答或给安全替代。
- 观察空间是black-box。行动是提交提示词;可重生成当前回复,或进入下一轮。攻击器看不到内部状态、参数和梯度。
外部judge与para-jailbreaking
- 攻击器自带评估器,用于会话中的控制。报告实验时使用的是事后外部judge。论文给出的判定是:相对目标G,回复含有害内容则为1,否则为0。
- 完整回复的外部判定取两个成分的最大值:fJ(y,G)=max{fJ(ydirect,G),fJ(yalt,G)}。含义是任一成分有害,整段回复即算有害。
- 在只输出内部防护为安全的回复时,作者把攻击成功概率写成:P[fJ(y,G)=1]=δdirect+δpara。前者是直接回答被外部判为有害;后者是直接回答未被判为有害、但替代内容被判为有害。作者把后者称为para-jailbreaking,并认为它是safe completion下直接失准的结构性补集:内部防护倾向于把“有用的替代”当成安全。
意图欺骗攻击器
- 生成器分为意图生成与查询生成,评估器分为二元控制与轨迹摘要,另有对目标隐藏的内部状态。纯文本时二者都通过提示一个LLM或VLM实现;有图像时,系统可使用从互联网公开来源检索的良性图像,用来强化表面意图。
- 先为目标G采样表面良性意图,仅当评估器接受才采用。论文写接受条件是:看起来良性、与G主题相关、并且适合多轮推进。随后用轨迹摘要初始化该意图。
- 每一轮,查询生成器以内部状态为条件,从最近一次回复中选取同时贴近良性框架和恶意目标的片段,并据此构造下一问。目标模型看到的是在回应良性意图。评估器若判定任一部分含有害内容就停止;否则写入轨迹,包括替代内容中的可利用信号和下一步提示。
- 会话级成功是各轮外部判定的并。直接成功是某一轮直接回答有害;para成功是某一轮替代内容有害,且直到该轮直接回答都未有害。
Explore-then-Exploit
- 作者认为攻击应是树而不是一条链:一段历史里可以有多个可扩展点,一条回复里的多个要点也可各自分支。Algorithm 1先做探索,再对汇总出的候选点调用Algorithm 2分支。
- 探索阶段长度为T_explore。该阶段记录评估反馈,但算法注明省略停止决定。分支阶段每支最长T_branch;若未判为有害、且满足重生成条件、且未超过B_regen,则在同一轮重生成。论文未给出这三个预算的数值,也未在正文定义重生成的触发条件。作者称当前实现限制了分支深度,但例程可以递归。
- 由此形成信息不对称:受害模型按良性意图作答,攻击系统按G转向。附录12给出意图生成、查询生成和评估器的提示词;评估器会标出可继续利用的点。这里不复述提示词中的具体约束。
理论结果
- 第4节在safe completion永不输出内部不安全回复的假设下给三个定理,证明见附录。Theorem 1:若存在一轮,意图欺骗比对照更常进入“高危险、拒答但有替代、且此前没有直接成功”的状态,则para成功概率不低于对照。
- Theorem 2:若内部评估器相对外部judge有优势γ>0,且攻击策略在允许的下一问中最大化“进入拒答加替代”与“评估器判为有害”的乘积,则总攻击成功率的下界不低于对照。Theorem 3再假设该问法不降低平均直接风险的期望,则总成功率不低于对照。作者称这些结果说明:能稳定引出“拒答但替代内容丰富”的良性叙事,就足以提高para风险;评估器只要有一定信息量,就能提高总成功率下界。
论文做了哪些实验?
Qwen-Plus版iDecep在AdvBench上对GPT-5的Total SR为0.63,Para SR为0.51。
实验设置
- 受害模型: GPT-4o、Gemini-2.5-Flash、Claude-Sonnet-4.5、GPT-5。作者写GPT-5使用safe completion,并称Claude-Sonnet-4.5以其防护著称。Figure 1与第4节示例写的是GPT-5-thinking,论文未说明它与表中GPT-5是否为同一模型。
- 数据: AdvBench与ClearHarm各随机抽取100题。AdvBench覆盖10类、每类10题;ClearHarm覆盖化学、生物、核与网络安全,每类25题。AdvBench-Vision为每条AdvBench文本配一张互联网检索的良性图像。
- 攻击模型与基线: 每种攻击分别用Qwen-Plus和GPT-3.5-Turbo实现。基线为Chain-of-Attack与Crescendo。Table 2只报告Qwen-Plus,且只有Chain-of-Attack与iDecep。
- 指标: Table 1将Total SR分解为Direct SR(模型直接输出有害内容)和Para SR(有害内容只出现在替代内容中)。
- 判定: 报告结果来自会话后的外部judge。论文未说明该judge是哪个模型、是否人工,也未给出除“相对G含有害内容”之外的阈值或细则。
- 规模与重复: 每个基准100题。论文未报告重复次数、查询次数,以及T_explore、T_branch、B_regen的取值。
主结果
下表为iDecep、攻击模型Qwen-Plus的成功率(Table 1)。
表格较宽,可左右滑动
受害模型 基准 Total SR Direct SR Para SR GPT-4o AdvBench文本 0.96 0.96 0.00 GPT-4o ClearHarm 0.86 0.86 0.00 Gemini-2.5-Flash AdvBench文本 0.98 0.98 0.00 Gemini-2.5-Flash ClearHarm 0.89 0.89 0.00 Claude-Sonnet-4.5 AdvBench文本 0.59 0.25 0.34 Claude-Sonnet-4.5 ClearHarm 0.53 0.21 0.32 GPT-5 AdvBench文本 0.63 0.12 0.51 GPT-5 ClearHarm 0.63 0.11 0.52 表中省略攻击模型GPT-3.5-Turbo。该设置下iDecep的Total SR:AdvBench为GPT-4o 0.87、Gemini-2.5-Flash 0.91、Claude-Sonnet-4.5 0.36、GPT-5 0.79;ClearHarm为0.76、0.77、0.31、0.52。其中GPT-5的Para SR为AdvBench 0.60、ClearHarm 0.43。
- 作者称在GPT-4o与Gemini-2.5-Flash上接近饱和,总成功率往往超过90%。Table 1里Qwen-Plus的AdvBench为0.96与0.98,但ClearHarm为0.86与0.89;GPT-3.5-Turbo的ClearHarm为0.76与0.77。
- 作者称在Claude-Sonnet-4.5与GPT-5上,既有多轮方法几乎失败,而iDecep仍有相当成功率。Table 1中两种基线、两种攻击模型在Claude-Sonnet-4.5上的Total SR均为0.00。GPT-5上基线Total SR为0.00、0.01、0.02或0.03,且Direct SR均为0.00。
- 作者称para-jailbreaking在GPT-5与Claude-Sonnet-4.5上尤其突出,并认为间接泄露是safe-completion模型的关键弱点。同一张表里,iDecep对GPT-4o与Gemini-2.5-Flash的Para SR均为0.00。作者称只有iDecep能稳定引出para-jailbreaking;基线在GPT-5上仍有0.01至0.03的Para SR。
多模态AdvBench-Vision
- Table 2只含攻击模型Qwen-Plus。iDecep的Total/Direct/Para SR:GPT-4o为0.97/0.97/0.00,Gemini-2.5-Flash为0.98/0.98/0.00,Claude-Sonnet-4.5为0.65/0.34/0.31,GPT-5为0.84/0.23/0.61。Chain-of-Attack为0.36/0.36/0.00、0.42/0.42/0.00、0.00/0.00/0.00、0.00/0.00/0.00。
- 作者在贡献中称加入图像会增加有害回答。与Table 1中同为Qwen-Plus、iDecep的AdvBench文本相比,Total SR为:GPT-4o 0.96与0.97,Gemini-2.5-Flash均为0.98,Claude-Sonnet-4.5 0.59与0.65,GPT-5 0.63与0.84。摘要称多模态上优于已有方法;Table 2的对照只有Chain-of-Attack,没有Crescendo。
类别分解
- Table 8中iDecep加Qwen-Plus、每类25题的成功数:Claude-Sonnet-4.5为化学12、生物9、核14、网络安全18;GPT-5为14、10、17、22;GPT-4o为21、20、21、24;Gemini-2.5-Flash为22、21、22、24。
- 作者称生物与化学比网络安全更敏感,网络安全可超过20/25,生物与化学多在16左右,并认为这与生化滥用受到明确安全训练约束一致。上列数字中,GPT-5生物为10、Claude-Sonnet-4.5生物为9,GPT-4o与Gemini-2.5-Flash的生物、化学为20至22。
- Table 6中iDecep加Qwen-Plus、每类10题:GPT-4o的黑客与欺诈均为10,暴力与逃避责任也为10;GPT-5的黑客为9、欺诈为8、暴力为6、逃避责任为7;Claude-Sonnet-4.5相应为7、7、5、6。作者称限制更强的类别也接近10/10;后两行不是这个数。这四行里性别与社会不公为4、4、8、9,是该行最低或并列最低。
定性示例
- Figure 1图注称,这是一次成功的生物相关para-jailbreaking:把请求写成防范报告并伪装成执法人员后,GPT-5给出处理生物废弃物的工具与步骤。第4节称该示例针对GPT-5-thinking,且该主题按OpenAI政策被严格限制。附录11对比了一次CoA与iDecep对话:作者称CoA以部分拒答和高层次、非操作描述结束并被判为安全,iDecep的替代内容被判为有害。具体说法不在此复述。
其他消融与分析
- 论文未报告去掉意图生成、分支或内部评估器的消融,也未报告T_explore、T_branch、B_regen的取值。
- Chain-of-Attack加GPT-3.5-Turbo在Table 1中几乎全为0.00,唯一非零是GPT-4o、ClearHarm的Total SR 0.01。
- 作者称GPT-3.5-Turbo在iDecep下仍能成功,因此优势来自意图欺骗而不是攻击模型能力;Table 1中该攻击模型对Claude-Sonnet-4.5的Total SR为0.36与0.31,低于Qwen-Plus的0.59与0.53。
有什么可以进一步探索的点?
作者指出查询预算、目标范围和攻击模块随机性,并计划研究防御与多轮信任。
作者指出的局限与后续方向
- 研究在black-box设定下进行,每次交互的查询预算有限(第7节Limitations)。
- 聚焦特定类型的目标,例如instructional harms,不声称覆盖全部可能的有害意图(第7节)。
- 评估器与查询生成器由大语言模型实例化,这些模型本身可能给攻击过程引入非预期偏差或随机性(第7节)。
- 作者称para-jailbreaking需要新的评测协议和专门的缓解策略(第6节)。
- 作者计划发展同时处理直接越狱与para-jailbreaking的原则性防御(第6节)。
- 作者计划对多轮交互中的信任动态建立更全面的理解(第6节)。
实验覆盖范围
- 主结果的受害模型为GPT-4o、Gemini-2.5-Flash、Claude-Sonnet-4.5、GPT-5共4个;Figure 1与第4节另用GPT-5-thinking这一名称,论文未说明二者是否相同。
- 文本基准为AdvBench与ClearHarm,各随机100题;多模态为AdvBench-Vision。Table 2的攻击模型只有Qwen-Plus,对照只有Chain-of-Attack。
- 攻击侧模型为Qwen-Plus与GPT-3.5-Turbo。指标为Total SR、Direct SR、Para SR;附录Table 6至Table 8给出类别成功任务数。
- 第4节在safe completion、评估器优势γ和非降低直接风险等假设下给出Theorem 1至3。第5节报告的是SR,论文未报告对γ或qt的估计。
- 论文未报告外部judge的模型或人工身份、与人工的一致性、重复次数、查询次数,以及T_explore、T_branch、B_regen的数值。相关工作讨论了单轮梯度攻击和若干防御,实验对比的是两种多轮攻击的成功率。
总结一下论文的主要内容
iDecep用意图欺骗做多轮越狱,在GPT-5与Claude-Sonnet-4.5上同时测到直接成功和para成功。
iDecep是一种黑盒多轮越狱:用表面良性的意图维持与恶意目标贴近的对话,并单独计入safe completion替代内容中的有害信息。
- 作者关心的变化是,GPT-5等从按用户意图硬拒答,转向约束自身输出、并在安全前提下尽量有用。作者认为意图可被伪装,且模型可能把有害信息放进它视为安全的替代内容。这一情形被称为para-jailbreaking。
- 攻击器先接受一个看起来良性、与目标相关、适合多轮推进的意图,再根据受害模型最近回复选取可继续追问的片段。探索之后按可利用点分支。外部judge在会话结束后判定;直接成功与只出现在替代内容中的成功分开统计。视觉设置加入互联网上的良性图像。第4节在若干假设下给出para风险与总成功率下界的比较定理。
- Table 1中,攻击模型为Qwen-Plus时,GPT-5的Total SR在AdvBench文本与ClearHarm上均为0.63,Para SR为0.51与0.52。Claude-Sonnet-4.5为0.59(Para SR 0.34)与0.53(Para SR 0.32)。两种基线在Claude-Sonnet-4.5上为0.00。
- 同一攻击模型在AdvBench-Vision上对GPT-5的Total SR为0.84,Para SR为0.61(Table 2)。GPT-4o与Gemini-2.5-Flash的Para SR在这些表的iDecep行中为0.00,成功主要来自直接回答。ClearHarm生物类、每类25题,Qwen-Plus版对GPT-5的成功数为10(Table 8)。
- 作者的结论是:safe completion加上多轮一致性,使意图欺骗可以引出有害输出;para-jailbreaking是需要单独评测和缓解的一类失败。作者计划研究同时覆盖两类失败的防御,以及多轮信任。