研究揭示批量提示导致大模型安全失效并提出批量感知对齐缓解方案
Safety in Batches? Understanding and Mitigating Safety Failures in Batch Prompting
有害问题嵌入良性 batch 后,JailbreakBench 上 Batch Prompting 六模型平均 ASR 为 62.2%。
标准单用户设定下的 black-box、single-step 越狱:攻击者把一个有害问题与若干良性问题拼成一条 prompt 直接提交,不访问模型内部,也不做额外优化。
- Batch prompting 把多个问题一次送入模型以降低推理成本,但作者称单独会被拒绝的有害问题嵌进良性问题后可以引出有害回答。作者认为拒答应对同一次调用里的问题数量和组成保持不变,这一点尚未在安全上被充分检验。
- 作者把一个有害问题与良性问题拼成 black-box、single-step 输入,对照 ICL 与长上下文攻击。四个公开奖励模型用来看奖励差,拒绝向量用来看拒答信号是否被稀释。两个开源模型上比较 batch-aware SFT 与 DPO。
- Table 2:Batch Prompting 六模型平均 ASR,JailbreakBench 62.2%,StrongREJECT 66.6%。Table 5:DPO 后 Llama 的 JBB、SR 位置平均 ASR 为 0.5%、0.6%。
- 作者称未追求最强攻击,自适应结构能否绕过 batch-aware 对齐留作后续;奖励分析用公开代理。评测为六个模型、两个有害基准和七个 black-box 基线,DPO 只报 Llama-3.1-8B 与 Phi-4-14B。
- 威胁模型
- 标准单用户设定下的 black-box、single-step 越狱:攻击者把一个有害问题与若干良性问题拼成一条 prompt 直接提交,不访问模型内部,也不做额外优化。目标是让模型回答单独提示下会拒绝的有害问题。受害系统是被调用的对齐 LLM。
- 被测模型
- Llama-3.1-8BPhi-4-14BQwen-3-8BGPT-5.3-ChatClaude-4.6-SonnetGemini-3-Flash
- 基准
- JailbreakBenchStrongREJECTGSM8KAlpacaCoinFlipAdvBenchBeaverTails
- 指标
- ASRdetection ratereward gaprefusal scoreGSM8K accuracyPPL
论文指出批量提示这一常见推理策略存在独立的安全失效模式:一个在单独提问时会被稳定拒答的有害问题,嵌入一批良性问题后可能得到有害回答。作者从对齐信号减弱和拒答信号稀释两个角度分析成因,并在多个开源与前沿商业模型上验证,批量提示作为一种简单的黑盒攻击能持续取得高攻击成功率。研究进一步表明,批量感知偏好优化能有效缓解该漏洞,作者据此提出批量感知对齐是稳健部署的必要环节。代码已公开。
深度解读
这篇论文试图解决什么问题?
单独会被拒绝的有害问题,放进良性问题 batch 后可以引出有害回答。
批量提示能保住效用,并不等于有害问题在 batch 里仍会被拒绝。
- 场景: 作者称 Batch Prompting(Cheng et al., 2023)把多个问题放进一次调用,以减少共享前缀的重复计算;后续工作称效用可与单问提示相当。作者认为有害意图的识别和拒答,不该随同一次调用中的问题数量和组成而改变。Figure 1 展示单独被拒的问题,嵌进良性问题后得到有害回答。
- 现有不足: 作者称长上下文安全、in-context learning(ICL)漏洞和特定模板攻击,都不能直接解释这一现象。batch 输入只有问题、没有有害问答示范,良性问题可以很短且语义不相关。
- 核心观察: 作者从两侧分析:偏好对齐里的奖励差变小,以及推理时内部拒绝信号被稀释。并称这不能还原为 ICL,也不能只归因于上下文变长。
- 本文做法: 把该结构当作 black-box 攻击测量 ASR,再用 batch-aware 偏好优化恢复被削弱的偏好差。
- 威胁模型:
- 目标: jailbreaking。让模型回答它在单独提示下会拒绝的有害问题,而不是污染其他用户的输出(Appendix A)。
- 知识: 论文称为 simple black-box、single-step;不访问模型内部,也不做额外优化(Section 4.1)。
- 能力: 标准单用户设定下,攻击者自己拼一条 prompt 并直接提交。消融里还改变 batch 大小、有害问题位置,以及良性问题是否与有害问题语义相关(Section 4.2)。
- 受害系统: 被调用的对齐 LLM,包括开源模型和前沿商业模型。回答是否有害,由三个 guard 模型多数投票判定(Section 4)。
有哪些相关研究?
论文把该现象与 ICL、长上下文、多用户注入和若干模板类越狱分开。
作者把该失败与效率向的 batch prompting、ICL、长上下文,以及其他依赖示范、长文或模板的越狱分开。
Batch prompting
- Cheng et al. (2023): 把多个 query 捆进一次调用,避免共享前缀在每次推理里重复计算。
- 效用与应用: Lin et al. (2024)、Son et al. (2024)、Wang et al. (2025) 讨论模型处理 batch 输入,并维持与单问相当的效用。附录还列医疗摘要和实体解析等应用(Zhang et al., 2024; Fan et al., 2024; Ji et al., 2025; Saengsiripaiboon et al., 2025)。作者称这些工作看效率和任务效用,没有讨论安全。
- Yue and Yao (2025): 多用户批处理服务中的 prompt injection,一个用户的恶意输入污染其他用户收到的回答。作者明确区分两点:本文是单用户自己提交一条 prompt;目标是 jailbreaking,不是污染他人输出。
ICL 与长上下文
- ICA(Wei et al., 2026)与 Many-Shot Jailbreaking(Anil et al., 2024): 用有害问答示范,或大量 shot,让模型走向有害回答。Anil et al. 称效果随 shot 数呈 power law。作者指出 batch prompting 没有答案示范,只有问题。
- 长上下文安全: Kim et al. (2025) 报告安全随上下文变长而下降,且与内容类型无关。Shah et al. (2025) 与 Lu et al. (2025) 报告和有害问题语义相关的长上下文更容易削弱安全。作者指出这类攻击要构造很长且相关的上下文;batch prompting 是短的、可以不相关的问题。
其他越狱结构
- 模板与问题链: CodeChameleon(Lv et al., 2024)、FlipAttack(Liu et al., 2025b)、JAIL-CON(Jiang et al., 2025)、Sandwich(Upadhayay and Behzadan, 2024)、SequentialBreak(Saiem et al., 2025)。作者称后两者依赖场景嵌套、意图混淆或语言混合;本文只把良性问题放进标准 batch 格式。
- 认知负荷: Working Memory Attack(Upadhayay et al., 2025)把有害请求嵌进需要逐步重建的计算任务;Xu et al. (2024) 用复杂推理、低资源语言、隐喻和假设情景增加负荷。作者指出这些攻击通常先给复杂任务,而 batch prompting 是有害问题后面跟着良性问题。
- 注意力分散: Ding et al. (2024a)、Du et al. (2025)、Pu et al. (2025) 把更高攻击成功和有害关键词注意力下降联系起来。作者称 batch prompting 不共享这一攻击面:Figure 8 图注写,成功样本对有害问题的注意力更高。
基线与基准
- 基线方法: CodeChameleon、FlipAttack、JAIL-CON、Working Memory Attack、ICA、Many-Shot Jailbreaking、NINJA(Shah et al., 2025)。附录写明沿用官方默认配置,如 ICA 为 12-shot,Many-Shot 为 128-shot,NINJA 用 medium-context(5,000 words)。
- 基准: JailbreakBench(Chao et al., 2024)100 条有害问题;StrongREJECT(Souly et al., 2024)313 条。主实验的良性问题来自 GSM8K(Cobbe et al., 2021)。
作者把本文定位成一种 distinct failure mode:安全退化不能还原为 ICL 或长上下文,也不同于 Yue and Yao (2025) 的多用户注入。
论文如何解决这个问题?
作者从奖励差缩小和拒绝信号稀释分析该失败,并用 batch-aware DPO 缓解。
作者把 batch prompting 直接当作攻击面:一条输入里放一个有害问题和多个良性问题,不提供有害答案示范。再从奖励和内部表示两侧解释,并用 batch-aware DPO 去恢复偏好差。
输入结构与对照设计
- 构造: 把一个有害问题与多个良性问题拼接。主实验 batch size 为 12,良性问题取自 GSM8K;有害问题在 Phi-4-14B 上放第 1 位,其余模型放第 2 位(Appendix B.5)。Figure 12 给出完整模板,其中有分题作答格式,以及抑制拒答表述的指令。
- 对照什么: Section 2 用同一受害模型比较 ICL 攻击、长上下文攻击和 batch prompting,记录平均 token 数、shot 数和 ASR。ICL 的有害 shot 来自 Circuit Breaker;另有一组良性 shot 来自 GSM8K(Appendix B.2)。
- 长度分离: 一是把 batch size 扩到很大;二是固定 12 个问题,只插入无关、非问答文本来加长上下文(Appendix B.2)。
奖励视角:对齐信号变弱
- 代理: 四个公开奖励模型给「用户问题–模型回答」打标量分:ArmoRM、SkyworkRM-Llama、SkyworkRM-Qwen、URM。作者称目标 LLM 实际使用的奖励模型不可得,这些模型只作代理(Section 3.1、Limitations)。
- 三种策略: (A) 全部拒绝;(B) 只拒绝有害问题、回答其余问题;(C) 全部遵从,作者将其视为越狱。安全上 (B) 被写成同时满足安全与有用的策略,(A) 安全但拒绝了良性问题。
- 度量: 奖励差 ΔR 表示奖励模型把 (A) 或 (B) 相对 (C) 偏好多少。Figure 3 的横轴是 batch size。附录再用有害问题位置、有害问题个数做对照,用来检查差距缩小是不是只来自 batch 模板偏离训练分布(Appendix B.3)。
表示视角:拒绝信号稀释
- PCA: 用 Zheng et al. (2024a) 的有害/良性单问作锚,投影 batch 隐状态,并标出不同 batch size 的 centroid(Figure 4)。PCA 层取 PC1 解释方差最高的层(Table 10:Llama 与 Phi 为 layer 17,Qwen 为 layer 24)。
- 拒绝分数: 按 Arditi et al. (2024) 抽取拒绝向量,再与输入最后 token 的隐状态做 cosine similarity。Table 10 写明抽取层和 token 位置:Llama layer 12、末 token;Phi layer 16、末 token;Qwen layer 20、倒数第 9 个 token。对比对象包括 JailbreakBench 单问、Alpaca 无害单问,以及语义无关(GSM8K)和语义相关的 batch。
- 探针: 在 Llama-3.1-8B 的 layer 17 训练两个线性探针。局部探针读有害问题最后一个 token,全局探针读整段最后一个 token。训练数据为 AdvBench 520 条有害提示和 Alpaca 520 条无害提示,80/20 划分;测试准确率分别为 99.5% 和 100%(Appendix B.4)。
Batch-aware 对齐
- 两种训练: 对 Llama-3.1-8B 与 Phi-4-14B 做 SFT 和 DPO(Rafailov et al., 2023),都用 LoRA。SFT 向模型展示 batch 上的理想回答;DPO 强化 batch 设定下安全回答与不安全回答的偏好差。作者用这一对照区分两种假设:只是没见过 batch 输入,还是偏好信号本身变弱。
- 数据与超参: 500 条,5-batch。有害问答来自 BeaverTails,且不与 JailbreakBench、StrongREJECT 重叠;良性问答来自 Alpaca。回答直接用原数据集,不另行生成。有害问题位置随机,Table 13 的五位计数为 108、90、104、104、94。LoRA rank 8、alpha 16,加在 q、k、v。优化器为 AdamW,cosine schedule 加 warmup。Llama 的 SFT/DPO 收敛于 6/2 epoch,Phi 为 4/1 epoch(Appendix B.7)。
- 外部护栏怎么测: 输入过滤用 Llama Guard4、OpenAI Moderation API、Azure AI Content Safety API;另测长度归一化 perplexity(Jain et al., 2023)。这是替代防线的评测,不是作者提出的训练方法(Section 5.2)。
成功判定
- ASR: 成功引出有害回答的攻击次数占比。Llama Guard4、WildGuard、BeaverDam 多数投票,至少两票判为有害。送入裁判的是原始有害目标,而不是带攻击模板的原文(Appendix B.6)。
论文做了哪些实验?
JailbreakBench 平均 ASR 为 62.2%;DPO 后 Llama 的 JBB 位置平均 ASR 为 0.5%。
主结果是六个模型上的黑盒 ASR;作者另做组成消融、与 ICL/长上下文的对照,以及 DPO 和外部护栏。
实验设置
- 被测模型: Llama-3.1-8B、Phi-4-14B、Qwen-3-8B、GPT-5.3-Chat、Claude-4.6-Sonnet、Gemini-3-Flash。检查点分别为 Llama-3.1-8B-Instruct、microsoft/phi-4、Qwen3-8B(主结果为 non-thinking)、gpt-5.3-chat-latest、claude-sonnet-4-6、gemini-3-flash-preview(Table 7)。
- 数据与主设置: JailbreakBench 100 条,StrongREJECT 313 条。主实验 batch size 为 12,良性问题来自 GSM8K;有害问题 Phi 在第 1 位,其余模型在第 2 位。
- 基线: CodeChameleon、FlipAttack、JAIL-CON、WMA、ICA、Many-Shot、NINJA,外加 No attack。实现沿用各方法官方默认配置(Appendix B.5)。
- 指标与裁判: ASR 为引出有害回答的比例。三模型多数投票。以 GPT-5.3-Chat 为参照时,ensemble 的 precision、recall、F1、一致率分别为 .969、.940、.955、94%(Table 12)。
- 解码: greedy,temperature=0。API 实验日期为 2026-04-11。论文未报告 ASR 的重复次数。
主结果
据 Table 2。Batch Prompting;batch size 12,良性问题为 GSM8K,有害问题位置见实验设置。
表格较宽,可左右滑动
模型 JBB batch JBB 无攻击 SR batch SR 无攻击 Llama-3.1-8B 55.0% 2.0% 71.3% 0.6% Phi-4-14B 65.0% 0.0% 69.0% 0.0% Qwen-3-8B 82.0% 2.0% 85.3% 0.6% GPT-5.3-Chat 52.0% 0.0% 40.6% 0.3% Claude-4.6-Sonnet 66.0% 0.0% 74.1% 0.3% Gemini-3-Flash 53.0% 0.0% 59.1% 0.6% - 作者称 Batch Prompting 在两个基准上平均 ASR 最高,分别为 62.2% 和 66.6%,且是 black-box、single-step。表中并非每列都最高。
- JailbreakBench 上,Llama 的 JAIL-CON 为 88.0%,Qwen 的 JAIL-CON 为 86.0%,Gemini 的 CodeChameleon 为 85.0%,都高于同列的 Batch Prompting。StrongREJECT 上,Llama 的 JAIL-CON 为 93.9%,Gemini 的 CodeChameleon 为 93.0%。
- 作者称 GPT、Claude 上既有攻击的 ASR 收束到接近 0。表中并不全部如此:JailbreakBench 上 CodeChameleon 对 GPT、Claude 为 22.0%、12.0%,JAIL-CON 对 Claude 为 34.0%。ICA 在 Table 2 的全部格子为 0.0%。
与 ICL、长上下文的区分
- Table 1,Llama-3.1-8B,JailbreakBench: ICL 在 128 shot(平均 5,606 token)和 12 shot(668 token)的 ASR 都是 0%;长上下文攻击平均 6,654 token、ASR 40%;batch prompting 平均 906 token、ASR 55%。
- 加长并不抬高 ASR: Table 8 中,GSM8K 良性 shot 的 ICL 仍为 0%。Figure 9 把 batch size 扩到 12、30、60、90,作者称 ASR 不因此上升;正文未给出各点 ASR。Table 9 固定 Qwen-3-8B 的 12-batch,token 从 936 增到 4,000,ASR 为 82、79、78、78、79。
- 注意力: Figure 8 图注称,成功样本对有害问题的注意力比例更高。作者据此认为成功不能用「更少注意有害内容」解释。论文未给出具体比例。
batch 组成
- 大小: Figure 6 覆盖 Llama-3.1-8B、Phi-4-14B、GPT-5.3-Chat。作者称 ASR 在小 batch 时上升,之后进入平台;正文未给出各点数值。作者称这与 Figure 3、4、5 的饱和一致,也不同于长上下文攻击随长度扩展。
- 位置: Table 3 为 7-batch、JailbreakBench。Llama 在第 1、2、4、6、7 位为 41.0%、48.0%、42.0%、19.0%、5.0%;Phi 为 37.0%、17.0%、14.0%、4.0%、3.0%;GPT-5.3-Chat 为 51.0%、54.0%、44.0%、39.0%、33.0%。作者称早位更高、后位下降。表中 Llama 与 GPT 的最高格在第 2 位,不是第 1 位。
- 语义相关: Table 4,JailbreakBench。无关(GSM8K)/相关:Llama 55.0%/31.0%,Phi 65.0%/12.0%,GPT-5.3-Chat 52.0%/42.0%。作者称无关问题更能稀释有害性。论文未说明这张表的相关问题由哪个模型生成。
防御与外部护栏
- Table 5: 12-batch、GSM8K,对有害问题位置取平均,不是 Table 2 的单一位置。Llama 的 JBB/SR:原始 41.3%/49.2%,SFT 23.8%/29.8%,DPO 0.5%/0.6%。Phi:原始 28.3%/34.5%,SFT 10.0%/9.9%,DPO 0.3%/0.3%。作者称 DPO 把 ASR 降到 1% 以下,SFT 只是部分缓解;并称训练是 5-batch、BeaverTails+Alpaca,评测的有害内容、良性类别和 batch size 都不同。
- 训练后的行为: Table 14 的 GSM8K 准确率,Llama 单问 83.3% 到 81.7%,12-batch 76.4% 到 78.7%;Phi 单问 94.9% 到 94.5%,12-batch 94.3% 到 92.5%。Table 15 中 Llama 的 12-batch JBB ASR,四种良性类别经 DPO 后都是 0。附录写归一化拒绝分数从 0.147 到 0.404。Figure 7 图注称 DPO 后 centroid 移回有害区域;转换文本看不到点的位置。
- 外部护栏 Table 6: Llama Guard4 检出率从单问 92.0% 到 9-batch 27.0%;OpenAI Moderation 从 69.0% 到 43.0%;Azure 从 37.0% 到 19.0%(9-batch;7-batch 为 18.0%)。长度归一化 PPL 从单问 26.886 到 9-batch 6.924,GSM8K 为 10.140。作者称外部防线不够。Table 20 里 Qwen-3-8B 打开 thinking 后,batch ASR 从 82 到 65(−17),JAIL-CON 从 86 到 68(−18)。
其他消融与分析
- 良性类别(Table 18,ASR): Llama 的 GSM8K/CoinFlip/Alpaca/Multi 为 55/57/42/51;Qwen 为 82/75/80/72。
- 有害问题个数(Table 19,12-batch,JBB): Llama 在 n=1/2/3 为 55/45/32;表中 GPT-5.3 为 52/9/0。
- 同一指令的单问对照(Table 17,JBB): single prompting 为 Llama 3、Phi 1、GPT 1、Claude 1;同指令 batch 为 55、65、52、66。Vanilla 为 2、0、0、0。
- 探针(Table 11,Llama-3.1-8B): 局部 pharmful 为 0.907;全局分数在 batch size 2、4、6、8、10 为 0.846、0.669、0.422、0.391、0.171。
- 效用(Table 16,GSM8K 准确率): 单问到 12-batch,Llama 83.3 到 76.4(−6.9),Phi 94.9 到 94.3(−0.6),GPT 96.6 到 97.2(+0.6)。正文称该 GPT 列为 GPT-5.3-Chat。
- 奖励差的内容对照: 作者称有害问题放在末尾,或 batch 中有害问题更多时,奖励差保留得更好(Figure 14、15)。正文未给出这些图的具体 ΔR。
有什么可以进一步探索的点?
作者称未构造更强组合攻击,且奖励分析依赖不可得的真实奖励模型。
作者指出的局限与后续方向
- 不做最强攻击: Limitations 写,研究重点是识别和分析这一漏洞,而不是设计尽可能有效的攻击。
- 组合现有越狱超出范围: 同一节写,把 batch prompting 和已有越狱技术合起来以放大攻击是可能的,但超出这项初步发现的范围。
- 自适应结构绕过对齐: Limitations 把「自适应 batch 结构能在多大程度上绕过 batch-aware preference alignment」写成后续方向。
- 奖励模型只是代理: Limitations 写,Section 3.1 使用公开奖励模型,因为目标 LLM 实际用于对齐的奖励模型不可得。作者称,尽管 Appendix B.3 里多个公开模型趋势一致,发现仍可能无法完全反映每个目标模型的内部对齐信号。
- Conclusion 的方向: Conclusion 在报告 DPO 能恢复被削弱的安全之后,把 batch-aware alignment 写成后续防御的一个方向。
实验覆盖范围
- 生成模型与基准: 被测模型为 Llama-3.1-8B、Phi-4-14B、Qwen-3-8B、GPT-5.3-Chat、Claude-4.6-Sonnet、Gemini-3-Flash,共 6 个。有害基准为 JailbreakBench(100 条)和 StrongREJECT(313 条)(Section 4、Table 2)。
- 攻击对照与解码: 对照为 7 个 black-box 方法加 No attack。主实验 batch size 为 12,greedy、temperature=0;API 实验日期为 2026-04-11(Appendix B.1、B.5)。论文未报告 ASR 重复次数。
- 判定: ASR 由 Llama Guard4、WildGuard、BeaverDam 多数投票得到;与 GPT-5.3-Chat 的 ensemble 一致率为 94%(Table 12)。论文未报告该一致性分析的样本量。
- 机制分析: 奖励差来自 ArmoRM、SkyworkRM-Llama、SkyworkRM-Qwen、URM(Section 3.1)。拒绝向量、PCA 和探针的模型与层写在 Table 10、Appendix B.4。
- 缓解实验写到哪里: SFT 与 DPO 的训练和 Table 5 评测针对 Llama-3.1-8B、Phi-4-14B。外部护栏为 Llama Guard4、OpenAI Moderation、Azure AI Content Safety 和长度归一化 PPL(Table 6)。thinking mode 的数字写在 Qwen-3-8B(Table 20)。论文未报告 GPT、Claude、Gemini 上的 DPO 结果。
总结一下论文的主要内容
有害问题混入良性 batch 可引出有害回答;作者称 batch-aware DPO 能恢复偏好信号。
这篇工作检查一种本用于省推理成本的输入结构:把多个问题一次送进对齐后的 LLM,安全拒答是否还和单问时一样。
- 问题: 单独提示下会被拒绝的有害问题,旁边放上良性问题后,模型可以改成给出有害回答。作者称这不是 ICL 示范,也不是长上下文攻击。
- 做法: 攻击者只拼接问题,不提供有害答案,也不看模型内部。作者用四个公开奖励模型看「全拒绝 / 只拒有害题 / 全遵从」的奖励差,并用拒绝向量、PCA 和线性探针看内部信号。缓解上比较 batch 数据上的 SFT 与 DPO。
- 攻击数字: Table 2 中 Batch Prompting 的六模型平均 ASR,JailbreakBench 为 62.2%,StrongREJECT 为 66.6%。GPT-5.3-Chat 为 52.0% 与 40.6%,Claude-4.6-Sonnet 为 66.0% 与 74.1%。同表里 JAIL-CON、CodeChameleon 在部分开源模型和 Gemini 上更高。Table 1 中,Llama-3.1-8B 上 batch 的 ASR 为 55%,同页 ICL 为 0%、长上下文攻击为 40%。
- 组成与缓解: 作者称小 batch 即进入平台,有害题靠前、良性题语义无关时 ASR 更高。Table 5 的位置平均 ASR,DPO 后 Llama 为 0.5%(JBB)和 0.6%(SR),Phi 均为 0.3%;SFT 仍为 23.8%、29.8%、10.0%、9.9%。Table 6 中三种审核模型的检出率随 batch 增大下降。
- 作者的结论: 只按单问做安全评测和对齐不够。作者称失败来自对齐偏好信号变弱和推理时拒绝信号被稀释,batch-aware 偏好对齐可以把这道差补回来,并把它写成后续防御方向。