DAPRO:多轮 LLM 评测中越狱所需轮数的动态预算分配
How Many Iterations to Jailbreak? Dynamic Budget Allocation for Multi-Turn LLM Evaluation
DAPRO分配多轮评测预算并给time-to-event下界;Toxicity上作者称偏差低1.90×。
- 多轮评测中,越狱成功或智能体完成任务可能要很多轮才出现,而交互计算贵。作者要在期望预算下估计time-to-event,并为未见提示词给出有覆盖保证的预测界。
- DAPRO把校准样本分为学习策略、共形风险控制与部署三段。用轨迹分数决定继续概率,在期望预算下减少加权误覆盖的方差,再以逆概率权重校准分位数,测试时只看初始提示词。
- Toxicity上、目标覆盖90%、每样本预算20,作者称四模型平均偏差比static低1.90×、方差低3.32×。Red-Team的Phi-4 Mini全量事件率79.6%,最低估计static 66.6%、DAPRO 73.7%。
- 作者指出实验里CRC常使预算用不满,覆盖保证依赖校准与测试同分布,τ̂也不随测试提示词变化。实验包括Toxicity、Red-Team、AutoIF和附录幻觉任务,目标模型为正文列出的4个;正文未给出Figure 2各模型覆盖率原值。
- 被测模型
- Qwen 2.5 14B InstructLlama 3.1 8B InstructPhi 4 Mini InstructGemma 3 4B Instruct
- 基准
- RealToxicityPromptsAnthropic Red-TeamAutoIFSQuAD v2
- 指标
- coverage rateabsolute coverage deviationcoverage-rate varianceevent rateRMTTEbudget per sample
论文提出 DAPRO(Dynamic Allocation via PRojected Optimization),一个用于多轮 LLM 交互中事件发生时间下界估计的动态预算分配框架。作者证明该方法满足期望预算约束,并提供无分布假设的有限样本覆盖保证,不再依赖此前 conformal survival 方法所要求的删失时间与事件时间条件独立假设。其覆盖界随平均删失权重的平方根缩放,且只涉及部分样本而非最坏情况权重,因此比先前工作更紧。DAPRO 还可在有限算力下给出越狱率等总体评测指标的无偏估计。在 Agent 任务成功、LLM 越狱、有害内容生成和 RAG 幻觉四类实验中,DAPRO 的覆盖更接近名义水平、方差低于静态基线,且期望预算不超限。
深度解读
这篇论文试图解决什么问题?
多轮交互的关键事件往往很晚出现,作者用DAPRO在期望预算内构造time-to-event预测界。
多轮交互中的关键事件往往很晚才出现,作者要在期望预算内为事件发生所需轮数(time-to-event)构造有覆盖保证的预测界。
- 场景:作者称系统正从单次预测转向顺序交互。越狱、有毒输出、幻觉或智能体完成任务都可能要很多轮,而每一轮都贵。他们问的不是最终会不会发生,而是要多少轮才会发生。
- 现有做法的不足:作者称[7]能给time-to-unsafe的下预测界(LPB),但审查时间在交互前固定,对话展开后不更新;事件提前结束时,该样本剩余预算不能分给其他样本。作者还称,用部分观测的事件时间直接校准,经验上会欠覆盖。
- 动态分配的难点:各条序列不能互相通信来决定停或继续,否则会破坏理论所用的独立性;在线更新审查时间仍须满足共享的期望预算。
- 本文提出:Dynamic Allocation via PRojected Optimization(DAPRO)。作者称它满足期望预算,覆盖保证不要求审查时间与事件时间在给定提示词下条件独立,并可在固定基准上无偏估计越狱率等群体指标。
- 评测设定:目标由attacker或智能体生成初始提示词,再与目标模型多轮交互;audit函数判定事件。校准与测试假设i.i.d.,攻击或智能体、目标模型和audit固定。预算是期望交互轮数不超过B。测试时只根据初始提示词出界,不再调用模型;作者给出的理由是测试预算可能没有,且自主系统已做出的动作可能难以撤回。
有哪些相关研究?
相关工作包括共形生存分析、[7]的静态分配,以及主动学习与降低评测开销的方法。
按引言、第2节和附录A的分组。
共形预测与生存分析
- 共形预测(Vovk等,2005;Shafer and Vovk,2008)、split conformal(Papadopoulos等,2002)和协变量偏移加权(Tibshirani等,2019):在可交换性下构造有限样本预测集。论文作背景引用,未单独批评。
- 共形生存分析(Candès等,2023;Gui等,2024,以及文中的[41, 42]):用逆删失加权处理右删失;[42]还用纵向协变量做历史感知的预测集。作者称既有PAC型松弛随最坏权重缩放,且依赖审查时间与事件时间在给定协变量下条件独立。
- Davidov、Feldman等(AISTATS 2026)[7]:提出time-to-unsafe-sampling,以及交互前固定、以方差最小化为目标的预算分配。作者称事件提前结束时,该样本剩余预算不能再分配。
主动学习与实验设计
- Settles(2010)、Fedorov(2013):研究如何把有限预算分到观测上,以降低估计方差。
- Zrnic and Candès(2024)、Hahn等(2011):在保持推断保证的前提下主动采集,或用倾向得分做自适应实验。
- Wang等(2026):针对删失生存结局做自适应实验。作者称其是在参与者之间分配预算以估计因果效应,本文则在每条轨迹内部决定滚到多远。
安全评测、红队与降低开销的评测
- 检测与护栏包括RealToxicityPrompts、SimpleSafetyTests、Llama Guard、NeMo Guardrails。红队工作包括PAIR、Perez等(2022)、Zou等(2023)、Wei等(2023)和TAP。作者称这些攻击工作旨在提高攻击成功率,不是在资源约束下估计删失的time-to-event。
- Kumar等(2023)和SmoothLLM用随机平滑等技术,给单条提示词的失败概率上界。作者称本文要利用多轮结构,给time-to-event统计保证。
- 降低评测开销的工作包括主动测试(Kossen等,2021;Li等,2024)、多臂赌博机(Zhou等,2025)、自适应划分(Wang等,2025)和有限总体推断(Wu等,2026)。作者称它们选择评哪些固定条目,本文决定每条顺序轨迹滚多远,并处理由此产生的删失。
基线与基准
- 基线是未校准的原始分位,以及[7]的静态优化分配。群体指标实验中,未校准指均匀预算下的朴素未加权估计;另有无限预算的Oracle作参照。
- 基准为RealToxicityPrompts、Anthropic Red-Team、AutoIF;附录还有基于SQuAD v2的RAG幻觉数据。多轮交互用PAIR生成。
作者把本文定位为:把[7]扩展到审查时间随轨迹更新的情形,去掉条件独立假设,并用只作用在一部分轨迹上的平均逆概率权重收紧覆盖间隙。
论文如何解决这个问题?
DAPRO先学继续概率,再用可选的CRC控制期望预算,然后自适应采集并校准预测界。
整体上,DAPRO把预算分配当成序贯决策:先在一部分校准轨迹上学继续还是停止,再在其余轨迹上按该策略采集,最后用已知审查机制校准time-to-event的预测界。
问题设定与沿用的校准
- 未删失时间是首次出现事件的轮数,删失时间是它与审查时间的较小值。期望预算为 𝔼[∑i T̃i]≤ B,即期望总交互轮数不超过B。
- 预测模型事先给出分位估计,并截断到不超过M。作者沿用[7]:用逆概率权重修正删失造成的分布偏移,再取误覆盖估计不超过α的最大水平。该水平为 τ̂=sup{τ∈𝒯:supτ′≤τα̂(τ′)≤α}。
- 分配时尚不知道校准后的水平,故使用固定的先验分位,并假定校准水平落在0到该先验之间。测试时下界只是初始提示词的函数。
- 下界用于不安全事件:界前不太可能发生。上界用于任务完成:到该界时很可能已经发生。附录B把“到最大轮数仍未发生”另记一档,并当作无穷。
Phase I:学习采集策略
- 校准索引随机分成学习集、共形风险控制(CRC)集和部署集。学习阶段把前两组观测到事件或先验分位为止。总预算必须够完成这一阶段。
- 分数把截至当前轮的轨迹打成实数,越高越该再花一轮。实现用当前步发生事件的估计概率。分数经单调映射变成继续概率,再做伯努利抽样。
- 优化的是加权误覆盖方差的代理。因为校准水平要等采集结束后才知道,作者用目标误覆盖水平α,而不是更保守的先验分位。小样本上的0-1指示不稳定,故用估计概率作平滑代理,并加小正则,让目标区间外的轨迹也有信号。
- 约束是这些样本的期望花费不超过后续每样本剩余预算,且分数更高则继续概率不更低。附录用两档分箱、对数概率上的对偶搜索求解,并把累积到达概率限制在正下界以上。
预算校准与部署
- 可选CRC把原映射乘以0到1之间的系数,使期望花费随系数不减。使用CRC样本前,先把每条轨迹的条件期望花费截到上界,避免策略被压得过保守。所选系数是CRC上界仍落在剩余预算内的最大值。
- 不启用CRC时直接部署原映射。作者称此时没有有限样本预算保证,保证依赖映射能泛化。
- 部署集逐步计算分数、继续概率和伯努利决策。到达事件或先验分位时,审查时间设为先验分位;否则取最后到达的步。到达目标长度的样本,权重是各步继续概率之积的倒数。学习集和CRC集的权重为1。
- 随后用附录的Algorithm 1选出校准水平。LPB实验的默认参数包括两档分箱、正则10的负3次方、到达概率下界0.005;CRC花费上界取最大轮数与两倍平均预算的较小值。
作者给出的保证
- 在i.i.d.、分位对水平非降、且部署集上“事件早于先验分位”的平均逆概率权重有上界时,作者称以至少1减容忍度的概率,条件覆盖至少为目标覆盖减去一个间隙。间隙随校准样本量的倒数和该平均权重的平方根变化,而不是随全体样本的最大权重。
- 作者称该结果不需要审查时间与事件时间在给定提示词下条件独立;DAPRO用真实事件时间提前停止,本来就会违反这一假设。作者称同一技巧也可用于[7]的静态流程。
- 在CRC可行集非空时,作者称期望总花费不超过预定预算。无CRC时的期望预算结论写在附录C.3,需要映射泛化假设。
论文做了哪些实验?
作者称Toxicity四模型平均,DAPRO覆盖偏差比static低1.90×、方差低3.32×。
实验设置
- 数据:RealToxicityPrompts、Anthropic Red-Team、AutoIF各10,000条;附录幻觉数据来自SQuAD v2,也是10,000条。划分为训练4,000、校准3,000、测试3,000。
- 模型与生成:攻击或helper为Qwen 2.5 14B Instruct,交互由PAIR生成。目标模型为Qwen 2.5 14B Instruct、Llama 3.1 8B Instruct、Phi 4 Mini Instruct、Gemma 3 4B Instruct。预测模型是在Multilingual-E5-large嵌入上训练的transformer,各方法共用。
- 事件:Toxicity用Detoxify,阈值0.5。正文Red-Team用Llama Guard。AutoIF由程序检查是否满足全部指令。附录幻觉由Qwen 2.5打1到10分,10分记为幻觉。评审失败时把分数记为0并继续。
- 协议:最大轮数和分位截断都是200。LPB的先验分位是0.56,UPB是0.98。主实验的训练对话观测到最大轮数。校准与测试的随机划分重复50次。LPB搜索为1,000个对数间隔候选;UPB为3,000个线性间隔候选。
- 对照:未校准的目标水平分位,以及[7]的静态优化分配。附录还报告去掉CRC的DAPRO,以及无限预算的Oracle。
- 规模与指标:附录F.1的LPB实验中,学习集和CRC集各25条;F.2的指标估计各50条。指标包括相对目标覆盖的绝对偏差、覆盖率方差、每样本预算、事件率和受限平均时间。
主结果
正文没有逐模型列出覆盖率原值。下表只收录正文写明的数字。
表格较宽,可左右滑动
指标 条件 报告值 出处 覆盖绝对偏差 Toxicity,四目标模型平均,目标90%,每样本预算20 作者称DAPRO比static低1.90× Section 4,Figure 2 覆盖率方差 同上 作者称DAPRO比static低3.32× Section 4,Figure 2 事件率估计方差 Red-Team,平均,每样本预算20 作者称DAPRO约低72% Section 4,Figure 4 事件率最低估计 Red-Team,Phi-4 Mini,全量79.6%,每样本预算20 Static 66.6%;DAPRO 73.7% Section 4,Figure 4 - 作者称Figure 2中DAPRO满足期望预算,且覆盖偏差低于对比方法。各模型单独的覆盖率和预算原值,正文未给出。
- 作者称Figure 4中两种分配的平均估计都接近全量事件率;更低的方差降低了把事件率估低、从而使模型显得比实际更安全的风险。正文将该Red-Team评审写为Llama Guard。
- AutoIF的Figure 3只针对Qwen 2.5:下界目标90%、每样本预算10,上界目标80%、每样本预算20。作者称两种界都更接近名义覆盖。选80%是因为90%会把上界推到接近200,作者称这会人为缩小方法间的方差差。该图的偏差原值正文未给出。
群体指标估计
- 测了什么:附录F.2在五种数据与评审配置上估计事件率,以及截断到200轮的平均时间。每样本预算20,用到达概率做Horvitz–Thompson重加权。
- 结果:作者称正确重加权的方法在期望上对准全量值;带CRC的DAPRO在两种指标上的经验方差都低于Static。作者称Toxicity图中的未校准估计低于真实指标。除主结果表已列的Red-Team数字外,附录未在文字中给出其余配置的估计原值。
- 作者解读:固定基准上的指标直接在该基准计算,不需要把结论外推到未见提示词。附录F.4.4中,均匀继续概率加CRC能看到更多事件,但事件率方差仍高于DAPRO和static;作者据此认为事件数本身不代表估计方差低。
覆盖间隙
- 测了什么:附录F.3在Toxicity上用带CRC的DAPRO构造90%下界,每样本预算取5、10、20、30、40、50,各50个种子,容忍度0.05。
- 结果:作者称既有间隙约894到533个百分点,所提间隙约24.1到5.0个百分点,约小37–110×。
- 作者解读:作者称既有间隙在所试预算下都不具信息量;新间隙在最小预算下仍可用。作者还称,若定义中的分位低于先验分位,间隙还可以更紧。
攻击模型偏移
- 测了什么:附录F.4.11在Qwen 2.5 14B Instruct作为攻击者的轨迹上学习和校准,在Gemma 3 12B IT作为攻击者的数据上评估;目标模型是Llama 3.1 8B Instruct。Red-Team和Toxicity的每样本预算都是10。Red-Team的评审与攻击者相同,故两者一起改变。
- 结果:作者称DAPRO与static的覆盖为94–97%,而不是90%;DAPRO在两个设置中覆盖方差更低,观测事件更多,预算不高于目标。论文未给出各设置单独的覆盖率。
- 作者解读:此时校准与测试不再i.i.d.,理论不保证名义覆盖。作者称学到的分配仍然统计稳定,但偏移后的下界更保守。
其他消融与分析
- Phase I规模(Figure 21):作者称所试学习集加CRC集的规模下,覆盖为90%且每样本预算不超过20;规模增大时用量更接近目标,平均权重升高。
- 可用预算(Figure 22):作者称低预算时static的覆盖方差高;DAPRO在所试预算下经验覆盖约90%,预算增加时平均权重下降。
- 训练预算(Figure 31):作者称每样本训练预算为5时,DAPRO方差仍低于Static;该预算下温度缩放把测试负对数似然从1.47升到2.37,验证轨迹约17条。
- 优化目标(Figure 23):作者称soft-prefix观测事件最多,加权误差和覆盖方差最低;soft-terminal更差。正文未给具体方差值。
- 分数噪声与映射容量(Figure 25–28):作者称中等噪声可被两档映射和CRC吸收,完全随机分数会变差;有CRC时8档的事件率方差最低,无CRC时2档最稳定。
- CRC花费上界与误覆盖估计(Figure 29–30):作者称上界过小会不用满预算,过大则有限样本修正变松,默认取两倍平均预算;UPB上作者称序贯增广估计的方差最低,该实验目标覆盖80%、每样本预算20。
有什么可以进一步探索的点?
作者指出CRC常使预算用不满,τ̂不随测试提示词变化,覆盖保证还依赖同分布。
作者指出的局限与后续方向
- CRC版本在实验中经常用不满预算;不需要有限样本预算保证时,可以去掉CRC。作者称无CRC时实验里一般仍满足预算,尽管理论要求映射准确(Section 5)。
- 作者把确定性而非期望意义的预算控制称为重要后续方向,并称正在研究(Section 5)。
- 当前校准后的分位水平是对所有测试提示词相同的标量。作者提出可随测试提示词自适应,对可预测交互更紧、对高方差交互更保守(Section 5)。
- 另一方向是设计更能代表安全或效用的分数,从而映射成方差更低的继续概率(Section 5)。
- 覆盖保证依赖校准与测试i.i.d.。作者称模型更新或新攻击策略会造成分布变化,对分布偏移或audit标注错误的稳健方法是后续工作。固定基准上的指标估计不需要这一i.i.d.假设(Section 5)。
实验覆盖范围
- 目标模型为Qwen 2.5 14B Instruct、Llama 3.1 8B Instruct、Phi 4 Mini Instruct、Gemma 3 4B Instruct,共4个。主实验的攻击或helper是Qwen 2.5 14B Instruct,交互由PAIR生成。
- 任务数据为RealToxicityPrompts、Anthropic Red-Team、AutoIF各10,000条,以及附录基于SQuAD v2的幻觉数据10,000条。训练、校准、测试为4,000、3,000、3,000,每设置50次划分,最大轮数200。
- 事件判定包括Detoxify阈值0.5、Llama Guard和程序化验证;附录另有Qwen 2.5的1到10分评审。比较对象为未校准分位和[7]的静态分配,并同时报告下界、上界和群体指标。
- 附录F.1的LPB实验把学习集和CRC集各设为25条;F.2的指标估计各为50条。附录F.4.10还改变了训练阶段的每样本预算。
- 附录F.4.11把攻击者从Qwen 2.5 14B Instruct换到Gemma 3 12B IT。正文未给出Figure 2、Figure 3各模型的覆盖率与预算原值。
总结一下论文的主要内容
DAPRO在期望预算内动态分配多轮交互,并给出time-to-event的有限样本覆盖界。
DAPRO是在期望交互预算下,为多轮LLM评测构造time-to-event预测界的统计方法。
- 关键事件可能很晚才出现。静态审查时间在交互前固定,事件提前结束时,剩余预算不能转给其他样本。
- 校准数据被分成学习、可选的共形风险控制和部署。轨迹分数映射成继续概率,伯努利决策决定是否再交互,逆概率权重再用来校准分位。测试只看初始提示词。
- 在Toxicity、目标覆盖90%、每样本预算20时,作者称四个目标模型平均,DAPRO的覆盖绝对偏差比static低1.90×,覆盖率方差低3.32×,且期望预算不超限。各模型原值正文未列出。
- Red-Team事件率估计中,作者称DAPRO的方差平均约低72%。Phi-4 Mini的全量事件率是79.6%,估计最低值在static为66.6%、在DAPRO为73.7%。
- AutoIF上,作者称Qwen 2.5的下界和上界都更接近各自的名义覆盖。附录还包含RAG幻觉;攻击模型改变后,作者称覆盖为94–97%,高于名义90%。
- 作者的结论是:在线更新审查时间可以在期望预算内收紧有限样本覆盖间隙,并降低群体事件率估计的方差。覆盖向未见提示词外推仍依赖同分布,确定性预算控制被作者列为后续工作。