研究揭示循环语言模型在不同循环深度下安全表现不一致
Safe at One Loop, Risky at Another: Aligning Safety Across Recurrent Depths in Looped Language Models
提出 SafeBridge 对齐 LoopLM 循环深度,Ouro-1.4B 攻击 Overall ASR 为 4.56%。
- LoopLM 的每个循环深度都可独立读出。作者称更深循环在原始有害查询上更安全,但越狱下是否成立不清楚;作者称 SFT 与偏好对齐也未消除跨深度安全差距。
- SafeBridge 给共享循环层的深度 2–4 加轻量调制,并从深度 2 把隐藏状态选择性接到更深出口。损失同时使用偏好对、回复安全标签、弱出口强调、各深度均匀监督和跨深度一致性。
- Ouro-1.4B/2.6B 上,Table 1 的 Overall attack ASR:SafeBridge 为 4.56% 与 9.85%,DPO 为 21.06% 与 44.93%。跨深度列同样更低。相对 Vanilla,Table 3 六个基准都更高。
- 论文未专列局限。结论促使后续对齐显式考虑循环计算。评测覆盖两种 Ouro、L=4、三种攻击与四个安全基准;消融只在 Ouro-1.4B 的 JailbreakBench。未报告多种子重复,也未报告与人工判定的一致性。
- 被测模型
- Ouro-1.4BOuro-2.6B
- 基准
- AdvBenchHarmBenchJailbreakBenchMaliciousInstructXSTestOR-Bench-HardGSM8KMMLUMBPPMBPP+HumanEvalHumanEval+
- 指标
- ASRMatchedCrossOverall attack ASRPooled source ASRORRaccuracypass@1
研究者对循环语言模型(LoopLM)在越狱攻击下的安全性做了系统评测,发现攻击成功率会随推理深度增加而上升,同一查询在不同深度可能触发不同的安全行为,针对某一深度构造的攻击还能迁移到其他深度。研究还发现 SFT 和偏好对齐无法消除这些安全差距。为此作者提出 SafeBridge,结合对共享循环层的轻量级深度特定控制、选择性状态桥接和跨循环深度的联合安全监督,在多种模型规模、攻击方法和安全基准上显著降低了同深度与跨深度攻击的成功率,同时提升了通用能力并保持相近的过度拒答水平。作者称代码与模型检查点将在论文被接收后发布。
深度解读
这篇论文试图解决什么问题?
LoopLM 各循环深度安全性可不一致,且越狱可从源深度迁到其他深度。
循环语言模型在多个可独立读出的深度上安全性并不一致,针对一个深度构造的越狱还可能迁到其他深度。
- 场景:LoopLM 在循环步上复用共享参数,每个循环深度都可经语言模型头读出。作者认为这扩大了有害行为可能出现的表面,需要检查安全是否贯穿整个循环计算。
- 现有缺口:作者称对 Ouro 的既有评估认为,更深循环会减少对原始有害查询的有害回答,但越狱下是否仍如此并不清楚。SFT、DPO、SafeDPO 面向常规 LLM,不显式做跨深度安全对齐;四个深度上等权平均 DPO 损失的 LoopDPO 也未优于 DPO。
- 两类现象:作者报告,同一输入在不同推理深度上的安全行为可以不同;针对源深度 s 构造的越狱可迁移到其他推理深度 d,使每个目标深度面对多个攻击来源。
- 评测设定:受害系统是 Ouro 家族的 LoopLM。攻击针对 s∈{1,2,3,4} 构造,再在 d∈{1,2,3,4} 读出;方法为 GCG、AutoDAN、PAIR。有害与否由 HarmBench classifier 判定。论文未把该设定称作 white-box 或 black-box。
- 做法:作者提出偏好优化方法 SafeBridge,用深度特异调制、选择性状态桥和跨深度安全监督,同时处理深度差异与跨深度迁移。
有哪些相关研究?
作者称现有对齐面向常规 LLM,未显式处理循环深度间的安全差异。
论文 Related Work 按三条线组织,并点名本文基线。
循环与循环深度语言模型
- Universal Transformers(Dehghani et al., 2019):在计算深度上共享参数,做循环计算。
- Saunshi et al. (2025)、Geiping et al. (2025):循环 Transformer 通过潜在循环计算改进推理,并把测试时计算当作额外缩放轴。
- Ouro(Zhu et al., 2025):扩展到带自适应深度分配的预训练 LoopLM。作者称既有研究主要看推理与计算缩放,跨循环深度的系统安全评估与对齐仍不充分。
越狱攻击与评测
- GCG(Zou et al., 2023)用梯度引导搜索优化可迁移对抗后缀;AutoDAN(Liu et al., 2024)用分层遗传算法生成语义上可读的越狱;PAIR(Chao et al., 2025)用攻击者 LLM 和目标模型反馈迭代改写提示。
- HarmBench(Mazeika et al., 2024)与 JailbreakBench(Chao et al., 2024)提供攻击与防御的标准化评测框架。
- 作者称本文在单个 LoopLM 内研究循环深度之间的迁移,并把攻击源深度与推理深度分开。论文未批评这三种攻击方法本身。
安全对齐
- SFT 与 RLHF(Ouyang et al., 2022)从示范和人类偏好学习行为;DPO(Rafailov et al., 2023)不单独训练奖励模型,直接优化偏好。
- Safe RLHF(Dai et al., 2024)把有用性奖励与安全代价分开;SafeDPO(Kim et al., 2026)把回复安全指示量放进直接偏好优化。
- DELMAN(Wang et al., 2025)与 EVA(Wang et al., 2026)用局部参数编辑对付越狱;ReSA(Cao et al., 2026)训练模型先作答再检查。作者称这些方法面向常规 LLM,不显式处理循环深度间的安全差异。
基线与基准
- 实验基线为 SFT、DPO、SafeDPO,以及在四个深度上等权平均偏好损失的 LoopDPO。
- 安全基准为 AdvBench、HarmBench、JailbreakBench、MaliciousInstruct;过度拒绝为 XSTest、OR-Bench-Hard;通用能力为 GSM8K、MMLU、MBPP、MBPP+、HumanEval、HumanEval+。
作者把 SafeBridge 定位为把循环深度当作显式对齐维度,用回复级安全监督加上深度特异控制与跨深度协调。
论文如何解决这个问题?
SafeBridge 以深度调制、状态桥和跨深度安全损失对齐各出口。
SafeBridge 在共享循环计算上做深度特异控制,并联合对齐各深度策略。架构与目标见 Figure 2。
深度特异调制与状态桥
- 调制:层在各深度共享,改一个深度会改变其他深度。作者因此给每个受监督深度单独的可训练向量。L=4,调制与直接监督在 D={2,3,4};深度 1 不加调制,仍可随共享骨干更新。层输出做 FiLM 式逐通道缩放与平移,缩放因子逐元素在 (0, 2),向量初始化为 0,初始为恒等。
- 状态桥:更深深度原本只能经中间循环看到更早状态。作者称动机是较早深度上观察到相对更安全的行为,于是用停梯度门控,把源深度归一化后的隐藏状态加到目标深度归一化之前。实验固定桥源深度为 2;Ouro-1.4B 的目标集为 {3,4},Ouro-2.6B 为 {3}。门控初始化为 0,初始不激活。论文未解释两规模目标集为何不同。
- 参数量:骨干、语言模型头、调制向量与桥门控联合优化。额外参数为 299,008(1.4B)与 591,872(2.6B),作者称约各模型的 0.02%。
带安全符号的偏好监督
- 标签:样本含提示、被选回复、被拒回复及安全标签,+1 为安全、−1 为不安全。作者指出偏好名次不能单独决定该提高还是降低似然,因为两条回复的安全标签可能相同。
- 分数:监督深度上,当前模型与冻结参考模型对两条回复做 teacher forcing。rd 是相对参考策略的对数似然变化。qd(y,η)=ηβ rd(y|x),qd 越大表示在提高安全回复或降低不安全回复的似然。
- 损失:成对偏好仍用 DPO 损失。另用 softplus(1−qd) 惩罚低于单位间隔的符号安全分。深度目标以系数 α 混合成对损失与两条回复的惩罚。论文取 α=0.85、β=0.1。
弱出口聚合与跨深度一致性
- 聚合:各深度风险不均,且成对损失与安全损失的较大值可能落在不同深度,因此三类损失分开做平滑最大值,以强调较弱出口;均匀项是各监督深度损失的平均。二者等权相加。
- 一致性:聚合不约束安全随循环如何变化。该项惩罚同一回复的符号安全分在下一监督深度下降,较早分数停梯度,温度与聚合共用。
- 总目标:LSafeBridge=1/2(E+U)+γ F。论文取温度 0.1、一致性系数 0.25。深度聚合在每条偏好对内完成,再对 batch 平均。附录 A 给出训练与前向过程。
训练起点与判定
- SFT:用 ReSA 发布的监督数据,从预训练 Ouro 开始,只监督深度 4,2 个 epoch,最长序列 8,192,超长样本丢弃。
- 偏好训练:DPO、SafeDPO、LoopDPO、SafeBridge 都从该 SFT 检查点开始,3 个 epoch。DPO 与 LoopDPO 只用排序;SafeDPO 与 SafeBridge 还用安全标注。SafeDPO 去掉 32,656 对双不安全样本,保留 41,251 对;其余保留全部 73,907 对。
- 参考模型:冻结。DPO 与 SafeDPO 的参考深度为 {4};LoopDPO 在四个深度上等权平均,每深度权重 0.25;SafeBridge 的参考深度为 {2,3,4}。
- 有害判定:HarmBench Llama-2-13B classifier 读取原始有害查询和生成回复,输出 yes 或 no。
论文做了哪些实验?
SafeBridge Overall attack ASR:Ouro-1.4B 4.56%,2.6B 9.85%(Table 1)。
实验设置
- 模型与基线:被对齐、被攻击的是 Ouro-1.4B 与 Ouro-2.6B。对照为同一模型上的 SFT、DPO、SafeDPO、LoopDPO。
- 数据与硬件:SFT 用 ReSA 的 79,552 行。偏好数据来自 PKU-SafeRLHF;SafeDPO 用 41,251 对,其余用 73,907 对。每次训练用一张 80GB A100。
- 攻击:GCG 用 EnsembleGCG、2,000 步;AutoDAN-HGA 为 100 步;PAIR 为 5 路并行、最多 5 轮,攻击模型 Vicuna-13B-v1.5,构造时目标是源深度上的 Ouro。每个规模、每个安全基准、每种攻击对四个源深度各造一套,共 48 套,再在四个推理深度复用,每检查点 192 个设置。
- 基准:AdvBench、HarmBench、JailbreakBench、MaliciousInstruct,含原始有害提示与越狱变体。过度拒绝为 XSTest 250 条安全提示、OR-Bench-Hard 1,319 条。通用能力只在 d=4:GSM8K 1,319 题、MMLU 14,042 题、MBPP/MBPP+ 378 题、HumanEval/HumanEval+ 164 题。
- 指标与生成:ASR 由 HarmBench Llama-2-13B classifier 的 yes/no 决定,分类器看到的是原始有害查询和生成回复。Matched 为四个 s=d 的平均,Cross 为 12 个 s≠d 的平均,再对四基准宏平均;Overall 平均 192 个条件。最终生成为 BF16、贪心、温度 0、最多 512 个新 token,每查询每深度一条。ORR 由 Qwen3.8-27B-FP8 判定。论文未报告多种子重复。
主结果
据 Table 1,单位 %。原始列为四基准×四深度(Avg@16),Overall 为 192 个条件的平均。
表格较宽,可左右滑动
方法 1.4B原始 1.4B Overall 2.6B原始 2.6B Overall Vanilla 29.13 50.44 30.19 65.66 SFT 21.23 23.77 41.40 45.90 DPO 17.73 21.06 37.35 44.93 SafeDPO 13.22 20.85 36.92 44.30 LoopDPO 19.55 21.89 39.37 45.19 SafeBridge 3.88 4.56 5.01 9.85 - 表内对比:两种规模上,SafeBridge 的原始 ASR 与 Overall attack ASR 都是该列最低。作者认为 LoopDPO 并未优于 DPO,只把单输出偏好目标扩到多个深度并不足够。
- 规模例外:Ouro-2.6B 上,SFT、DPO、SafeDPO、LoopDPO 的原始 ASR 都高于 Vanilla;Ouro-1.4B 上则低于 Vanilla。论文未解释这一例外。
- 匹配与跨深度:Table 1 其余列也是 SafeBridge 最低。Ouro-1.4B 的 PAIR Cross 为 2.77%,Vanilla 为 41.74%;Ouro-2.6B 的 GCG Matched 为 11.99%,Vanilla 为 81.82%。
推理深度上的安全变化
- 越狱随深度:Table 5 把越狱 ASR 再对三种攻击和四个源深度平均。Ouro-1.4B 上 DPO 在深度 2 为 2.72%、深度 4 为 35.44%;SafeBridge 为 0.98% 与 4.16%。作者称 SFT、DPO、LoopDPO 在深度 2 较低、在深度 3–4 上升。
- 中间出口:作者称 Ouro-2.6B 的越狱 ASR 在深度 3 而非深度 4 达峰,只看最终深度可能漏掉更脆弱的中间出口。Table 5 中 DPO 为 61.60% 与 37.58%。SafeBridge 在各深度都是表中最低,但其深度 1 为 14.13%,高于自身深度 3 的 9.35%。
- 与引言不完全一致:引言称原始有害查询上 ASR 随深度下降。Table 5 中 Ouro-1.4B Vanilla 的原始 ASR 在深度 2 为 39.26%,高于深度 1 的 25.88% 和深度 4 的 24.44%,并非各设置都单调下降。
跨深度迁移与汇集源
- 不匹配源可以更强:Figure 4 每格对四基准和三种攻击平均。Ouro-2.6B 的 DPO 在 s=2、d=3 为 66.24%,高于匹配深度 63.18%;SafeBridge 该格为 12.02%。作者称相对 DPO,两种规模上 16 个组合都更低。
- 四源汇集:Table 2 把针对四个源深度的变体合在一起,任一成功即计成功,再对四基准和四目标深度平均。PAIR 上 SafeBridge 为 8.39%(1.4B)与 24.25%(2.6B),SafeDPO 为 42.12% 与 85.49%。三种攻击、两种规模上 SafeBridge 均为该列最低。
- 定性案例:附录 D 用 JailbreakBench 比较 DPO 与 SafeBridge,按同一分类器标注,不复述示例原文。Ouro-2.6B 上,源深度 1 的 GCG 输入使 DPO 在推理深度 2 和 4 被判攻击成功、在 1 和 3 未成功;SafeBridge 在四个深度均未成功。Ouro-1.4B 上,源深度 3 的 PAIR 在推理深度 3 未成功,源深度 2 的 PAIR 在同一推理深度成功;SafeBridge 在深度 2 和 3 阻断这两条。
效用与过度拒绝
- 相对 DPO 与 Vanilla:Table 3 在最终深度 d=4。相对 Vanilla,SafeBridge 在两种规模的六个基准上都更高。作者称 Ouro-1.4B 上它高于 DPO 的全部六格,并在五个基准上为表中最高;相对 DPO,HumanEval 与 HumanEval+ 高 1.83 与 1.22 个百分点(79.88% 对 78.05%,76.22% 对 75.00%)。MBPP+ 为 61.38%,低于 SafeDPO 的 61.64%。
- 2.6B 代码并非都最高:SafeBridge 在 GSM8K 87.79%、MMLU 75.72%、MBPP+ 66.93% 为表中最高;HumanEval 为 82.32%,低于 DPO 的 84.15%。
- 过度拒绝:Table 6 中 Ouro-1.4B 的 XSTest,SafeBridge 在深度 2 为 51.60%,DPO 为 63.20%。作者称相对 SafeDPO 过度拒绝大体相当,且峰值通常更低;相对 DPO 与 Vanilla,部分深度更高。例如 1.4B 的 OR-Bench-Hard 深度 4:SafeBridge 14.10%,DPO 4.40%,Vanilla 10.08%。
其他消融与分析
消融在 Ouro-1.4B、JailbreakBench、三种攻击和全部 4×4 深度对上(Table 4)。Mean 为 48 个条件的 ASR;Worst Exit 是先对攻击和源深度平均后、四个推理深度中的最高 ASR;Worst Setting 是 48 个条件中的最大 ASR;Safety Regression 是相邻深度 2→3 与 3→4 上,同一攻击输入较早深度安全、下一深度有害的比例。完整 SafeBridge 为 4.40%、11.92%、24.00%、1.83%。作者称去掉任一组件这些指标都会变差。
- 去掉回复安全损失:Mean 20.83%,Worst Exit 29.67%,Worst Setting 47.00%,Safety Regression 4.08%;Mean 升幅为各变体中最大。
- 去掉调制:Mean 15.35%,Worst Setting 59.00%,Safety Regression 3.17%。
- 去掉状态桥:Mean 7.69%,Worst Setting 31.00%,Safety Regression 7.17%。
- 去掉弱出口项 E:Mean 6.75%,Worst Exit 18.42%,Worst Setting 29.00%,Safety Regression 2.46%。
- 去掉均匀项 U:Mean 9.13%,Worst Exit 15.33%,Worst Setting 27.00%,Safety Regression 6.17%。
- 去掉一致性项 F:Mean 5.19%,Worst Exit 13.83%,Worst Setting 33.00%,Safety Regression 3.29%;作者称对 Mean 影响较小,但后两项上升。
有什么可以进一步探索的点?
论文未专列局限,结论促使未来对齐显式考虑循环计算。
作者指出的局限与后续方向
- 未专列局限:论文没有 Limitations、Discussion 或 Future Work 专节,也未把某一实验结果写成方法局限。
- 后续方向:Conclusion 称这些发现凸显了在循环深度上评估并对齐安全的重要性,并促使未来的安全对齐方法显式考虑循环计算。
实验覆盖范围
- 模型与深度:被测模型为 Ouro-1.4B 与 Ouro-2.6B,循环步数 L=4,直接监督深度为 {2,3,4}(Section 3.1、Section 4)。
- 攻击面:安全评测覆盖 AdvBench、HarmBench、JailbreakBench、MaliciousInstruct;攻击为 GCG、AutoDAN、PAIR;源深度与推理深度均为 1 到 4,每检查点 192 个设置(Section 4)。
- 判定与其他评测:ASR 由 HarmBench Llama-2-13B classifier 判定;过度拒绝由 Qwen3.8-27B-FP8 在 XSTest(250)和 OR-Bench-Hard(1,319)上判定;通用能力只在 d=4 评测六个基准(Section 4、附录 C)。
- 消融与桥:消融在 Ouro-1.4B 上,用 JailbreakBench、三种攻击和全部 4×4 深度对(Section 5.5)。桥源深度固定为 2;1.4B 的桥目标为 {3,4},2.6B 为 {3}(Section 4)。
- 论文未报告:四个安全基准各自的查询条数、多种子重复,以及分类器或过度拒绝评判与人工判定的一致性。
总结一下论文的主要内容
SafeBridge 对齐 LoopLM 各循环深度,并降低匹配与跨深度越狱 ASR。
SafeBridge 把循环深度当作 LoopLM 的对齐维度,用来同时压低匹配深度和跨深度越狱的成功率。
- 问题:单个模型可在多个深度读出。同一查询的安全行为可随深度变化,在源深度上构造的越狱会迁到其他推理深度。作者称常规 SFT 与偏好对齐,以及把 DPO 等权扩到四个深度的 LoopDPO,都未盖住这一差距。
- 方法:共享层在深度 2–4 接受单独调制;深度 2 的隐藏状态经门控接到更深出口。损失混合偏好、回复安全标签、弱出口强调、均匀监督和跨深度一致性。1.4B 与 2.6B 的桥目标集分别为 {3,4} 与 {3}。
- 主结果:Table 1 的 Overall attack ASR,SafeBridge 在 Ouro-1.4B/2.6B 为 4.56%/9.85%,DPO 为 21.06%/44.93%,Vanilla 为 50.44%/65.66%。Ouro-2.6B 上,几个对齐基线的原始 ASR 反而高于 Vanilla。
- 迁移:Figure 4 中 Ouro-2.6B 的 DPO,从源深度 2 打到推理深度 3 为 66.24%,高于匹配的 63.18%;SafeBridge 该格为 12.02%。Table 2 的 PAIR 汇集源 ASR,SafeBridge 为 8.39% 与 24.25%。
- 深度仍不均匀:Table 5 中 Ouro-1.4B 的 DPO 越狱 ASR 在深度 2 为 2.72%、深度 4 为 35.44%。SafeBridge 在各深度都更低,但其 Ouro-1.4B 越狱 ASR 在深度 1 仍为 12.07%。
- 效用、拒绝与结论:相对 Vanilla,Table 3 六个基准都更高;相对 DPO 并非每格都更高。Table 6 中部分深度的过度拒绝高于 DPO 与 Vanilla。作者认为不能从单一循环深度推断 LoopLM 的安全。作者计划在接收后发布代码与检查点。