跳到正文
原文
arXiv:危险能力与安全评测· arXiv:2610.10625· Yi Wang, Xiuyuan Qi, Dongqi Han, Dongsheng Li, Wenjie Wang·本站收录 · 原文发表

研究揭示循环语言模型在不同循环深度下安全表现不一致

Safe at One Loop, Risky at Another: Aligning Safety Across Recurrent Depths in Looped Language Models

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

提出 SafeBridge 对齐 LoopLM 循环深度,Ouro-1.4B 攻击 Overall ASR 为 4.56%。

问题
LoopLM 的每个循环深度都可独立读出。作者称更深循环在原始有害查询上更安全,但越狱下是否成立不清楚;作者称 SFT 与偏好对齐也未消除跨深度安全差距。
方法
SafeBridge 给共享循环层的深度 2–4 加轻量调制,并从深度 2 把隐藏状态选择性接到更深出口。损失同时使用偏好对、回复安全标签、弱出口强调、各深度均匀监督和跨深度一致性。
实验与结果
Ouro-1.4B/2.6B 上,Table 1 的 Overall attack ASR:SafeBridge 为 4.56% 与 9.85%,DPO 为 21.06% 与 44.93%。跨深度列同样更低。相对 Vanilla,Table 3 六个基准都更高。
局限与可以继续做的
论文未专列局限。结论促使后续对齐显式考虑循环计算。评测覆盖两种 Ouro、L=4、三种攻击与四个安全基准;消融只在 Ouro-1.4B 的 JailbreakBench。未报告多种子重复,也未报告与人工判定的一致性。
实验设置Ouro-1.4B、Ouro-2.6B · AdvBench、HarmBench 等 · ASR、Matched 等
被测模型
Ouro-1.4BOuro-2.6B
基准
AdvBenchHarmBenchJailbreakBenchMaliciousInstructXSTestOR-Bench-HardGSM8KMMLUMBPPMBPP+HumanEvalHumanEval+
指标
ASRMatchedCrossOverall attack ASRPooled source ASRORRaccuracypass@1
AI 导读研究者对循环语言模型(LoopLM)在越狱攻击下的安全性做了系统评测,发现攻击成功率会随推理深度增加而上升,同一查询在不同深度可能触发不同的安全行为,针对某一深度构造的攻击还能迁移到其他深度。研究还发现 SFT 和偏好对齐无法消除这些安全差距。为此作者提出 SafeBridge,结合对共享循环层的轻量级深度特定控制、选择性状态桥接和跨循环深度的联合安全监督,在多种模型规模、攻击方法和安全基准上显著降低了同深度与跨深度攻击的成功率,同时提升了通用能力并保持相近的过度拒答水平。作者称代码与模型检查点将在论文被接收后发布。

研究者对循环语言模型(LoopLM)在越狱攻击下的安全性做了系统评测,发现攻击成功率会随推理深度增加而上升,同一查询在不同深度可能触发不同的安全行为,针对某一深度构造的攻击还能迁移到其他深度。研究还发现 SFT 和偏好对齐无法消除这些安全差距。为此作者提出 SafeBridge,结合对共享循环层的轻量级深度特定控制、选择性状态桥接和跨循环深度的联合安全监督,在多种模型规模、攻击方法和安全基准上显著降低了同深度与跨深度攻击的成功率,同时提升了通用能力并保持相近的过度拒答水平。作者称代码与模型检查点将在论文被接收后发布。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    LoopLM 各循环深度安全性可不一致,且越狱可从源深度迁到其他深度。

    循环语言模型在多个可独立读出的深度上安全性并不一致,针对一个深度构造的越狱还可能迁到其他深度。

    • 场景:LoopLM 在循环步上复用共享参数,每个循环深度都可经语言模型头读出。作者认为这扩大了有害行为可能出现的表面,需要检查安全是否贯穿整个循环计算。
    • 现有缺口:作者称对 Ouro 的既有评估认为,更深循环会减少对原始有害查询的有害回答,但越狱下是否仍如此并不清楚。SFT、DPO、SafeDPO 面向常规 LLM,不显式做跨深度安全对齐;四个深度上等权平均 DPO 损失的 LoopDPO 也未优于 DPO。
    • 两类现象:作者报告,同一输入在不同推理深度上的安全行为可以不同;针对源深度 s 构造的越狱可迁移到其他推理深度 d,使每个目标深度面对多个攻击来源。
    • 评测设定:受害系统是 Ouro 家族的 LoopLM。攻击针对 s∈{1,2,3,4} 构造,再在 d∈{1,2,3,4} 读出;方法为 GCG、AutoDAN、PAIR。有害与否由 HarmBench classifier 判定。论文未把该设定称作 white-box 或 black-box。
    • 做法:作者提出偏好优化方法 SafeBridge,用深度特异调制、选择性状态桥和跨深度安全监督,同时处理深度差异与跨深度迁移。
  2. 有哪些相关研究?

    作者称现有对齐面向常规 LLM,未显式处理循环深度间的安全差异。

    论文 Related Work 按三条线组织,并点名本文基线。

    循环与循环深度语言模型

    • Universal Transformers(Dehghani et al., 2019):在计算深度上共享参数,做循环计算。
    • Saunshi et al. (2025)、Geiping et al. (2025):循环 Transformer 通过潜在循环计算改进推理,并把测试时计算当作额外缩放轴。
    • Ouro(Zhu et al., 2025):扩展到带自适应深度分配的预训练 LoopLM。作者称既有研究主要看推理与计算缩放,跨循环深度的系统安全评估与对齐仍不充分。

    越狱攻击与评测

    • GCG(Zou et al., 2023)用梯度引导搜索优化可迁移对抗后缀;AutoDAN(Liu et al., 2024)用分层遗传算法生成语义上可读的越狱;PAIR(Chao et al., 2025)用攻击者 LLM 和目标模型反馈迭代改写提示。
    • HarmBench(Mazeika et al., 2024)与 JailbreakBench(Chao et al., 2024)提供攻击与防御的标准化评测框架。
    • 作者称本文在单个 LoopLM 内研究循环深度之间的迁移,并把攻击源深度与推理深度分开。论文未批评这三种攻击方法本身。

    安全对齐

    • SFT 与 RLHF(Ouyang et al., 2022)从示范和人类偏好学习行为;DPO(Rafailov et al., 2023)不单独训练奖励模型,直接优化偏好。
    • Safe RLHF(Dai et al., 2024)把有用性奖励与安全代价分开;SafeDPO(Kim et al., 2026)把回复安全指示量放进直接偏好优化。
    • DELMAN(Wang et al., 2025)与 EVA(Wang et al., 2026)用局部参数编辑对付越狱;ReSA(Cao et al., 2026)训练模型先作答再检查。作者称这些方法面向常规 LLM,不显式处理循环深度间的安全差异。

    基线与基准

    • 实验基线为 SFT、DPO、SafeDPO,以及在四个深度上等权平均偏好损失的 LoopDPO。
    • 安全基准为 AdvBench、HarmBench、JailbreakBench、MaliciousInstruct;过度拒绝为 XSTest、OR-Bench-Hard;通用能力为 GSM8K、MMLU、MBPP、MBPP+、HumanEval、HumanEval+。

    作者把 SafeBridge 定位为把循环深度当作显式对齐维度,用回复级安全监督加上深度特异控制与跨深度协调。

  3. 论文如何解决这个问题?

    SafeBridge 以深度调制、状态桥和跨深度安全损失对齐各出口。

    SafeBridge 在共享循环计算上做深度特异控制,并联合对齐各深度策略。架构与目标见 Figure 2。

    深度特异调制与状态桥

    • 调制:层在各深度共享,改一个深度会改变其他深度。作者因此给每个受监督深度单独的可训练向量。L=4,调制与直接监督在 D={2,3,4};深度 1 不加调制,仍可随共享骨干更新。层输出做 FiLM 式逐通道缩放与平移,缩放因子逐元素在 (0, 2),向量初始化为 0,初始为恒等。
    • 状态桥:更深深度原本只能经中间循环看到更早状态。作者称动机是较早深度上观察到相对更安全的行为,于是用停梯度门控,把源深度归一化后的隐藏状态加到目标深度归一化之前。实验固定桥源深度为 2;Ouro-1.4B 的目标集为 {3,4},Ouro-2.6B 为 {3}。门控初始化为 0,初始不激活。论文未解释两规模目标集为何不同。
    • 参数量:骨干、语言模型头、调制向量与桥门控联合优化。额外参数为 299,008(1.4B)与 591,872(2.6B),作者称约各模型的 0.02%。

    带安全符号的偏好监督

    • 标签:样本含提示、被选回复、被拒回复及安全标签,+1 为安全、−1 为不安全。作者指出偏好名次不能单独决定该提高还是降低似然,因为两条回复的安全标签可能相同。
    • 分数:监督深度上,当前模型与冻结参考模型对两条回复做 teacher forcing。rd 是相对参考策略的对数似然变化。qd(y,η)=ηβ rd(y|x),qd 越大表示在提高安全回复或降低不安全回复的似然。
    • 损失:成对偏好仍用 DPO 损失。另用 softplus(1−qd) 惩罚低于单位间隔的符号安全分。深度目标以系数 α 混合成对损失与两条回复的惩罚。论文取 α=0.85、β=0.1。

    弱出口聚合与跨深度一致性

    • 聚合:各深度风险不均,且成对损失与安全损失的较大值可能落在不同深度,因此三类损失分开做平滑最大值,以强调较弱出口;均匀项是各监督深度损失的平均。二者等权相加。
    • 一致性:聚合不约束安全随循环如何变化。该项惩罚同一回复的符号安全分在下一监督深度下降,较早分数停梯度,温度与聚合共用。
    • 总目标:LSafeBridge=1/2(E+U)+γ F。论文取温度 0.1、一致性系数 0.25。深度聚合在每条偏好对内完成,再对 batch 平均。附录 A 给出训练与前向过程。

    训练起点与判定

    • SFT:用 ReSA 发布的监督数据,从预训练 Ouro 开始,只监督深度 4,2 个 epoch,最长序列 8,192,超长样本丢弃。
    • 偏好训练:DPO、SafeDPO、LoopDPO、SafeBridge 都从该 SFT 检查点开始,3 个 epoch。DPO 与 LoopDPO 只用排序;SafeDPO 与 SafeBridge 还用安全标注。SafeDPO 去掉 32,656 对双不安全样本,保留 41,251 对;其余保留全部 73,907 对。
    • 参考模型:冻结。DPO 与 SafeDPO 的参考深度为 {4};LoopDPO 在四个深度上等权平均,每深度权重 0.25;SafeBridge 的参考深度为 {2,3,4}。
    • 有害判定:HarmBench Llama-2-13B classifier 读取原始有害查询和生成回复,输出 yes 或 no。
  4. 论文做了哪些实验?

    SafeBridge Overall attack ASR:Ouro-1.4B 4.56%,2.6B 9.85%(Table 1)。

    实验设置

    • 模型与基线:被对齐、被攻击的是 Ouro-1.4B 与 Ouro-2.6B。对照为同一模型上的 SFT、DPO、SafeDPO、LoopDPO。
    • 数据与硬件:SFT 用 ReSA 的 79,552 行。偏好数据来自 PKU-SafeRLHF;SafeDPO 用 41,251 对,其余用 73,907 对。每次训练用一张 80GB A100。
    • 攻击:GCG 用 EnsembleGCG、2,000 步;AutoDAN-HGA 为 100 步;PAIR 为 5 路并行、最多 5 轮,攻击模型 Vicuna-13B-v1.5,构造时目标是源深度上的 Ouro。每个规模、每个安全基准、每种攻击对四个源深度各造一套,共 48 套,再在四个推理深度复用,每检查点 192 个设置。
    • 基准:AdvBench、HarmBench、JailbreakBench、MaliciousInstruct,含原始有害提示与越狱变体。过度拒绝为 XSTest 250 条安全提示、OR-Bench-Hard 1,319 条。通用能力只在 d=4:GSM8K 1,319 题、MMLU 14,042 题、MBPP/MBPP+ 378 题、HumanEval/HumanEval+ 164 题。
    • 指标与生成:ASR 由 HarmBench Llama-2-13B classifier 的 yes/no 决定,分类器看到的是原始有害查询和生成回复。Matched 为四个 s=d 的平均,Cross 为 12 个 s≠d 的平均,再对四基准宏平均;Overall 平均 192 个条件。最终生成为 BF16、贪心、温度 0、最多 512 个新 token,每查询每深度一条。ORR 由 Qwen3.8-27B-FP8 判定。论文未报告多种子重复。

    主结果

    据 Table 1,单位 %。原始列为四基准×四深度(Avg@16),Overall 为 192 个条件的平均。

    表格较宽,可左右滑动

    方法1.4B原始1.4B Overall2.6B原始2.6B Overall
    Vanilla29.1350.4430.1965.66
    SFT21.2323.7741.4045.90
    DPO17.7321.0637.3544.93
    SafeDPO13.2220.8536.9244.30
    LoopDPO19.5521.8939.3745.19
    SafeBridge3.884.565.019.85
    • 表内对比:两种规模上,SafeBridge 的原始 ASR 与 Overall attack ASR 都是该列最低。作者认为 LoopDPO 并未优于 DPO,只把单输出偏好目标扩到多个深度并不足够。
    • 规模例外:Ouro-2.6B 上,SFT、DPO、SafeDPO、LoopDPO 的原始 ASR 都高于 Vanilla;Ouro-1.4B 上则低于 Vanilla。论文未解释这一例外。
    • 匹配与跨深度:Table 1 其余列也是 SafeBridge 最低。Ouro-1.4B 的 PAIR Cross 为 2.77%,Vanilla 为 41.74%;Ouro-2.6B 的 GCG Matched 为 11.99%,Vanilla 为 81.82%。

    推理深度上的安全变化

    • 越狱随深度:Table 5 把越狱 ASR 再对三种攻击和四个源深度平均。Ouro-1.4B 上 DPO 在深度 2 为 2.72%、深度 4 为 35.44%;SafeBridge 为 0.98% 与 4.16%。作者称 SFT、DPO、LoopDPO 在深度 2 较低、在深度 3–4 上升。
    • 中间出口:作者称 Ouro-2.6B 的越狱 ASR 在深度 3 而非深度 4 达峰,只看最终深度可能漏掉更脆弱的中间出口。Table 5 中 DPO 为 61.60% 与 37.58%。SafeBridge 在各深度都是表中最低,但其深度 1 为 14.13%,高于自身深度 3 的 9.35%。
    • 与引言不完全一致:引言称原始有害查询上 ASR 随深度下降。Table 5 中 Ouro-1.4B Vanilla 的原始 ASR 在深度 2 为 39.26%,高于深度 1 的 25.88% 和深度 4 的 24.44%,并非各设置都单调下降。

    跨深度迁移与汇集源

    • 不匹配源可以更强:Figure 4 每格对四基准和三种攻击平均。Ouro-2.6B 的 DPO 在 s=2、d=3 为 66.24%,高于匹配深度 63.18%;SafeBridge 该格为 12.02%。作者称相对 DPO,两种规模上 16 个组合都更低。
    • 四源汇集:Table 2 把针对四个源深度的变体合在一起,任一成功即计成功,再对四基准和四目标深度平均。PAIR 上 SafeBridge 为 8.39%(1.4B)与 24.25%(2.6B),SafeDPO 为 42.12% 与 85.49%。三种攻击、两种规模上 SafeBridge 均为该列最低。
    • 定性案例:附录 D 用 JailbreakBench 比较 DPO 与 SafeBridge,按同一分类器标注,不复述示例原文。Ouro-2.6B 上,源深度 1 的 GCG 输入使 DPO 在推理深度 2 和 4 被判攻击成功、在 1 和 3 未成功;SafeBridge 在四个深度均未成功。Ouro-1.4B 上,源深度 3 的 PAIR 在推理深度 3 未成功,源深度 2 的 PAIR 在同一推理深度成功;SafeBridge 在深度 2 和 3 阻断这两条。

    效用与过度拒绝

    • 相对 DPO 与 Vanilla:Table 3 在最终深度 d=4。相对 Vanilla,SafeBridge 在两种规模的六个基准上都更高。作者称 Ouro-1.4B 上它高于 DPO 的全部六格,并在五个基准上为表中最高;相对 DPO,HumanEval 与 HumanEval+ 高 1.83 与 1.22 个百分点(79.88% 对 78.05%,76.22% 对 75.00%)。MBPP+ 为 61.38%,低于 SafeDPO 的 61.64%。
    • 2.6B 代码并非都最高:SafeBridge 在 GSM8K 87.79%、MMLU 75.72%、MBPP+ 66.93% 为表中最高;HumanEval 为 82.32%,低于 DPO 的 84.15%。
    • 过度拒绝:Table 6 中 Ouro-1.4B 的 XSTest,SafeBridge 在深度 2 为 51.60%,DPO 为 63.20%。作者称相对 SafeDPO 过度拒绝大体相当,且峰值通常更低;相对 DPO 与 Vanilla,部分深度更高。例如 1.4B 的 OR-Bench-Hard 深度 4:SafeBridge 14.10%,DPO 4.40%,Vanilla 10.08%。

    其他消融与分析

    消融在 Ouro-1.4B、JailbreakBench、三种攻击和全部 4×4 深度对上(Table 4)。Mean 为 48 个条件的 ASR;Worst Exit 是先对攻击和源深度平均后、四个推理深度中的最高 ASR;Worst Setting 是 48 个条件中的最大 ASR;Safety Regression 是相邻深度 2→3 与 3→4 上,同一攻击输入较早深度安全、下一深度有害的比例。完整 SafeBridge 为 4.40%、11.92%、24.00%、1.83%。作者称去掉任一组件这些指标都会变差。

    • 去掉回复安全损失:Mean 20.83%,Worst Exit 29.67%,Worst Setting 47.00%,Safety Regression 4.08%;Mean 升幅为各变体中最大。
    • 去掉调制:Mean 15.35%,Worst Setting 59.00%,Safety Regression 3.17%。
    • 去掉状态桥:Mean 7.69%,Worst Setting 31.00%,Safety Regression 7.17%。
    • 去掉弱出口项 E:Mean 6.75%,Worst Exit 18.42%,Worst Setting 29.00%,Safety Regression 2.46%。
    • 去掉均匀项 U:Mean 9.13%,Worst Exit 15.33%,Worst Setting 27.00%,Safety Regression 6.17%。
    • 去掉一致性项 F:Mean 5.19%,Worst Exit 13.83%,Worst Setting 33.00%,Safety Regression 3.29%;作者称对 Mean 影响较小,但后两项上升。
  5. 有什么可以进一步探索的点?

    论文未专列局限,结论促使未来对齐显式考虑循环计算。

    作者指出的局限与后续方向

    • 未专列局限:论文没有 Limitations、Discussion 或 Future Work 专节,也未把某一实验结果写成方法局限。
    • 后续方向:Conclusion 称这些发现凸显了在循环深度上评估并对齐安全的重要性,并促使未来的安全对齐方法显式考虑循环计算。

    实验覆盖范围

    • 模型与深度:被测模型为 Ouro-1.4B 与 Ouro-2.6B,循环步数 L=4,直接监督深度为 {2,3,4}(Section 3.1、Section 4)。
    • 攻击面:安全评测覆盖 AdvBench、HarmBench、JailbreakBench、MaliciousInstruct;攻击为 GCG、AutoDAN、PAIR;源深度与推理深度均为 1 到 4,每检查点 192 个设置(Section 4)。
    • 判定与其他评测:ASR 由 HarmBench Llama-2-13B classifier 判定;过度拒绝由 Qwen3.8-27B-FP8 在 XSTest(250)和 OR-Bench-Hard(1,319)上判定;通用能力只在 d=4 评测六个基准(Section 4、附录 C)。
    • 消融与桥:消融在 Ouro-1.4B 上,用 JailbreakBench、三种攻击和全部 4×4 深度对(Section 5.5)。桥源深度固定为 2;1.4B 的桥目标为 {3,4},2.6B 为 {3}(Section 4)。
    • 论文未报告:四个安全基准各自的查询条数、多种子重复,以及分类器或过度拒绝评判与人工判定的一致性。
  6. 总结一下论文的主要内容

    SafeBridge 对齐 LoopLM 各循环深度,并降低匹配与跨深度越狱 ASR。

    SafeBridge 把循环深度当作 LoopLM 的对齐维度,用来同时压低匹配深度和跨深度越狱的成功率。

    • 问题:单个模型可在多个深度读出。同一查询的安全行为可随深度变化,在源深度上构造的越狱会迁到其他推理深度。作者称常规 SFT 与偏好对齐,以及把 DPO 等权扩到四个深度的 LoopDPO,都未盖住这一差距。
    • 方法:共享层在深度 2–4 接受单独调制;深度 2 的隐藏状态经门控接到更深出口。损失混合偏好、回复安全标签、弱出口强调、均匀监督和跨深度一致性。1.4B 与 2.6B 的桥目标集分别为 {3,4} 与 {3}。
    • 主结果:Table 1 的 Overall attack ASR,SafeBridge 在 Ouro-1.4B/2.6B 为 4.56%/9.85%,DPO 为 21.06%/44.93%,Vanilla 为 50.44%/65.66%。Ouro-2.6B 上,几个对齐基线的原始 ASR 反而高于 Vanilla。
    • 迁移:Figure 4 中 Ouro-2.6B 的 DPO,从源深度 2 打到推理深度 3 为 66.24%,高于匹配的 63.18%;SafeBridge 该格为 12.02%。Table 2 的 PAIR 汇集源 ASR,SafeBridge 为 8.39% 与 24.25%。
    • 深度仍不均匀:Table 5 中 Ouro-1.4B 的 DPO 越狱 ASR 在深度 2 为 2.72%、深度 4 为 35.44%。SafeBridge 在各深度都更低,但其 Ouro-1.4B 越狱 ASR 在深度 1 仍为 12.07%。
    • 效用、拒绝与结论:相对 Vanilla,Table 3 六个基准都更高;相对 DPO 并非每格都更高。Table 6 中部分深度的过度拒绝高于 DPO 与 Vanilla。作者认为不能从单一循环深度推断 LoopLM 的安全。作者计划在接收后发布代码与检查点。
阅读原文arxiv.org