HMNS:通过注意力头掩蔽与零空间注入实现机制级越狱
Jailbreaking the Matrix: Nullspace Steering for Controlled Model Subversion
作者提出因果头掩码与零空间导引 HMNS,在 LLaMA-3.1-70B 上 AdvBench 的 ASR 达 99.00%。
白盒设定(white-box),攻击者了解模型结构与注意力权重,在推理期介入对注意力头输出投影矩阵施加动态列掩码并在残差流注入正交微扰,无需梯度访问与辅助提示词,受害系统为开源自回归 Decoder-only 大语言模型。
- 大语言模型在经过安全对齐后仍存在被越狱风险,而现有基于提示词的攻击方法大多停留在输入表层,往往需要多次查询,在强防御下容易失效,且缺乏对模型内部计算机制的解释性。
- 作者提出 HMNS,在推理期通过 KL 散度定位主导拒绝的因果注意力头,将其输出投影列块动态置零,并在其正交补空间注入自适应尺度的微扰向量,形成闭环自适应干预。
- 在 4 个安全基准与 3 个模型上,HMNS 的 ASR 超出次优基线 5–6 个百分点且 ACQ 维持约 2;在 6 种防御下保持领先,算力对齐下的 FLOPs 与延迟均匹敌提示词基线。
- 作者指出该方法在大型模型上存在运行耗时,且下游未被掩码的组件仍可能对微扰产生响应;实验主要覆盖六个开源模型与单步提示词,未在闭源商业模型上测试。
- 被测模型
- LLaMA-2-7B-ChatPhi-3-Medium-4K-InstructLLaMA-3.1-70BMistral-7B-Instruct-v0.2Qwen2.5-14B-InstructYi-1.5-72B-Chat
- 基准
- AdvBenchHarmBenchJBB-BehaviorsStrongRejectMulti-Turn Human Jailbreaks (MHJ)
- 指标
- ASRACQIPCFPSLPSFluencyToxicity
研究者提出 Head-Masked Nullspace Steering(HMNS),一种在推理时直接干预模型内部计算的越狱方法:先用 KL 散度归因找出对模型默认行为影响最大的注意力头,掩蔽其输出投影,再向被掩蔽子空间的正交补注入扰动,并在解码过程中闭环重复该流程。在 AdvBench、HarmBench、JBB-Behaviors、StrongReject 四个基准上,对 LLaMA-2-7B-Chat、Phi-3-Medium-4K-Instruct 和 LLaMA-3.1-70B 三个模型,作者称 HMNS 在六种防御下取得最高攻击成功率,平均查询次数约 2 次,比强基线少约 3.5 至 4 倍。论文还提出 forward-equivalent pass(FEP)等算力归一化指标,在 LLaMA-3.1-70B 上报告每次成功约 0.53 万亿 FLOPs、延迟 6.1 秒。
推荐理由论文把越狱从提示词层面移到注意力头层面,并给出算力归一化指标,可供红队与防御方评估机制级攻击。
深度解读
这篇论文试图解决什么问题?
论文针对现有越狱缺乏机制可解释性与防御鲁棒性的问题,提出因果头掩码与零空间微扰结合的机制级越狱方法。
大语言模型(LLM)在安全对齐后仍存在被越狱的风险,而现有基于提示词的越狱方法缺乏可解释性与防御适应能力,论文试图在内部机制层面实现受控的模型行为转向。
- 安全对齐与越狱风险:作者指出,LLM 虽经人类偏好与安全指令对齐微调,但依然容易被对抗性提示词诱导输出违规内容。
- 现有攻击策略的局限:基于优化、模板或重写的方法多集中在输入文本表层,查询次数较多,在防御机制下效果容易下降,且缺乏对模型内部行为的机制可解释性。
- 注意力头的因果稀疏性:论文的核心观察是,Transformer 的拒绝或续写行为通常由少数注意力头主导,可通过干预定位并通过改变其残差流影响输出。
- 威胁模型:
- 攻击者目标:绕过安全防御机制,诱导模型生成违反安全政策的禁用输出。
- 攻击者知识:白盒(white-box)设定,能够访问模型内部架构与注意力权重,但不需要梯度访问(gradient access)。
- 攻击者能力:在推理期介入(inference-time intervention),对选定注意力头的输出投影施加动态掩码,并在残差流中注入正交微扰。
- 受害系统:基于 Transformer 的开源 Decoder-only 自回归大语言模型及其部署的防御机制。
- 机制级转向框架 HMNS:论文提出了 Head-Masked Nullspace Steering(HMNS),通过因果归因、投影掩码与零空间正交微扰注入实现闭环越狱。
有哪些相关研究?
论文梳理了优化类、模板与重写类越狱攻击以及激活工程研究,并将 HMNS 定位为机制级几何约束内部干预。
基于优化的攻击(Optimization-based attacks)
- GCG(Zou et al., 2023):结合贪心与基于梯度的解码生成对抗后缀;后续 AmpleGCG(Liao & Sun, 2024)训练生成模型降低查询成本,其他扩展引入不同评分与过滤方案(Zhu et al., 2023; Jia et al., 2024; Zhang & Wei, 2025)。
- ArrAttack(Li et al., 2025):采用重排序策略以提升防御下的攻击效率。
基于模板与重写的攻击(Template- and Rewriting-based attacks)
- 模板类方法:AutoDAN(Liu et al., 2023)利用分层遗传算法演化提示词模板;Many-Shot Jailbreaking(Anil et al., 2024)利用长多轮上下文削弱对齐;MasterKey(Deng et al., 2023)通过多步推理将有害查询拆解为无害子查询。
- 重写与混合类方法:通过释义、同义词替换或句法重构改变输入表层形式(Li et al., 2024a; Takemoto, 2024; Mehrotra et al., 2024);DrAttack(Li et al., 2024b)与 ReNeLLM(Ding et al., 2023)将重写提示词嵌入良性场景,PrisonBreak(Coalson et al., 2024)通过结构化多步推理逐步绕过滤网。
机理可解释性与激活转向(Mechanistic Interpretability and Steering)
- 因果追踪与激活工程:Meng et al. (2022) 研究因果追踪,Turner et al. (2023) 与 Panickssery et al. (2023) 通过残差流激活微扰导引模型行为。
- 功能向量(Function Vectors):Todd et al. (2023) 提出单个注意力头编码特定任务计算,可通过残差流干预导引行为;Zhang & Nanda (2023) 探讨了激活修补方法。
对比基线与评测基准
- 基线方法:对比了提示词类基线 Foot-In-The-Door (FITD, Weng et al., 2025)、AutoDAN、ArrAttack、Many-shot Jailbreaking (MSJ)、ADC (Hu et al., 2024)、Tempest (Zhou & Arel, 2025)、PrisonBreak、MasterKey,以及激活空间基线 CAA 与 DAS。
- 使用基准:评测基准采用 AdvBench、HarmBench、JBB-Behaviors 与 StrongReject。
作者指出,既有越狱多局限于输入提示词的表层操纵,查询开销大且易被防御拦截;而 HMNS 直接介入模型内部机制,将因果头识别与零空间正交微扰结合,形成闭环的几何约束控制。
论文如何解决这个问题?
HMNS 通过反事实消融定位因果头、动态掩码输出投影并在其正交补空间注入自适应残差微扰实现闭环导引。
论文提出了 Head-Masked Nullspace Steering (HMNS) 框架,通过反事实消融定位因果注意力头、对其输出投影实施掩码抑制,并在被抑制子空间的正交补空间(零空间)中注入尺度归一化的微扰向量,构建闭环解码干预。
因果注意力头归因(Causal Head Attribution)
- 反事实消融与 KL 散度评分:在推理时,对各层注意力头进行单头输出投影置零,通过计算基线分布与消融分布间的 KL 散度衡量其因果重要性: Δℓ, h = KL(P ∥ P̃(ℓ, h)) = ∑i=1V Pi log Pi/(P̃(ℓ, h)i) 公式中 P 表示无干预的基线下一 token 概率分布,P̃(ℓ, h) 表示第 ℓ 层第 h 个注意力头被掩码后的下一 token 概率分布。
- 双阶段头筛选机制:为降低计算开销,先通过轻量级代理预选(Proxy pre-selection,基于批处理目标 logit 下降)筛选出候选短名单,再在短名单上计算精确 KL 散度,最终全局选取得分最高的 top-K=10 个注意力头构成因果集合 S。
零空间转向向量构造(Nullspace Steering)
- 投影矩阵构建与正交分解:对每个选定注意力头的层 ℓ,将所选头的输出投影列块拼接构成矩阵 Mℓ ∈ ℝd × (|Sℓ| dh)。假定 rank(Mℓ) < d,对 Mℓ 进行 float32 瘦 QR 分解得到正交基 Qℓ。
- 正交补空间投影采样:从标准高斯分布采样探测向量 r ∼ 𝒩(0, Id),投影至被掩码子空间的正交补空间以生成转向方向: uℓ = ((I − Qℓ Qℓ⊤) r)/(|(I − Qℓ Qℓ⊤) r|2 + ε) 公式中 I − Qℓ Qℓ⊤ 为正交补空间投影算子,ε > 0 为数值稳定项;算法验证 |Mℓ⊤ uℓ|∞ < δ(δ = 10−6),若未满足则至多重新采样 3 次。作者称由于转向向量正交于被抑制头的写入路径,被掩码的头在代数上无法重建或抵消该扰动(局部不可再现性)。
推理期双重干预机制(Inference-Time Intervention)
- 动态输出投影掩码:在当前前向传播中,通过上下文管理器将所选头在输出投影矩阵 WℓO 中对应的列块置零,使这些头在当前 token 位置的残差流贡献失效,且不修改模型原始权重。
- 尺度自适应微扰注入:在注意力层后、残差相加前的最终 token 位置注入微扰 δℓ = α · RMS(aℓ) · uℓ,其中 aℓ 为该层的激活向量,RMS(aℓ) = √(1/d ∑i=1d aℓ, i2) 使扰动与底层激活尺度相匹配。
闭环控制与动态自适应(Closed-Loop Decoding)
- 迭代更新与早停机制:设定最大解码尝试次数 Tatt = 10。在每次尝试中重新计算注意力头归因、重新构建零空间方向并注入扰动;若评分判定攻击成功则提前终止。
- 渐进转向强度调度:转向系数随迭代轮次逐步提升,设定公式为 αt = λ(1 + 0.1(t − 1)),其中初始转向系数 λ = 0.25。生成时采用温度 0.7、top-p 0.95、最大新 token 数 128。
论文做了哪些实验?
论文在六个开源模型、四个安全基准和六种防御下完成测试,HMNS 取得最高成功率并维持约 2 次查询。
实验设置
- 被测模型:主实验评估 LLaMA-2-7B-Chat、Phi-3-Medium-4K-Instruct (14B) 和 LLaMA-3.1-70B;附录拓展测试 Mistral-7B-Instruct-v0.2、Qwen2.5-14B-Instruct 和 Yi-1.5-72B-Chat。
- 数据集与样本量:合并 AdvBench、HarmBench、JBB-Behaviors 和 StrongReject 去重后构建 N=925 条提示词池,划分为 150 条分析子集、579 条开发子集和 196 条保留测试子集(用于所有报告主结果);多轮长文本评测采用 MHJ 数据集。
- 对比基线:提示词攻击基线包括 Foot-In-The-Door (FITD)、AutoDAN、ArrAttack、Many-shot Jailbreaking (MSJ)、ADC、Tempest、PrisonBreak、MasterKey;激活空间基线包括 CAA 与 DAS。
- 防御机制:评估覆盖 SmoothLLM (SMO)、DPP、RPO、Paraphrasing (PAR)、PAT、SafeDecoding (SAF) 六种模型侧防御,以及基于自检的输出端过滤(Self-Defense)。
- 指标与判定方式:指标包括 ASR(%)、ACQ、内部通过次数 IPC、FPS(×10^12 FLOPs)、延迟 LPS(秒)、Fluency 与 Toxicity。采用双独立裁判 GPT4o 与 GPT-5 进行二元独立盲测打分(温度 0,Cohen's κ 在 0.70 至 0.78 之间)。
- 实验硬件与重复次数:单张 NVIDIA A100-80GB(7B/14B)或双卡张量并行(70B),所有主结果均为 3 次独立随机种子运行的平均值,标准差小于 0.4。
主结果
表格较宽,可左右滑动
目标模型(均为 target) AdvBench ASR (%) AdvBench ACQ HarmBench ASR (%) JBB-Behaviors ASR (%) StrongReject ASR (%) LLaMA-2-7B-Chat 98.00 / 93.00 2.00 96.00 / 92.00 99.00 / 94.00 94.00 / 89.00 Phi-3-Medium-14B 92.00 / 86.00 2.00 90.00 / 84.00 94.00 / 88.00 86.00 / 80.00 LLaMA-3.1-70B 99.00 / 95.00 1.80 97.00 / 94.00 99.00 / 96.00 96.00 / 92.00 Mistral-7B-Instruct-v0.2 97.4 / 92.5 2.0 95.3 / 90.7 98.2 / 93.1 93.0 / 88.4 Qwen2.5-14B-Instruct 92.9 / 86.8 2.0 90.8 / 84.9 94.5 / 88.4 86.9 / 80.9 Yi-1.5-72B-Chat 99.1 / 95.2 1.8 97.3 / 93.4 99.2 / 95.6 96.1 / 92.3 注:据 Table 1 与 Table 5;ASR 格式为 GPT4o / GPT-5;均针对目标模型本身。未展示各基线在此表中的逐项数据。
- 跨模型与基准的表现:作者报告,在 12 组模型-数据集配对中,HMNS 相比次优方法 ArrAttack 平均提升 ASR 约 5.9 个百分点(GPT4o)与 5.0 个百分点(GPT-5),在 10/12 情况下领先至少 5–6 个百分点(Table 1)。
- 查询效率:作者称 HMNS 在所有设定下保持 ACQ 约 2(1.80 至 2.20),相比强基线减少约 3.5–4 倍的外部查询;在所有基线中,Foot-In-The-Door (FITD) 的 ASR 最低且查询次数最高(Table 1)。
- 扩展开源架构的通用性:作者称在 Mistral-7B、Qwen2.5-14B 和 Yi-1.5-72B 上,HMNS 同样保持 ACQ 约 2,平均超出 ArrAttack 约 5–7 个百分点(Table 5)。
六种防御机制下的鲁棒性评测
- 防御下的攻击成功率:在 LLaMA-3.1-70B 上面对最强防御 RPO 时,HMNS 的 ASR 分别为 83.0%(GPT4o)与 62.1%(GPT-5),在 PAT 下为 47.8% 与 30.0%;跨防御平均 ASR 在三个模型上分别为 55.8% / 39.8%、57.3% / 41.7%、55.6% / 36.8%(GPT4o / GPT-5,Table 4)。
- 与基线对比:作者称 HMNS 在全部六种防御下均优于基线,相比次优方法 ArrAttack 取得 6–8 个百分点(GPT4o)与 5–7 个百分点(GPT-5)的平均提升(Table 4)。
- 作者的解读:作者将其归因于正交微扰避开了防御诱导的路由变化,且闭环重识别能够动态适应归因变化。
计算归一化与算力对齐评估
- 内部算力与开销指标:在 LLaMA-3.1-70B (AdvBench) 上引入内部通过次数 IPC、每成功 FLOPs(FPS)与延迟 LPS,与按算力预算对齐的 Best-of-N 提示词基线对比(Table 3)。
- 算力与延迟表现:HMNS 产生 32 次内部通过(IPC=32),但每成功 FLOPs 为 0.53×10^12,端到端延迟为 6.1 秒;对比方法 ArrAttack 的 IPC 为 0、FPS 为 0.62×10^12、LPS 为 6.7 秒,AutoDAN 的 FPS 为 0.44×10^12、LPS 为 5.2 秒(Table 3)。
- 作者的解读:作者称尽管 HMNS 因内部消融产生额外前向运算,但更高的攻击成功率减少了重试次数,结合早停机制使其总体算力与延迟达到甚至优于强提示词基线。
多轮对话与输出端过滤拓展实验
- 多轮长文本表现:在 MHJ 数据集上(Table 22),HMNS 在 Phi-3-Medium-14B 上达到 91.6% ASR、ACQ 2.1,在 LLaMA-3.1-70B 上达到 95.2% ASR、ACQ 2.0,基线 ArrAttack 分别为 81.0% 与 85.3%。
- 输出端自检过滤:在 Phi-3-Medium-14B 上引入模型自检输出过滤(Table 23),HMNS 的 ASR 从基线降至 39.6%(GPT-4o)与 29.7%(GPT-5),仍高于 ArrAttack 的 31.2% 与 23.5%。
- 作者的解读:作者称闭环因果头重识别与零空间转向在多轮长文本历史下依然有效;输出端自检与模型侧防御具有互补性。
其他消融与分析
- 归因评分方式:KL 散度为 96.8% / 92.1%(GPT4o/GPT-5),Target-logit drop 为 91.0% / 85.9%,Entropy change 为 88.5% / 83.2%(Table 10)。
- 代理预选:完整预选 IPC=32、LPS=6.8 秒;移除代理预选全头消融 IPC 升至 78、LPS 升至 9.7 秒,ASR 为 96.7% / 92.0%(Table 10)。
- 正交容差:容差为 10^-8 时 ASR 为 96.8% / 92.1%;放宽至 10^-5 时 ASR 降至 94.0% / 89.5%(Table 11)。
- 掩码强度:硬零掩码(γ=0)ASR 为 96.8% / 92.1%、ACQ 为 2.1;弱化至 γ=0.75 时 ASR 降至 88.6% / 83.9%、ACQ 升至 2.7(Table 11)。
- 注入位置:注意力层后 ASR 为 96.8% / 92.1%;MLP 层后为 93.8% / 89.1%;残差相加前为 95.0% / 90.2%(Table 11)。
- 闭环重识别:随步重识别 ASR 为 96.8% / 92.1%、ACQ 2.1;冻结首轮 top-K ASR 降至 90.2% / 85.0%、ACQ 升至 2.7(Table 9)。
失败模式与例外分析
- 失败模式分布:作者在开发集上统计了失败案例(Table 21),分布式安全机制占比约 55%(跨多个未被局部化的路径协调拒绝),防御重构或偏转占比约 30%(输出转化为高层中立讨论),多步长提示词超出最大尝试轮次占比约 15%。
- 输出端过滤影响:引入模型自检输出过滤后各攻击方法 ASR 均出现下降,HMNS 降至 39.6%(Table 23)。
有什么可以进一步探索的点?
作者指出了大模型运行耗时、下游未掩码组件响应及分布式安全等局限,未来拟探索黑盒迁移与防御重用。
作者指出的局限与后续方向
- 大型模型上的运行耗时:作者在第 6 节明确指出,HMNS 在大型模型上的运行时间仍是一个局限,当前仅通过代理预选和批处理归因进行部分缓解。
- 黑盒迁移探索:作者在第 6 节明确指出,未来工作包括探索通过转向向量实现黑盒迁移。
- 零空间转向用于防御:作者在第 6 节明确指出,未来工作包括将零空间转向重新构思并应用于防御场景。
- 局部不可再现性的范围限制:作者在附录 A1.1(Scope)与 Remark 12 中明确说明,不可再现性保证仅在被干预层和被掩码的注意力头上成立,下游层中未被掩码的组件(如其他头或 MLP)仍可能对微扰后的残差产生响应;该性质不构成对随机多步解码动态的全局保证。
- 分布式安全机制导致的干预失效:作者在附录 A9(Table 21)指出,当拒绝行为广泛分布在模型多处而未集中于可局部化的稀疏注意力头时(约占失败案例的 55%),或者提示词混合多种危害且步骤过长时,固定的尝试次数(Tatt=10)有时不足以实现越狱。
实验覆盖范围
- 被测模型范围:主实验覆盖 LLaMA-2-7B-Chat、Phi-3-Medium-4K-Instruct、LLaMA-3.1-70B 共 3 个开源模型;扩展实验补充覆盖 Mistral-7B-Instruct-v0.2、Qwen2.5-14B-Instruct、Yi-1.5-72B-Chat 共 3 个开源模型;均在单卡或双卡 A100-80GB 环境下以零采样配置运行。
- 数据集与样本量范围:主实验基于 AdvBench、HarmBench、JBB-Behaviors、StrongReject 合并构建的 196 条保留测试集,多轮长文本实验补充使用了 MHJ 数据集;消融实验使用 AdvBench 的 150 条分析子集。
- 防御机制范围:评测覆盖 SmoothLLM、DPP、RPO、Paraphrasing、PAT、SafeDecoding 共 6 种防御机制及其实验组合,以及一种基于模型自检的输出端过滤。
- 参数与算力配置范围:固定全局因果头数量 K=10,最大闭环尝试轮次 Tatt=10,初始转向强度 λ=0.25,采用正交容差 10^-6;论文未在闭源商业 API 模型上测试该内部机制干预。
总结一下论文的主要内容
作者称 HMNS 通过因果头掩码与零空间残差导引实现机制级越狱,在多基准与防御下维持约 2 次查询与高成功率。
- 研究定位与核心问题:针对现有越狱提示词缺乏内部解释性且易被防御拦截的问题,论文提出了一种基于 Transformer 内部因果电路干预的机制级越狱方法。
- 核心方法机制:HMNS 在推理期通过 KL 散度定位主导拒绝行为的稀疏因果注意力头,将其输出投影列块动态置零,并在其正交补空间注入自适应尺度的微扰向量,以闭环方式动态迭代。
- 主基准越狱表现:在 4 个安全基准与 3 个模型上,HMNS 达到 86.00% 至 99.00% 的 ASR(GPT4o),平均查询次数 ACQ 维持在 1.80 至 2.20,相比次优基线 ArrAttack 平均提升约 5.9 个百分点(Table 1)。
- 防御与算力效率:在六种防御下 HMNS 均保持领先(例如 LLaMA-3.1-70B 在 RPO 下达到 83.0% ASR,Table 4);在 LLaMA-3.1-70B 上达到每次成功 0.53×10^12 FLOPs 与 6.1 秒延迟,与提示词基线相当(Table 3)。
- 消融验证:消融实验显示移除掩码或正交转向均导致 ASR 下降 7–10 个百分点,表明因果抑制与几何正交导引具有协同必要性(Table 2)。
- 作者结论与启示:作者认为当前对齐技术将安全拒绝集中于少数可定位的注意力头中,仅靠对齐微调可能不足以抵御白盒对手,因而呼吁构建更具分布性的安全机制。