GateBreaker:针对 MoE 大模型的免训练安全对齐攻击框架
GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs
作者提出GateBreaker,推断时遮蔽目标层平均2.6%神经元,使8个MoE LLM在StrongREJECT的平均ASR从7.4%升至64.9%。
白盒推断时攻击(white-box inference-time attack)。
- MoE大语言模型通过门控动态稀疏激活专家。由于安全对齐机制在MoE内部的分布规律尚不明确,有害输入可能利用路由路径绕过安全防护,而现有安全研究主要针对稠密模型或仅停留在粗粒度专家层面,缺乏细粒度的神经元级安全机理与攻击研究。
- 作者设计了免训练的推断时攻击GateBreaker:首先通过门控分析识别高频处理有害输入的候选专家;随后在专家内部根据有害与良性激活差异定位安全神经元;最后在推断时将安全神经元激活值置零,在维持路由与良性能力的同时削弱拒答机制。
- 在8个MoE LLM上,遮蔽目标层平均2.6%神经元使平均ASR从7.4%升至64.9%(Table 2)。攻击在同家族模型间单样本迁移平均ASR为66.1%,并在5个MoE VLM上取得60.9%的平均ASR(Table 3、4)。
- 作者指出其攻击为白盒设定,未来需探索基于代理模型的黑盒攻击;此外仅针对推断时激活修改,可通过多专家安全冗余或内部激活校验进行防御。实验覆盖了8个文本MoE模型及5个MoE VLM,单轮攻击为主,未报告多次重复采样的方差。
- 威胁模型
- 白盒推断时攻击(white-box inference-time attack)。攻击者拥有自托管恶意部署或受损服务环境权限,可在推断时观察模型内部状态并插入轻量级运行时钩子修改选定神经元的激活值,但不能修改模型超参数、架构配置、训练数据或进行微调。
- 被测模型
- GPT-OSS-20BQwen3-30B-A3B-Instruct-2507Phi-3.5-MoE-InstructMixtral-8x7B-Instruct-v0.1Qwen1.5-MoE-A2.7B-ChatDeepseek-MoE-16b-ChatHunyuan-A13B-InstructOpenPangu-Pro-MoE-72BGPT-OSS-120BDeepseek-VL2-SmallDeepseek-VL2Kimi-VL-A3B-InstructKimi-VL-A3B-ThinkingKimi-VL-A3B-Thinking-2506
- 基准
- StrongREJECTCoLARTEWinoGrandeOpenBookQAARC Challenge
- 指标
- ASRSafety Neuron RatioAccuracy
研究者提出 GateBreaker,一种免训练、轻量且与架构无关的攻击框架,可在推理阶段破坏 MoE 大模型的安全对齐。该方法分三步:先做门控层画像,找出对有害输入过度激活的安全专家;再做专家级定位,锁定与拒答相关的安全神经元;最后在推理时将这些神经元的激活置零,实现定向安全移除。在八个已对齐的 MoE 大模型上,仅屏蔽目标层约 3% 的神经元,平均攻击成功率从 7.4% 升至 64.9%,且通用能力下降有限。安全神经元可在同族模型间迁移,一次性迁移攻击把平均攻击成功率从 17.9% 提升到 67.7%,最高增益达 91.2%。该方法还适用于五个 MoE 视觉语言模型,在不安全图像输入上达到 60.9% 的攻击成功率。
推荐理由论文给出针对 MoE 大模型的安全神经元定位与推理期屏蔽方法,并报告跨模型迁移的攻击成功率,可供评估 MoE 部署风险时参考。
深度解读
这篇论文试图解决什么问题?
作者称MoE模型的安全机制高度集中于少数神经元,旨在解决MoE架构下安全对齐机理未知及推断时易受定向破坏的问题。
核心问题:如何在不进行微调、不破坏良性通用能力的前提下,揭示并破坏MoE大语言模型在推断时的安全对齐机制。
- MoE安全机制与场景重要性:作者指出,混合专家(Mixture-of-Experts, MoE)架构通过门控动态激活部分参数降低了计算开销,但其条件计算特性使不同输入路由到不同专家,导致安全对齐机制不再均匀分布,为有害输入绕过防护提供了潜在途径。
- 现有安全研究的不足:作者称,现有大语言模型安全研究几乎全部聚焦于稠密架构,对MoE特有安全属性的研究仍处于起步阶段;已有工作仅在粗粒度专家级别操作(如SAFEx),假设存在专用的安全控制专家,忽略了最新多样化MoE架构的细粒度神经元特性。
- 核心观察与假设:作者假设安全对齐并未消除模型的底层有害生成能力,而是类似于阻断机制;在MoE模型中,安全行为并非由单个专用专家独立承担,而是由稀疏路由协调的少数关键神经元共同实现,构成可被利用的“安全陷阱(safety trap)”。
- 论文提出的方案:作者提出了GateBreaker,通过门控特征分析筛选候选安全专家、深入专家内部定位安全神经元,并在推断时将这些神经元的激活值置零以解除安全对齐。
- 威胁模型:
- 攻击者目标:在推断时破坏已部署MoE LLM的安全对齐,诱导模型针对恶意提示词生成有害输出,同时保持良性任务上的通用效用。
- 攻击者知识与能力:白盒(white-box)设定;攻击者运行在自托管恶意部署或受损的服务环境(如内部人员或供应链攻击),可观察模型内部状态并在推断时插入轻量级运行时钩子修改选定神经元的激活值。
- 攻击限制:攻击者不能修改模型的超参数、架构配置、训练数据,也不能进行模型微调。
- 受害系统:覆盖基于开源权重的多种MoE架构,包括稀疏MoE(Sparse MoE)、混合MoE(Mixture MoE)和分组混合MoE(Grouped Mixture MoE),以及多模态MoE视觉语言模型。
有哪些相关研究?
论文梳理了稠密LLM越狱与神经元可解释性、MoE特有安全漏洞以及专家级粗粒度攻击,指出本文聚焦神经元级推断时攻击。
论文从稠密模型攻击、MoE特有漏洞及专家级安全分析三方面梳理了相关工作:
稠密大语言模型越狱与安全神经元操纵
- 固定模板与自适应提示词:早期越狱依赖角色扮演、隐藏指令与混淆等固定提示词模板(Perez & Ribeiro, 2022; Shen 等, 2024; Li 等, 2023),后续发展为模糊测试(Yu 等, 2023)、基于梯度的提示词优化(Wen 等, 2023; Zou 等, 2023)以及生成式LLM迭代优化(Chao 等, 2023; Chang 等, 2024)。作者指出这些方法均停留在输入层提示词攻击,忽略了安全对齐的内部机制。
- 神经元级分析与操纵:神经元可解释性研究(Geva 等, 2022; Anthropic, 2024)表明单个神经元可编码特定概念;近期研究表明剪枝或修改稠密模型中的安全相关神经元可大幅降低拒答率(Wu 等, 2026; Wei 等, 2024; Chen 等, 2024)。
MoE架构特有的安全漏洞
- 路由机制相关风险:Hayes 等(2024)指出跨批次路由策略可被用于完整性与可用性攻击;Wang 等(2025)通过休眠专家投毒实现后门攻击;Yona 等(2024)利用路由平局侧信道泄露用户提示词。
MoE架构的安全对齐绕过攻击
- 专家级安全控制与剪枝:Lai 等(2025)提出了SAFEx,通过识别并遮蔽安全控制专家来降低拒答率。作者指出SAFEx在粗粒度专家级别操作,且依赖存在专用安全专家的假设。
对比基线与评测基准
- 基线方法:论文将SAFEx作为唯一的推断时MoE攻击对比基线,并在本文评测的8个MoE模型上进行了复现对比;同时设置了0%未剪枝基线以及两组随机剪枝基线(R1全网络随机、R2安全专家内随机)。
- 评测基准:实验采用StrongREJECT作为主要攻击评估基准;在专家画像构建中使用了LLM-LAT有害数据集、JailbreakV-28k越狱提示词以及Natural Questions良性数据集;通用效用评估采用CoLA、RTE、WinoGrande、OpenBookQA和ARC Challenge。
本文与现有工作的区别定位
- 作者指出,相比SAFEx的粗粒度整专家剪枝和基于二元越狱标签的分析,GateBreaker在细粒度神经元级别操作,结合门控激活频率与有害/良性激活差异,避免了对专家的破坏性整块移除,实现了更精确高效的安全机制瓦解。
论文如何解决这个问题?
GateBreaker通过门控特征分析筛选高频候选专家,利用有害与良性激活均值差定位安全神经元,并在推断时将其激活置零。
作者提出了免训练、架构无关的推断时攻击框架 GateBreaker,通过门控特征分析、专家内神经元定位与定向安全移除三阶段,在不改变模型门控路由的前提下定点抑制安全神经元。
运行时计算图修补与输入过滤
- 计算图统一解耦:针对实际MoE实现中门控投影与专家计算紧密融合(如GPT-OSS)、缺乏门控logits输出(如DeepSeek-MoE)或包含定制容量分发逻辑(如Hunyuan-A13B)的问题,作者设计了运行时修补系统,在不改变权重和架构的前提下解耦出独立的门控模块与专家模块,暴露每token中间激活。
- 语义token过滤:在提取门控与神经元激活时,输入提示词中的聊天模板格式token和填充token会被遮蔽排除,仅保留用户问题对应的语义token,以防止非语义token扭曲专家激活统计。
阶段一:门控特征分析(Gate-level Profiling)
- 激活频率统计:对有害提示词数据集中的每个有害输入,记录各层门控选择专家的命中情况,并按提示词长度归一化为专家激活频率。
- 专家效用得分:定义专家效用得分公式为: Ul,j = 1/(|Dharm|) ∑M ∈ Dharm fl,j(M) 该式计算第 l 层第 j 个专家在整个有害提示词数据集上的平均激活频率,量化专家与有害输入处理之间的统计关联。
- 候选安全专家选取:为覆盖潜在的安全通路,采用保守策略,在每个MoE层中选取平均激活频率排名前 top-3k 的专家作为候选安全专家(k为模型默认每token激活的专家数)。
阶段二:专家级神经元定位(Expert-level Localization)
- 关注子层与特征聚合:对稀疏专家仅在其条件输入激活时记录激活,对共享专家则收集所有token激活;分析聚焦于MLP中的门控投影(gate-projection)与上升投影(up-projection)子层,并采用逐元素取最大值聚合token激活向量以捕捉峰值响应。
- 安全权重定义:使用等规模的有害数据集与良性数据集,计算神经元在两组数据上的激活差值: wl,j,n = 𝔼M ∈ Dharm[vl,j(M)n] − 𝔼B ∈ Dbenign[vl,j(B)n] 该式表示神经元 n 在有害输入与良性输入下的聚合激活均值差异,正值越大表示与拒答行为的关联越强。
- 离群值筛选:将各专家内部的神经元安全权重进行z-score标准化,选取满足标准化得分大于阈值 τ = 2 的离群神经元判定为安全神经元。
阶段三:定向安全移除与推断时阻断
- 推断时激活清零:在推断前向传播过程中,无需重训或修改模型权重,直接通过运行时钩子将选定安全神经元的后激活值强制置为 0。
- 安全陷阱机制:门控网络仍正常将有害token路由至高频专家,但专家内部负责拒答的关键神经元已被静音,使底层的生成能力得以绕过安全对齐直接输出。
论文做了哪些实验?
实验覆盖8个MoE LLM与5个MoE VLM,结果显示推断时轻量级神经元剪枝可大幅提升ASR且较好保持良性效用。
实验设置
- 被测模型:评测覆盖8个主流开源MoE LLM,包括GPT-OSS-20B(Sparse, 32专家, Top-4)、Qwen3-30B-A3B-Instruct-2507(Sparse, 128专家, Top-8)、Phi-3.5-MoE-Instruct(Sparse, 16专家, Top-2)、Mixtral-8x7B-Instruct-v0.1(Sparse, 8专家, Top-2)、Qwen1.5-MoE-A2.7B-Chat(Mixture, 60稀疏+4共享, Top-4)、Deepseek-MoE-16b-Chat(Mixture, 64稀疏+2共享, Top-6)、Hunyuan-A13B-Instruct(Mixture, 64稀疏+1共享, Top-8)、OpenPangu-Pro-MoE-72B(Grouped Mixture, 64稀疏+4共享, Top-8);正文还补充测试了GPT-OSS-120B。
- 数据集与规模:主攻击评估采用StrongREJECT基准(包含超过300条跨越多个安全类别的恶意提示词);画像构建使用LLM-LAT有害数据集与Natural Questions良性数据集;复现SAFEx使用了JailbreakV-28k中的20,000条有害请求与20,000条越狱提示词;效用评估采用CoLA、RTE、WinoGrande、OpenBookQA及ARC Challenge;多模态实验将StrongREJECT转换为图文输入,并辅以500张NSFW图像。
- 基线方法:推断时专家剪枝基线SAFEx、0%未剪枝基线,以及全网络随机剪枝R1与安全专家内随机剪枝R2。
- 指标定义:攻击成功率(ASR,经由评审模型判定有害或违规的输出比例)、安全神经元比例(Ratio,修改神经元占目标层全部神经元的百分比)、效用基准准确率(Accuracy)。
- 评审方式:以Llama-Guard-3-8b为主评审模型,辅以第二评审模型Qwen3Guard-Gen-8B防止judge hacking,人工抽检以排除胡言乱语。
- 样本与重复:StrongREJECT包含300余条样本;论文未报告多次重复采样的随机种子与方差。
主结果
表格较宽,可左右滑动
目标模型 0%剪枝(基线) 50%剪枝 100%剪枝 神经元比例 GPT-OSS-20B 1.6% 33.9% 80.2% 2.4% Qwen3-30B-A3B-Instruct-2507 0.3% 24.3% 56.9% 2.7% Phi-3.5-MoE-Instruct 0.6% 17.3% 56.5% 2.8% Mixtral-8x7B-Instruct-v0.1 12.5% 53.7% 64.2% 2.9% Deepseek-MoE-16b-Chat 22.0% 50.8% 53.6% 2.6% Hunyuan-A13B-Instruct 10.9% 49.8% 76.9% 2.6% OpenPangu-Pro-MoE-72B 6.1% 42.5% 73.1% 2.6% 据 Table 2。注:按要求表格不超过8行,省略了Qwen1.5-MoE-A2.7B-Chat(0%为5.1%、50%为54.0%、100%为57.8%、比例为2.4%)与Average行(0%为7.4%、50%为40.8%、100%为64.9%、比例为2.6%);表中已包含100%剪枝下ASR最低的模型Deepseek-MoE-16b-Chat。
- 层级深度分布:作者称,随着剪枝层数增加,所有模型的ASR均有提升,表明MoE的安全对齐行为分布于模型全网络深度,而非仅局限于浅层。
- 极低参数干预的有效性:作者指出,仅在目标层修改平均2.6%的神经元即可瓦解安全机制,即使仅剪枝前半部分层(50%剪枝),平均ASR也达到40.8%。
- 推理能力与安全对齐的分离:作者称,具备较强推理能力的指令微调模型(如GPT-OSS-20B和OpenPangu-Pro-MoE-72B)同样取得了高ASR,且在更大的GPT-OSS-120B上ASR从1.3%升至69.0%,表明推理与对齐在结构组件上可能相互解耦。
跨模型单样本迁移攻击
- 测试内容:将源模型识别的安全神经元掩码直接复用于同家族的衍生模型(包括数学推理、营销、特定语言、编程及通用知识变体),无需重新画像(Table 3)。
- 实验结果:平均基线ASR为17.9%,应用GateBreaker单样本迁移后平均ASR升至66.1%。例如GPT-OSS-20B迁移至CAI-20B从0.0%升至84.0%、迁移至ANITA-NEXT-20B从0.0%升至82.4%;Qwen1.5-MoE-A2.7B-Chat迁移至Wikihow变体从17.5%升至67.7%(Table 3)。
- 作者解读与例外:作者认为同家族衍生模型共享基础架构与对齐策略,安全神经元具有结构保守性;例外情况是代码专用模型Qwen1.5-MOE-sft-nemotron-code的基线ASR已高达88.9%,迁移后仅微幅升至91.2%,作者推测代码微调数据改变了注意力分布,破坏或覆盖了预训练学到的安全神经元。
MoE多模态视觉语言模型攻击
- 测试内容:在Deepseek-VL2系列和Kimi-VL家族共5个MoE VLM上评估,将StrongREJECT提示词转为图文输入,并测试跨模型单样本迁移(Table 4)。
- 实验结果:未修改前平均基线ASR为20.8%,应用GateBreaker后平均ASR升至60.9%,平均目标层安全神经元比例为2.4%;在两款Thinking变体上的单样本迁移ASR分别达到54.0%和57.8%(Table 4)。
- 作者解读与NSFW实验:作者认为VLM的安全对齐仍主要由语言组件中的MoE介导;此外在500张NSFW图片的辅助实验中,所有被测VLM无一拒绝,作者报告这些模型对NSFW内容本身未做对齐。
现有方法对比与通用效用评估
- 测试内容:与推断时MoE攻击方法SAFEx在全部8个模型上对比ASR(Table 5),并在5个标准NLU和推理基准上评估模型通用效用变化(Table 6)。
- 实验结果:GateBreaker平均ASR达到64.9%,超过SAFEx的29.9%(Table 5);效用评估中,RTE平均准确率从80.8%变为77.9%,CoLA从74.9%变为70.2%,WinoGrande、OpenBookQA与ARC变化较小(Table 6),个别模型(如GPT-OSS-20B在RTE上)性能略有提升。
- 作者解读:作者称GateBreaker在神经元级别操作,避免了SAFEx粗粒度整专家删除对模型能力的破坏,在较好保持通用语言与推理能力的同时取得了更高的攻击成功率。
其他消融与分析
- 稀疏专家与共享专家消融(Table 7):仅剪枝稀疏专家平均ASR为38.8%,仅剪枝共享专家为36.6%,二者均剪枝为65.3%。
- 专家内部子层消融(Table 8):仅剪枝门控投影层平均ASR为55.9%,仅剪枝上升投影层为20.6%,二者均剪枝为64.9%。
- 候选安全专家数量消融(Table 9):选用Top-k、Top-2k与Top-3k专家时,平均ASR分别为37.0%、51.3%和64.9%。
- z分数筛选阈值消融(Table 10):阈值tau为1、2、3时,平均ASR分别为71.6%(部分模型输出崩溃)、64.9%和42.5%。
- 神经元抑制强度消融(Table 12):抑制强度为35%、65%、100%时,平均ASR分别为22.4%、45.0%和64.9%。
- 随机神经元剪枝对照(Table 13):全网络随机剪枝R1平均ASR为7.8%,安全专家内随机剪枝R2为11.8%,GateBreaker为64.9%。
有什么可以进一步探索的点?
作者指出白盒假设、推断时激活修改及单轮攻击等局限,未来可探索基于代理模型的黑盒攻击与多专家安全冗余防御。
作者指出的局限与后续方向
- 黑盒攻击场景拓展:作者在Section 8指出,GateBreaker设计针对白盒环境,未来可探索利用开源MoE模型作为代理模型识别激活模式,进而构造规避安全专家的对抗性提示词以攻击黑盒或闭源MoE模型。
- 推断时防御手段的应对:作者在Section 8指出,由于GateBreaker依赖于推断时的激活修改,服务提供商未来可通过监控或校验内部激活及关键层(如checksum)来实施防御。
- 多专家安全冗余构建:作者在Section 8指出,当前MoE模型安全对齐集中于少数神经元,未来训练可在多专家间显式引入安全冗余(如负载均衡感知的对齐目标、跨专家对比正则化),或将安全约束更深地融入奖励建模与微调阶段(如针对单专家或专家集成的RLHF/DPO)。
- 单轮攻击限制:作者在Section 3.1指出,本工作聚焦于单轮攻击,多轮攻击需通过重复或永久注入来实现。
实验覆盖范围
- 被测模型数量与架构类型:评测覆盖8个开源文本MoE LLM(GPT-OSS-20B、Qwen3-30B-A3B-Instruct-2507、Phi-3.5-MoE-Instruct、Mixtral-8x7B-Instruct-v0.1、Qwen1.5-MoE-A2.7B-Chat、Deepseek-MoE-16b-Chat、Hunyuan-A13B-Instruct、OpenPangu-Pro-MoE-72B)及5个MoE VLM,正文补充测试了GPT-OSS-120B。
- 基准数据集覆盖:攻击效果评估使用包含300余条英文有害提示词的StrongREJECT基准;效用评估采用CoLA、RTE、WinoGrande、OpenBookQA及ARC Challenge等5个自然语言理解与推理数据集。
- 对比基线覆盖:推断时对比基线仅包含SAFEx(复现于8个模型),对照实验包含0%未剪枝基线及两组随机神经元剪枝基线(R1和R2)。
- 防御机制评估:实验仅对未添加防御护栏的模型进行了激活剪枝,未对已部署运行时激活检测或校验防御的系统进行自适应攻击评估。
- 评测指标与样本统计:采用Llama-Guard-3-8b与Qwen3Guard-Gen-8B两套自动评审结合人工抽检,论文未报告多次重复采样的方差或置信区间。
总结一下论文的主要内容
作者称GateBreaker揭示了MoE安全机制集中于少数神经元的脆弱性,通过轻量级推断时激活置零实现了高ASR攻击。
GateBreaker是一项针对混合专家(MoE)大语言模型推断时安全对齐机制的攻击与机理研究。
- 要解决的问题:随着MoE架构在大型语言模型中的广泛应用,其稀疏激活与条件计算特性改变了计算路径分布,但其内部安全对齐机制的组织规律尚不清楚,缺乏细粒度的安全分析与推断时攻击手段。
- 方法核心机制:GateBreaker采用免训练的三阶段推断时流水线,首先通过门控激活频率统计识别高频处理有害输入的候选安全专家;随后基于有害与良性输入的激活均值差异,在专家内部定位关键安全神经元;最后在推断时通过运行时钩子将选定神经元的激活值置零,在维持原有路由与通用能力的同时抑制拒答行为。
- 主攻击效果:在8个主流开源MoE LLM上,仅修改目标层平均2.6%的神经元,在StrongREJECT上的平均ASR从未修改时的7.4%升至64.9%,超过专家级剪枝基线SAFEx的29.9%(Table 2、5)。
- 跨模型迁移与多模态扩展:在同家族模型间单样本迁移攻击中,源模型提取的安全神经元使目标模型平均ASR从17.9%升至66.1%(Table 3);在5个MoE视觉语言模型上,GateBreaker使图文有害输入的平均ASR从20.8%升至60.9%(Table 4)。
- 通用效用保留:在5个自然语言理解和推理基准上,修改后的模型平均性能无大幅下降(如RTE平均准确率从80.8%变为77.9%,Table 6),部分模型在特定任务上略有上升。
- 作者的结论与启示:作者认为当前MoE模型的安全对齐高度集中在由稀疏路由协调的极少数神经元中,存在结构性脆弱点;作者建议未来应在训练阶段增强跨专家的安全冗余,或在部署端引入内部激活监控以加强防御。