Misrouter:利用 MoE 路由机制对混合专家大模型发起仅输入攻击
Misrouter: Exploiting Routing Mechanisms for Input-Only Attacks on Mixture-of-Experts LLMs
Misrouter用开源MoE代理优化仅输入攻击并迁移到同家族API,作者称黑盒平均ASR从20.8%到39.7%。
攻击者只改输入,不能改路由logits、掩码专家或改专家参数。
- 公共MoE API只能通过输入访问,已有路由攻击却要改模型内部。作者问仅靠输入扰动,能否把路由引向更易顺从的专家,并得到足够有信息量的不安全回复。
- Misrouter在同家族开源代理上,用有害查询、有害顺从序列和良性问答估计专家激活,构造要压制或提升的路由分数,再两阶段优化前缀:先只调路由,再在保住路由的同时提高目标不安全续写的概率。也可叠在FFA提示词上。
- 白盒、灰盒、黑盒都做了评测,评审为Llama-Guard-3-8B。作者称黑盒下Misrouter+FFA的平均ASR从20.8%到39.7%;单独Misrouter常低于提示工程基线,GCG在AdvBench六服务上为0.0%。
- 作者指出统一用GCG式优化,提示词可能不自然,目标与代理差异大时迁移可能较弱;后续可把路由损失用作FFA类提示词的筛选,或用多个代理。论文未报告样本量、重复次数及评审与人工的一致性。
- 威胁模型
- 攻击者只改输入,不能改路由logits、掩码专家或改专家参数。构造时对同家族开源代理有白盒访问;对远程MoE API只有查询访问。目标是引出既非拒答、又足够有信息量的违反策略回复。
- 被测模型
- GPT-4o miniQwen-PlusPhi-4Mistral-Large-2512Qwen-TurboDeepSeek-Chat-V3-0324GPT-OSS-20BQwen3-30B-A3B-Instruct-2507Phi-3.5-MoE-InstructMixtral-8x7B-Instruct-v0.1Qwen1.5-MoE-A2.7B-ChatDeepSeek-MoE-16B-ChatANITA-NEXT-20B-gpt-oss-ITAQwen3-Coder-30B-A3B-InstructPhi-3.5-MoE-GSM8Knotux-8x7b-v1Qwen1.5-MoE-A2.7B-WikihowDeepseek-MoE-16b-GSM8K
- 基准
- AdvBenchStrongREJECTCoLARTEWinoGrandeOpenBookQAARC Challenge
- 指标
- ASRrouting lossRefusal Rateaccuracy
研究者提出 Misrouter,一种针对混合专家(MoE)大语言模型的仅输入攻击框架,通过操纵路由机制诱导模型产生不安全行为。此前操纵路由的攻击需要修改模型,只能用于本地部署;Misrouter 改为在开源代理 MoE 模型上做白盒优化,再把对抗输入迁移到同一模型族的公开 API 服务。方法先分析有害查询配不安全续写下的专家激活,找出对齐较弱的专家,再优化输入把路由导向这些专家并远离对齐较强的专家,同时偏向从良性问答任务中识别出的高能力通用专家。由于路由与输出目标可能冲突,框架采用两阶段优化,先引导路由再优化有害输出并保持路由稳定。
深度解读
这篇论文试图解决什么问题?
远程MoE服务只能改输入,作者问路由能否被仅输入攻击用来诱导不安全输出。
远程托管的MoE服务只能改输入,作者要问路由能否被用来诱导不安全行为。
- 场景: 作者认为MoE靠动态选专家做稀疏计算,路由因此成为新攻击面。已有路由攻击要改logits或专家计算,只适用于本地模型;公共API远程托管,攻击者不能检查或修改模型。
- 缺口: 作者报告在开源代理上直接优化再迁到同家族API会失败。列出的挑战是:路由只能靠输入扰动间接影响,路由控制与输出生成互相干扰,以及绕过拒答后回复仍可能含糊或不连贯。
- 做法: Misrouter找出愿意生成目标有害内容的弱对齐专家,把路由引向它们并离开强对齐专家,同时偏向从良性问答识别的高能力通用专家;两阶段先稳定路由,再优化有害输出。作者称据其所知,这是首个研究远程托管服务上、利用MoE路由的仅输入攻击的工作。
- 威胁模型:
- 目标: 仅靠输入让模型顺从有害意图,而不是拒答或给泛泛的安全话术;成功还要求回复对目标查询足够有信息量。
- 知识: 持有同家族或路由架构相近的开源代理,白盒优化后迁到远程MoE API。
- 能力: 构造时可看代理的路由、专家激活等内部状态;对目标只有查询访问,不能改路由、掩码专家或改参数。
- 受害系统: 仅经输入查询访问的远程MoE LLM服务。作者称目标API可能在规模、专家数、层深、路由设计、安全微调、系统提示词和部署时过滤上不同于代理。
有哪些相关研究?
相关工作包括通用越狱、需改模型的MoE路由攻击、BadMoE后门和路由侧信道;基线为GCG与FFA等。
通用越狱
- 提示工程: Jailbroken(Wei et al., 2023)、FFA(Zhou et al., 2024)、WildPrompt(Shen et al., 2024)用角色扮演、假设场景或指令混淆绕过对齐,不改模型、不做显式优化。
- 优化攻击: GCG(Zou et al., 2023)按坐标用梯度替换token,最大化目标不安全回复的对数概率。
- 防御: RLHF(Ouyang et al., 2022)和DPO(Rafailov et al., 2023)在训练时加入安全偏好;部署时有内容过滤和外部护栏(Dong et al., 2024;Llama Guard, Inan et al., 2023)。论文称这些努力之后越狱仍然有效,MoE路由又增加攻击面。
需改模型的MoE路由攻击
- 路由改写: Fayyaz et al.(2025)、Jiang et al.(2026)、SafeX(Lai et al., 2025)和GateBreaker(Wu et al., 2025)在推理时改路由分布:硬掩码去掉专家,或用有限扰动重加权;有的还做神经元级掩码。论文指出它们假设能访问并修改路由logits和专家函数,主要适用于本地模型。
- 强对齐画像: GateBreaker用有害查询探测拒答式续写时被激活的专家。作者认为只避开这些专家,在仅输入约束下往往过刚,也不保证激活愿意生成目标内容的专家。
输入设计、侧信道与服务级路由
- BadMoE(Wang et al., 2025): 找很少激活的专家,用路由感知损失优化触发器,再微调注入后门。论文称这是最接近的输入设计工作,但需要改模型,目标是后门而非仅输入越狱。
- 路由副作用: Hayes et al.(2024)讨论跨batch路由使对抗查询影响同批其他输入,或造成拒绝服务式过载;Yona et al.(2024)利用路由平局打破抽取用户提示词。论文称本文不依赖跨输入交互或侧信道观测。
- R2A(Tang et al., 2026): 黑盒攻击代价感知的模型路由,训练代理路由器并优化通用对抗后缀,把查询导向高成本模型。论文称那是服务级选模型,目标是推理成本,不是单模型内部选专家来诱导不安全生成。
基线与基准
- 基线: Direct Instruction、GCG、FFA、Jailbroken、WildPrompt;组合变体Misrouter+FFA是在FFA生成的提示词上再跑Misrouter。GCG与Misrouter在同一代理上优化,其余提示工程基线不需要代理。
- 基准: 主评测为AdvBench与StrongREJECT。附录D的效用分析使用CoLA、RTE、WinoGrande、OpenBookQA和ARC Challenge。
作者把本文与需改模型的路由攻击、需微调的BadMoE以及服务级R2A分开:只改输入,在开源代理上白盒优化后迁到同家族远程API。
论文如何解决这个问题?
Misrouter在代理上用对比激活塑形路由,两阶段优化前缀后再迁到同家族API。
Misrouter在开源代理上先画像路由,再优化固定长度的对抗前缀,使输入偏向攻击有利的专家,并提高目标不安全续写的概率,最后把前缀迁到同家族API。Figure 1将流程画成数据构造、路由画像、提示词优化和攻击执行四段。
数据与路由画像
- 三套数据: Dharm是原始有害查询,用来找与强对齐、拒答式续写相关的激活。Dcomp把有害查询与顺着有害意图的不安全续写拼接,并加入语义改写、对抗扰动和语境重构,用来找愿意顺从的弱对齐专家。Dbenign是常规问答,用来找高能力通用专家。附录C写Dharm来自留出集,共4500条,取自Categorical HarmfulQA、Harmful Dataset、HarmfulQA和JailBreakV,不用于最终评测;Dcomp由这些查询配对而成;Dbenign从Natural Questions抽样,论文未给出条数。
- 估计: 每个数据集抽S个大小为m的子集,用专家进入TopK的频率估计激活,再对S次取平均。固定配置未给出S和m。路由概率由logits经softmax得到,可按层和token位置聚合。
- 分数: 最小化由ΔU加权的路由概率。定义为 Δ Ui=λ1Ūi(Dharm)−λ2Ūi(Dcomp)−λ3Ūi(Dbenign)。Dharm上常激活的专家分数更高,对应强对齐,应被压低;Dcomp或Dbenign上常激活的专家分数更低,优化时被鼓励。三个λ均大于0。可选地取TopK抑制集和BottomK提升集;默认用完整向量,作者认为比硬掩码更平滑。附录A的Algorithm 1汇总该过程。
两阶段优化
- 前缀: 给定有害查询x和ΔU,构造长度L的前缀δ,输入为δ接上x。攻击者不直接改路由logits。
- 阶段一: 只最小化各专家ΔU与路由概率的乘积之和,做T1次基于梯度的token更新,作用在前缀的token embedding上。作者的理由是先到达可行路由区,避免输出目标干扰。
- 阶段二: 输出损失沿GCG,对目标不安全续写的逐token对数概率取负再求和。联合目标为 L=α Lout+β Lroute。路由项作为正则,防止提示词漂回强对齐专家,共T2次更新。附录A的Algorithm 2给出该过程。
- 固定配置: 附录C写主实验除非另有说明,λ1、λ2、λ3为1.0、0.5、0.5,α为1.0、β为0.5,L为10,总迭代T为500,T1与T2各250;另写k为15%或25%,未说明各实验用哪一个。这些值来自预实验,主评测保持不变。
迁移与成功条件
- 执行: 前缀与原查询拼接后,经普通查询接口提交目标API。攻击者看不到目标的路由logits、被选专家或其他内部状态。作者认为路由比完整输出分布更低维,同家族迁移可能好于直接拟合代理输出的GCG。
- 成功条件: 选中专家子集落在攻击有利集合中,回复属于违反策略的集合,且信息量不低于阈值τ。论文未给出τ的数值。实验中的成功与否由ASR判定。
论文做了哪些实验?
白盒、灰盒、黑盒均有评测;作者称路由优化带来额外攻击能力,但单独Misrouter并非每格都高于基线。
实验设置
- 模型: 白盒目标即代理,Table 1记为GPT-OSS、Qwen3、Phi-3.5、Mixtral、Qwen1.5、Deepseek;Table 7全名为GPT-OSS-20B、Qwen3-30B-A3B-Instruct-2507、Phi-3.5-MoE-Instruct、Mixtral-8x7B-Instruct-v0.1、Qwen1.5-MoE-A2.7B-Chat、DeepSeek-MoE-16B-Chat。黑盒API为GPT-4o mini、Qwen-Plus、Phi-4、Mistral-Large-2512、Qwen-Turbo、DeepSeek-Chat-V3-0324,代理为同表同家族模型。灰盒学生模型(Table 8)为ANITA-NEXT-20B-gpt-oss-ITA、Qwen3-Coder-30B-A3B-Instruct、Phi-3.5-MoE-GSM8K、notux-8x7b-v1、Qwen1.5-MoE-A2.7B-Wikihow、Deepseek-MoE-16b-GSM8K。
- 数据与基线: AdvBench与StrongREJECT;灰盒只用AdvBench。论文未报告两基准的评测条数。基线为Direct Instruction、GCG、FFA、Jailbroken、WildPrompt,以及叠在FFA上的Misrouter+FFA。
- 指标: ASR是被判为unsafe或违反策略的查询比例。开源模型另报routing loss,即ΔU与路由概率的加权和。Table 4另有Refusal Rate,论文未给出计算式。
- 评审: 分类器为Llama-Guard-3-8B。论文未写阈值,未报告重复次数或与人工的一致性。主实验使用附录C的固定配置,除非另有说明。
主结果
黑盒AdvBench的ASR(Table 2)。
表格较宽,可左右滑动
服务 FFA Jailbroken WildPrompt Misrouter Misrouter+FFA GPT-4o mini 2.0% 12.0% 0.0% 0.0% 18.0% Qwen-Plus 0.0% 0.0% 4.0% 0.0% 6.0% Phi-4 0.0% 0.0% 0.0% 6.0% 10.0% Mistral-Large-2512 92.0% 86.0% 96.0% 10.0% 96.0% Qwen-Turbo 20.0% 20.0% 22.0% 8.0% 26.0% DeepSeek-Chat-V3-0324 96.0% 30.0% 32.0% 2.0% 96.0% - 作者解读: 作者称组合方法在基线偏低或中等的服务上提供额外攻击能力,并在摘要中称黑盒平均ASR从20.8%到39.7%。单独Misrouter在上表多低于提示工程基线;Mistral-Large-2512上组合方法与WildPrompt持平。
- StrongREJECT: Table 2中GPT-4o mini上Jailbroken为11.7%,Misrouter+FFA为5.0%,与FFA相同。Qwen-Plus上组合方法为8.3%,作者称相对Jailbroken的3.3%为2.5×。Phi-4上二者同为3.3%。
- GCG: AdvBench六服务均为0.0%。StrongREJECT上仅Qwen-Turbo与DeepSeek-Chat-V3-0324为1.7%,其余0.0%。作者认为一种可能是GCG拟合代理的完整输出分布,而路由是更低维的部件。
白盒:代理即目标
- ASR: 作者称Misrouter与Misrouter+FFA一致强于基线。按Table 1,组合方法各格高于同表基线;单独Misrouter并非如此。AdvBench上Mixtral的Misrouter为22.0%,低于Jailbroken的78.0%;Deepseek为62.0%,低于FFA的98.0%。
- GPT-OSS: 作者称最强基线在AdvBench为2.0%、StrongREJECT为3.3%,Misrouter为24.0%与11.7%,并称相当于12.0×与3.5×。
- routing loss: 作者称Misrouter低于GCG,并认为提升来自路由操纵。Table 1六模型、两数据集均低于GCG;也有提示工程方法更低,例如AdvBench上Mixtral的Jailbroken为8.00,Misrouter为9.19。作者认为更低的routing loss不一定对应更高ASR。
灰盒:基座到微调变体
- 设置: 代理与目标共享架构和初始参数,目标再做下游微调。只评AdvBench。Table 8的应用包括意大利语、代码、数学、人类偏好、通用知识和指令向知识任务。
- 结果: Table 3的Misrouter+FFA为GPT-OSS 30%、Qwen3 14%、Phi-3.5 80%、Mixtral 94%、Qwen1.5 100%、Deepseek 94%。作者称GPT-OSS上相对FFA的6%为5×,Phi-3.5上相对Jailbroken的32%为2.5×。正文把这两对写成6.0%与30.0%、32.0%与80.0%。
- 例外: 单独Misrouter在Qwen3为2%,低于WildPrompt的10%;Mixtral为22%,低于FFA的88%。作者认为灰盒比黑盒更容易迁移,因为专家数、层结构和初始化更一致。
防御
- 做法: 一是对有害查询上很少激活的专家做额外安全训练;二是提高强对齐专家的路由logits。论文未给出该实验的放大系数和k。作者认为前者开销大且与专家分工相冲突,后者会干扰专家分工并降低效用。
- 数字: Table 6未写模型。无防御时AdvBench ASR 96.0%、routing loss 3.78,StrongREJECT为80.0%与3.86;加强弱专家后为30.0%与3.64、26.7%与3.70;放大强专家后为44.0%与6.26、41.7%与6.26。
- 作者解读: 作者称两种策略都不能有效缓解Misrouter。Table 6里两种防御的ASR都低于无防御一行。
其他消融与分析
- 路由目标(Table 4,Qwen1.5,直接掩码而非优化提示词): 仅Uharm的AdvBench ASR/拒答率为14.0%/92.0%,StrongREJECT为31.7%/76.7%;加入良性信号后为26.0%/64.0%与50.0%/41.7%;三信号为62.0%/12.0%与76.7%/13.3%。
- 优化目标(Table 5,Qwen1.5,ASR/routing loss): 只优化Lout为76.0%/3.91与63.3%/3.91;只优化Lroute为36.0%/3.52与21.7%/3.60;从头联合为88.0%/3.91与73.3%/3.89;先路由后只优化输出为88.0%/3.87与75.0%/3.88;两阶段为96.0%/3.78与80.0%/3.86。作者称从头联合表现差;该格AdvBench ASR高于只优化输出,低于两阶段,routing loss高于只优化路由。
- 效用(Table 9、附录D): 掩码按Ubenign排序最高的10%专家。作者称六模型五任务平均准确率从60.3%到40.3%。表中任务平均:CoLA 53.6%到10.5%,RTE 80.4%到61.4%,WinoGrande 70.9%到61.3%,OpenBookQA 41.8%到27.1%,ARC 55.0%到41.4%。
有什么可以进一步探索的点?
作者指出GCG式提示词可能不自然、黑盒迁移可能较弱,并计划重排序与多代理。
作者指出的局限与后续方向
- 统一骨干: 第6节写,为公平比较,白盒、灰盒、黑盒统一用GCG式优化;该设计在代理与目标相同或接近时尤其有效,但可能生成不那么自然的提示词。
- 黑盒迁移: 第6节写,目标服务与代理差异很大时,GCG式优化的迁移可能较弱。
- 重排序变体: 第6节提出,可把路由目标只当作FFA等提示工程方法所生成提示词的选择或重排序信号,而不是直接做token优化。
- 多代理: 第6节写,当前每个目标服务用一个同开发者或同家族代理;后续可在多个代理上优化或选择提示词,以得到更不依赖特定模型的路由感知提示词。
- 防御: 第7节称,专家级对齐或路由偏置防御的缓解有限,需要更稳健的路由感知防御。
实验覆盖范围
- 评测分三档:白盒六对代理即目标,AdvBench与StrongREJECT;灰盒Table 8六对基座到微调,只用AdvBench;黑盒Table 7六对代理到API,两个基准都用。
- 对照为Direct Instruction、GCG、FFA、Jailbroken、WildPrompt和Misrouter+FFA。主指标为ASR,开源模型另报routing loss;分类器为Llama-Guard-3-8B。黑盒API不暴露路由,论文因此不在API上报告routing loss。
- 第5.5、5.6节把代理和目标都固定为Qwen1.5。前者直接掩码三种路由目标,后者比较五种损失组合(Table 4、Table 5)。
- 防御结果在Table 6,含两种专家级干预的ASR与routing loss。附录D在六个开源MoE上掩码Ubenign最高的10%专家,任务为CoLA、RTE、WinoGrande、OpenBookQA和ARC。
- 论文未报告评测样本量、重复次数、Llama-Guard-3-8B与人工判定的一致性,以及Table 6的模型和放大强度。
总结一下论文的主要内容
仅输入的MoE路由攻击:代理上两阶段塑形路由,再迁到同家族API,与FFA组合后若干设定ASR更高。
Misrouter是面向远程MoE服务的仅输入攻击:在同家族开源代理上操纵路由,再把提示词迁到只接受查询的API。
- 问题: 作者称已有路由攻击要改模型,不能自然扩展到公共API。成功标准是回复既非拒答,又对有害查询足够有信息量。
- 方法: 用有害查询、有害顺从序列和良性问答给专家打路由分数,压制强对齐、提升弱对齐和高能力通用专家;先只优化路由,再在路由正则下提高目标不安全续写的概率。Misrouter+FFA把该优化叠在FFA提示词上。
- 黑盒: 六个API、两个基准,由Llama-Guard-3-8B判ASR。作者称组合方法相对代表性基线的平均ASR从20.8%到39.7%。Table 2里GPT-4o mini的AdvBench上组合方法为18.0%;StrongREJECT上Jailbroken为11.7%,组合方法为5.0%。AdvBench上GCG六服务均为0.0%。
- 另外两档: 白盒GPT-OSS上,作者称Misrouter的ASR为AdvBench 24.0%、StrongREJECT 11.7%,最强基线为2.0%与3.3%。灰盒AdvBench上,Table 3的组合方法在GPT-OSS为30%、Phi-3.5为80%,作者称相当于5×与2.5×。
- 结论: 作者称路由感知攻击可以迁移,也能与已有越狱组合;专家级对齐或简单路由偏置的缓解有限。Table 1至Table 3里,单独Misrouter有多格低于FFA或WildPrompt。