跳到正文
原文
论文追踪· arXiv:2605.04446· Zekun Fei, Zihao Wang, Weijie Liu et al.·本站收录 · 原文发表

Misrouter:利用 MoE 路由机制对混合专家大模型发起仅输入攻击

Misrouter: Exploiting Routing Mechanisms for Input-Only Attacks on Mixture-of-Experts LLMs

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

Misrouter用开源MoE代理优化仅输入攻击并迁移到同家族API,作者称黑盒平均ASR从20.8%到39.7%。

威胁模型攻击者只改输入,不能改路由logits、掩码专家或改专家参数。

问题
公共MoE API只能通过输入访问,已有路由攻击却要改模型内部。作者问仅靠输入扰动,能否把路由引向更易顺从的专家,并得到足够有信息量的不安全回复。
方法
Misrouter在同家族开源代理上,用有害查询、有害顺从序列和良性问答估计专家激活,构造要压制或提升的路由分数,再两阶段优化前缀:先只调路由,再在保住路由的同时提高目标不安全续写的概率。也可叠在FFA提示词上。
实验与结果
白盒、灰盒、黑盒都做了评测,评审为Llama-Guard-3-8B。作者称黑盒下Misrouter+FFA的平均ASR从20.8%到39.7%;单独Misrouter常低于提示工程基线,GCG在AdvBench六服务上为0.0%。
局限与可以继续做的
作者指出统一用GCG式优化,提示词可能不自然,目标与代理差异大时迁移可能较弱;后续可把路由损失用作FFA类提示词的筛选,或用多个代理。论文未报告样本量、重复次数及评审与人工的一致性。
实验设置GPT-4o mini、Qwen-Plus 等 · AdvBench、StrongREJECT 等 · ASR、routing loss 等
威胁模型
攻击者只改输入,不能改路由logits、掩码专家或改专家参数。构造时对同家族开源代理有白盒访问;对远程MoE API只有查询访问。目标是引出既非拒答、又足够有信息量的违反策略回复。
被测模型
GPT-4o miniQwen-PlusPhi-4Mistral-Large-2512Qwen-TurboDeepSeek-Chat-V3-0324GPT-OSS-20BQwen3-30B-A3B-Instruct-2507Phi-3.5-MoE-InstructMixtral-8x7B-Instruct-v0.1Qwen1.5-MoE-A2.7B-ChatDeepSeek-MoE-16B-ChatANITA-NEXT-20B-gpt-oss-ITAQwen3-Coder-30B-A3B-InstructPhi-3.5-MoE-GSM8Knotux-8x7b-v1Qwen1.5-MoE-A2.7B-WikihowDeepseek-MoE-16b-GSM8K
基准
AdvBenchStrongREJECTCoLARTEWinoGrandeOpenBookQAARC Challenge
指标
ASRrouting lossRefusal Rateaccuracy
AI 导读研究者提出 Misrouter,一种针对混合专家(MoE)大语言模型的仅输入攻击框架,通过操纵路由机制诱导模型产生不安全行为。此前操纵路由的攻击需要修改模型,只能用于本地部署;Misrouter 改为在开源代理 MoE 模型上做白盒优化,再把对抗输入迁移到同一模型族的公开 API 服务。方法先分析有害查询配不安全续写下的专家激活,找出对齐较弱的专家,再优化输入把路由导向这些专家并远离对齐较强的专家,同时偏向从良性问答任务中识别出的高能力通用专家。由于路由与输出目标可能冲突,框架采用两阶段优化,先引导路由再优化有害输出并保持路由稳定。

研究者提出 Misrouter,一种针对混合专家(MoE)大语言模型的仅输入攻击框架,通过操纵路由机制诱导模型产生不安全行为。此前操纵路由的攻击需要修改模型,只能用于本地部署;Misrouter 改为在开源代理 MoE 模型上做白盒优化,再把对抗输入迁移到同一模型族的公开 API 服务。方法先分析有害查询配不安全续写下的专家激活,找出对齐较弱的专家,再优化输入把路由导向这些专家并远离对齐较强的专家,同时偏向从良性问答任务中识别出的高能力通用专家。由于路由与输出目标可能冲突,框架采用两阶段优化,先引导路由再优化有害输出并保持路由稳定。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    远程MoE服务只能改输入,作者问路由能否被仅输入攻击用来诱导不安全输出。

    远程托管的MoE服务只能改输入,作者要问路由能否被用来诱导不安全行为。

    • 场景: 作者认为MoE靠动态选专家做稀疏计算,路由因此成为新攻击面。已有路由攻击要改logits或专家计算,只适用于本地模型;公共API远程托管,攻击者不能检查或修改模型。
    • 缺口: 作者报告在开源代理上直接优化再迁到同家族API会失败。列出的挑战是:路由只能靠输入扰动间接影响,路由控制与输出生成互相干扰,以及绕过拒答后回复仍可能含糊或不连贯。
    • 做法: Misrouter找出愿意生成目标有害内容的弱对齐专家,把路由引向它们并离开强对齐专家,同时偏向从良性问答识别的高能力通用专家;两阶段先稳定路由,再优化有害输出。作者称据其所知,这是首个研究远程托管服务上、利用MoE路由的仅输入攻击的工作。
    • 威胁模型:
      • 目标: 仅靠输入让模型顺从有害意图,而不是拒答或给泛泛的安全话术;成功还要求回复对目标查询足够有信息量。
      • 知识: 持有同家族或路由架构相近的开源代理,白盒优化后迁到远程MoE API。
      • 能力: 构造时可看代理的路由、专家激活等内部状态;对目标只有查询访问,不能改路由、掩码专家或改参数。
      • 受害系统: 仅经输入查询访问的远程MoE LLM服务。作者称目标API可能在规模、专家数、层深、路由设计、安全微调、系统提示词和部署时过滤上不同于代理。
  2. 有哪些相关研究?

    相关工作包括通用越狱、需改模型的MoE路由攻击、BadMoE后门和路由侧信道;基线为GCG与FFA等。

    通用越狱

    • 提示工程: Jailbroken(Wei et al., 2023)、FFA(Zhou et al., 2024)、WildPrompt(Shen et al., 2024)用角色扮演、假设场景或指令混淆绕过对齐,不改模型、不做显式优化。
    • 优化攻击: GCG(Zou et al., 2023)按坐标用梯度替换token,最大化目标不安全回复的对数概率。
    • 防御: RLHF(Ouyang et al., 2022)和DPO(Rafailov et al., 2023)在训练时加入安全偏好;部署时有内容过滤和外部护栏(Dong et al., 2024;Llama Guard, Inan et al., 2023)。论文称这些努力之后越狱仍然有效,MoE路由又增加攻击面。

    需改模型的MoE路由攻击

    • 路由改写: Fayyaz et al.(2025)、Jiang et al.(2026)、SafeX(Lai et al., 2025)和GateBreaker(Wu et al., 2025)在推理时改路由分布:硬掩码去掉专家,或用有限扰动重加权;有的还做神经元级掩码。论文指出它们假设能访问并修改路由logits和专家函数,主要适用于本地模型。
    • 强对齐画像: GateBreaker用有害查询探测拒答式续写时被激活的专家。作者认为只避开这些专家,在仅输入约束下往往过刚,也不保证激活愿意生成目标内容的专家。

    输入设计、侧信道与服务级路由

    • BadMoE(Wang et al., 2025): 找很少激活的专家,用路由感知损失优化触发器,再微调注入后门。论文称这是最接近的输入设计工作,但需要改模型,目标是后门而非仅输入越狱。
    • 路由副作用: Hayes et al.(2024)讨论跨batch路由使对抗查询影响同批其他输入,或造成拒绝服务式过载;Yona et al.(2024)利用路由平局打破抽取用户提示词。论文称本文不依赖跨输入交互或侧信道观测。
    • R2A(Tang et al., 2026): 黑盒攻击代价感知的模型路由,训练代理路由器并优化通用对抗后缀,把查询导向高成本模型。论文称那是服务级选模型,目标是推理成本,不是单模型内部选专家来诱导不安全生成。

    基线与基准

    • 基线: Direct Instruction、GCG、FFA、Jailbroken、WildPrompt;组合变体Misrouter+FFA是在FFA生成的提示词上再跑Misrouter。GCG与Misrouter在同一代理上优化,其余提示工程基线不需要代理。
    • 基准: 主评测为AdvBench与StrongREJECT。附录D的效用分析使用CoLA、RTE、WinoGrande、OpenBookQA和ARC Challenge。

    作者把本文与需改模型的路由攻击、需微调的BadMoE以及服务级R2A分开:只改输入,在开源代理上白盒优化后迁到同家族远程API。

  3. 论文如何解决这个问题?

    Misrouter在代理上用对比激活塑形路由,两阶段优化前缀后再迁到同家族API。

    Misrouter在开源代理上先画像路由,再优化固定长度的对抗前缀,使输入偏向攻击有利的专家,并提高目标不安全续写的概率,最后把前缀迁到同家族API。Figure 1将流程画成数据构造、路由画像、提示词优化和攻击执行四段。

    数据与路由画像

    • 三套数据: Dharm是原始有害查询,用来找与强对齐、拒答式续写相关的激活。Dcomp把有害查询与顺着有害意图的不安全续写拼接,并加入语义改写、对抗扰动和语境重构,用来找愿意顺从的弱对齐专家。Dbenign是常规问答,用来找高能力通用专家。附录C写Dharm来自留出集,共4500条,取自Categorical HarmfulQA、Harmful Dataset、HarmfulQA和JailBreakV,不用于最终评测;Dcomp由这些查询配对而成;Dbenign从Natural Questions抽样,论文未给出条数。
    • 估计: 每个数据集抽S个大小为m的子集,用专家进入TopK的频率估计激活,再对S次取平均。固定配置未给出S和m。路由概率由logits经softmax得到,可按层和token位置聚合。
    • 分数: 最小化由ΔU加权的路由概率。定义为 Δ Ui=λ1Ūi(Dharm)−λ2Ūi(Dcomp)−λ3Ūi(Dbenign)。Dharm上常激活的专家分数更高,对应强对齐,应被压低;Dcomp或Dbenign上常激活的专家分数更低,优化时被鼓励。三个λ均大于0。可选地取TopK抑制集和BottomK提升集;默认用完整向量,作者认为比硬掩码更平滑。附录A的Algorithm 1汇总该过程。

    两阶段优化

    • 前缀: 给定有害查询x和ΔU,构造长度L的前缀δ,输入为δ接上x。攻击者不直接改路由logits。
    • 阶段一: 只最小化各专家ΔU与路由概率的乘积之和,做T1次基于梯度的token更新,作用在前缀的token embedding上。作者的理由是先到达可行路由区,避免输出目标干扰。
    • 阶段二: 输出损失沿GCG,对目标不安全续写的逐token对数概率取负再求和。联合目标为 L=α Lout+β Lroute。路由项作为正则,防止提示词漂回强对齐专家,共T2次更新。附录A的Algorithm 2给出该过程。
    • 固定配置: 附录C写主实验除非另有说明,λ1、λ2、λ3为1.0、0.5、0.5,α为1.0、β为0.5,L为10,总迭代T为500,T1与T2各250;另写k为15%或25%,未说明各实验用哪一个。这些值来自预实验,主评测保持不变。

    迁移与成功条件

    • 执行: 前缀与原查询拼接后,经普通查询接口提交目标API。攻击者看不到目标的路由logits、被选专家或其他内部状态。作者认为路由比完整输出分布更低维,同家族迁移可能好于直接拟合代理输出的GCG。
    • 成功条件: 选中专家子集落在攻击有利集合中,回复属于违反策略的集合,且信息量不低于阈值τ。论文未给出τ的数值。实验中的成功与否由ASR判定。
  4. 论文做了哪些实验?

    白盒、灰盒、黑盒均有评测;作者称路由优化带来额外攻击能力,但单独Misrouter并非每格都高于基线。

    实验设置

    • 模型: 白盒目标即代理,Table 1记为GPT-OSS、Qwen3、Phi-3.5、Mixtral、Qwen1.5、Deepseek;Table 7全名为GPT-OSS-20B、Qwen3-30B-A3B-Instruct-2507、Phi-3.5-MoE-Instruct、Mixtral-8x7B-Instruct-v0.1、Qwen1.5-MoE-A2.7B-Chat、DeepSeek-MoE-16B-Chat。黑盒API为GPT-4o mini、Qwen-Plus、Phi-4、Mistral-Large-2512、Qwen-Turbo、DeepSeek-Chat-V3-0324,代理为同表同家族模型。灰盒学生模型(Table 8)为ANITA-NEXT-20B-gpt-oss-ITA、Qwen3-Coder-30B-A3B-Instruct、Phi-3.5-MoE-GSM8K、notux-8x7b-v1、Qwen1.5-MoE-A2.7B-Wikihow、Deepseek-MoE-16b-GSM8K。
    • 数据与基线: AdvBench与StrongREJECT;灰盒只用AdvBench。论文未报告两基准的评测条数。基线为Direct Instruction、GCG、FFA、Jailbroken、WildPrompt,以及叠在FFA上的Misrouter+FFA。
    • 指标: ASR是被判为unsafe或违反策略的查询比例。开源模型另报routing loss,即ΔU与路由概率的加权和。Table 4另有Refusal Rate,论文未给出计算式。
    • 评审: 分类器为Llama-Guard-3-8B。论文未写阈值,未报告重复次数或与人工的一致性。主实验使用附录C的固定配置,除非另有说明。

    主结果

    黑盒AdvBench的ASR(Table 2)。

    表格较宽,可左右滑动

    服务FFAJailbrokenWildPromptMisrouterMisrouter+FFA
    GPT-4o mini2.0%12.0%0.0%0.0%18.0%
    Qwen-Plus0.0%0.0%4.0%0.0%6.0%
    Phi-40.0%0.0%0.0%6.0%10.0%
    Mistral-Large-251292.0%86.0%96.0%10.0%96.0%
    Qwen-Turbo20.0%20.0%22.0%8.0%26.0%
    DeepSeek-Chat-V3-032496.0%30.0%32.0%2.0%96.0%
    • 作者解读: 作者称组合方法在基线偏低或中等的服务上提供额外攻击能力,并在摘要中称黑盒平均ASR从20.8%到39.7%。单独Misrouter在上表多低于提示工程基线;Mistral-Large-2512上组合方法与WildPrompt持平。
    • StrongREJECT: Table 2中GPT-4o mini上Jailbroken为11.7%,Misrouter+FFA为5.0%,与FFA相同。Qwen-Plus上组合方法为8.3%,作者称相对Jailbroken的3.3%为2.5×。Phi-4上二者同为3.3%。
    • GCG: AdvBench六服务均为0.0%。StrongREJECT上仅Qwen-Turbo与DeepSeek-Chat-V3-0324为1.7%,其余0.0%。作者认为一种可能是GCG拟合代理的完整输出分布,而路由是更低维的部件。

    白盒:代理即目标

    • ASR: 作者称Misrouter与Misrouter+FFA一致强于基线。按Table 1,组合方法各格高于同表基线;单独Misrouter并非如此。AdvBench上Mixtral的Misrouter为22.0%,低于Jailbroken的78.0%;Deepseek为62.0%,低于FFA的98.0%。
    • GPT-OSS: 作者称最强基线在AdvBench为2.0%、StrongREJECT为3.3%,Misrouter为24.0%与11.7%,并称相当于12.0×与3.5×。
    • routing loss: 作者称Misrouter低于GCG,并认为提升来自路由操纵。Table 1六模型、两数据集均低于GCG;也有提示工程方法更低,例如AdvBench上Mixtral的Jailbroken为8.00,Misrouter为9.19。作者认为更低的routing loss不一定对应更高ASR。

    灰盒:基座到微调变体

    • 设置: 代理与目标共享架构和初始参数,目标再做下游微调。只评AdvBench。Table 8的应用包括意大利语、代码、数学、人类偏好、通用知识和指令向知识任务。
    • 结果: Table 3的Misrouter+FFA为GPT-OSS 30%、Qwen3 14%、Phi-3.5 80%、Mixtral 94%、Qwen1.5 100%、Deepseek 94%。作者称GPT-OSS上相对FFA的6%为5×,Phi-3.5上相对Jailbroken的32%为2.5×。正文把这两对写成6.0%与30.0%、32.0%与80.0%。
    • 例外: 单独Misrouter在Qwen3为2%,低于WildPrompt的10%;Mixtral为22%,低于FFA的88%。作者认为灰盒比黑盒更容易迁移,因为专家数、层结构和初始化更一致。

    防御

    • 做法: 一是对有害查询上很少激活的专家做额外安全训练;二是提高强对齐专家的路由logits。论文未给出该实验的放大系数和k。作者认为前者开销大且与专家分工相冲突,后者会干扰专家分工并降低效用。
    • 数字: Table 6未写模型。无防御时AdvBench ASR 96.0%、routing loss 3.78,StrongREJECT为80.0%与3.86;加强弱专家后为30.0%与3.64、26.7%与3.70;放大强专家后为44.0%与6.26、41.7%与6.26。
    • 作者解读: 作者称两种策略都不能有效缓解Misrouter。Table 6里两种防御的ASR都低于无防御一行。

    其他消融与分析

    • 路由目标(Table 4,Qwen1.5,直接掩码而非优化提示词): 仅Uharm的AdvBench ASR/拒答率为14.0%/92.0%,StrongREJECT为31.7%/76.7%;加入良性信号后为26.0%/64.0%与50.0%/41.7%;三信号为62.0%/12.0%与76.7%/13.3%。
    • 优化目标(Table 5,Qwen1.5,ASR/routing loss): 只优化Lout为76.0%/3.91与63.3%/3.91;只优化Lroute为36.0%/3.52与21.7%/3.60;从头联合为88.0%/3.91与73.3%/3.89;先路由后只优化输出为88.0%/3.87与75.0%/3.88;两阶段为96.0%/3.78与80.0%/3.86。作者称从头联合表现差;该格AdvBench ASR高于只优化输出,低于两阶段,routing loss高于只优化路由。
    • 效用(Table 9、附录D): 掩码按Ubenign排序最高的10%专家。作者称六模型五任务平均准确率从60.3%到40.3%。表中任务平均:CoLA 53.6%到10.5%,RTE 80.4%到61.4%,WinoGrande 70.9%到61.3%,OpenBookQA 41.8%到27.1%,ARC 55.0%到41.4%。
  5. 有什么可以进一步探索的点?

    作者指出GCG式提示词可能不自然、黑盒迁移可能较弱,并计划重排序与多代理。

    作者指出的局限与后续方向

    • 统一骨干: 第6节写,为公平比较,白盒、灰盒、黑盒统一用GCG式优化;该设计在代理与目标相同或接近时尤其有效,但可能生成不那么自然的提示词。
    • 黑盒迁移: 第6节写,目标服务与代理差异很大时,GCG式优化的迁移可能较弱。
    • 重排序变体: 第6节提出,可把路由目标只当作FFA等提示工程方法所生成提示词的选择或重排序信号,而不是直接做token优化。
    • 多代理: 第6节写,当前每个目标服务用一个同开发者或同家族代理;后续可在多个代理上优化或选择提示词,以得到更不依赖特定模型的路由感知提示词。
    • 防御: 第7节称,专家级对齐或路由偏置防御的缓解有限,需要更稳健的路由感知防御。

    实验覆盖范围

    • 评测分三档:白盒六对代理即目标,AdvBench与StrongREJECT;灰盒Table 8六对基座到微调,只用AdvBench;黑盒Table 7六对代理到API,两个基准都用。
    • 对照为Direct Instruction、GCG、FFA、Jailbroken、WildPrompt和Misrouter+FFA。主指标为ASR,开源模型另报routing loss;分类器为Llama-Guard-3-8B。黑盒API不暴露路由,论文因此不在API上报告routing loss。
    • 第5.5、5.6节把代理和目标都固定为Qwen1.5。前者直接掩码三种路由目标,后者比较五种损失组合(Table 4、Table 5)。
    • 防御结果在Table 6,含两种专家级干预的ASR与routing loss。附录D在六个开源MoE上掩码Ubenign最高的10%专家,任务为CoLA、RTE、WinoGrande、OpenBookQA和ARC。
    • 论文未报告评测样本量、重复次数、Llama-Guard-3-8B与人工判定的一致性,以及Table 6的模型和放大强度。
  6. 总结一下论文的主要内容

    仅输入的MoE路由攻击:代理上两阶段塑形路由,再迁到同家族API,与FFA组合后若干设定ASR更高。

    Misrouter是面向远程MoE服务的仅输入攻击:在同家族开源代理上操纵路由,再把提示词迁到只接受查询的API。

    • 问题: 作者称已有路由攻击要改模型,不能自然扩展到公共API。成功标准是回复既非拒答,又对有害查询足够有信息量。
    • 方法: 用有害查询、有害顺从序列和良性问答给专家打路由分数,压制强对齐、提升弱对齐和高能力通用专家;先只优化路由,再在路由正则下提高目标不安全续写的概率。Misrouter+FFA把该优化叠在FFA提示词上。
    • 黑盒: 六个API、两个基准,由Llama-Guard-3-8B判ASR。作者称组合方法相对代表性基线的平均ASR从20.8%到39.7%。Table 2里GPT-4o mini的AdvBench上组合方法为18.0%;StrongREJECT上Jailbroken为11.7%,组合方法为5.0%。AdvBench上GCG六服务均为0.0%。
    • 另外两档: 白盒GPT-OSS上,作者称Misrouter的ASR为AdvBench 24.0%、StrongREJECT 11.7%,最强基线为2.0%与3.3%。灰盒AdvBench上,Table 3的组合方法在GPT-OSS为30%、Phi-3.5为80%,作者称相当于5×与2.5×。
    • 结论: 作者称路由感知攻击可以迁移,也能与已有越狱组合;专家级对齐或简单路由偏置的缓解有限。Table 1至Table 3里,单独Misrouter有多格低于FFA或WildPrompt。
阅读原文arxiv.org