跳到正文
原文
论文追踪· arXiv:2610.02910·本站收录 · 原文发表

论文提出用路由梯度敏感度定位稀疏 MoE 模型中的安全敏感专家

Frequency Is Not Sensitivity: Identifying Safety-Sensitive Experts in Sparse MoE LLM

AI 导读

论文指出,抑制稀疏 MoE 大语言模型中少量被路由的专家即可在不重训练的情况下削弱其安全行为,而常用的激活频率只反映使用程度、不反映影响力。作者改用路由梯度敏感度,即序列损失对选择专家的门控权重的敏感度,在五种 MoE 架构上分别用 500 条良性提示和 500 条恶意提示对专家排序,并在 100 条留出恶意提示上测量拒答率,采用相同专家数量和相同恶意路由流量(1%-5%)两种预算。在两种预算下,路由梯度选择在 25 种条件中的 24 种比激活频率带来更大拒答下降,在全部 25 种中超过十次随机试验的均值。效果最大的是 OLMoE,拒答从 100 条中的 34 条降至 9 条(相对下降 73.53%),且输出质量未退化。逐层匹配专家数量后,梯度选择仍在 25 种条件中的 23 种优于激活频率,另有 2 种持平。

阅读原文arxiv.org