跳到正文
原文
arXiv· arXiv:2610.01058· Boyang Li, Bingyu Shen, Weihao Hong, Zhiyuan Jiang, Xinlei Guan, Yan Ma, Miles Q. Li, Yi Sheng, Ruiyang Qin·本站收录 · 原文发表

MOMAT:面向量化 LLM 低功耗越狱防御的多图集混合框架

MOMAT: Mixture of Multiple Atlases for Low-Power Jailbreak Defense of Quantized LLMs

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

MOMAT 用多 atlas 检索加轻量 MoE 与 CiM,把 W4A8 的 Llama2-7B 和 Mistral-7B 在 AdvBench、Malicious 上的 ASR 降到 0.0%,且 FRR 不变。

威胁模型边缘设备上的量化 LLM(qLLM)面对越狱与提示注入:攻击经普通用户接口、无需特权即可发起;防御用冻结编码器做 atlas 检索与 MoE 判定,有害则返回安全模板,否则交给 qLLM。

问题
量化让边缘 qLLM 更省资源,但会削弱对齐,使其更容易被越狱和提示注入绕过;单体安全 RAG 又受维度灾难和内存带宽限制。
方法
MOMAT 把有害/良性样本与策略模板分成多个语义 atlas,用冻结的 BGE 编码器取 1024 维嵌入,CiM 做各 atlas 的 top-k 检索,轻量 MoE(1.03M 参数)给出有害概率,超过阈值则从最激活 atlas 取安全回复模板。
实验与结果
W4A8 下 MOMAT 把 Llama2-7B 与 Mistral-7B 在 AdvBench 和 Malicious Instruct 上的 ASR 降到 0.0% 或 0.00%,FRR 相对无防御不变。CiM 把 100-query 批检索从 15,052.44 ms 降到 3,207.21 ns,能量从约 8.1×10^7 μJ 降到 3.32 μJ;作者称二者测量层级不同,不宜直接比绝对值。
局限与可以继续做的
作者计划做自适应 atlas,并扩展到更多量化方案和端侧环境;将发布 223.2k 样本数据集。安全评测主要是 Llama2-7B 与 Mistral-7B 的 W4A8,在 AdvBench 与 Malicious Instruct 上对比若干防御;CiM 数字来自电路级仿真,RPi 能量为板级估计。
实验设置Llama2-13B、Llama2-7B 等 · AdvBench、Malicious Instruct · ASR、FRR 等
威胁模型
边缘设备上的量化 LLM(qLLM)面对越狱与提示注入:攻击经普通用户接口、无需特权即可发起;防御用冻结编码器做 atlas 检索与 MoE 判定,有害则返回安全模板,否则交给 qLLM。论文未使用 white-box/black-box 等标签。
模型
Llama2-13BLlama2-7BMistral-7B
基准
AdvBenchMalicious Instruct
指标
ASRFRRp95 end-to-end latencyenergy per query
AI 导读全文 366 字

研究者提出 MOMAT(Mixture of Multiple Atlases),一种面向边缘设备上量化大语言模型的硬件增强安全框架,用于缓解量化削弱对齐防护后模型易被越狱攻击的问题。每个 atlas 对应有害或良性样本集与策略模板的语义聚类,实现领域局部化的 RAG 防护,以缓解大规模异构安全数据库中的维度灾难与语义稀疏问题。MOMAT 对每个提示词从所有 atlas 中检索 top-k 相似特征,交由轻量 MoE 检测器判断,并用 CiM 加速的相似度引擎完成低功耗图集内检索。其 CiM 检索将 100 条查询的批处理从 15,052.44 ms 加速到 3,207.21 ns,能耗从 8.1×10^7 μJ 降至 3.32 μJ,相比基于 DRAM 的 Raspberry Pi 基线约降低 2.5×10^5 倍能耗。

深度解读

6 个问题,约 9,200 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    量化削弱边缘 qLLM 的对齐,单体安全 RAG 又慢又吵;MOMAT 用分域 atlas、MoE 与 CiM 做低功耗防御。

    量化后的大语言模型在边缘设备上更容易被越狱和提示注入绕过,而现有安全检索既受维度灾难影响,也难满足端侧时延与能耗。

    • 场景与重要性:作者认为量化能减小模型体积、时延和能耗,因而 qLLM(quantized large language models)越来越多地部署在边缘和嵌入式设备上;但权重量化会扭曲表示几何、压缩安全相关子空间,激活裁剪会进一步加重,使模型更难拒绝不安全输入。作者称边缘 qLLM 比全精度云端模型脆弱得多,且多数没有专门的安全机制;云端常用的多模型安全流水线和服务器侧过滤又受资源限制,难以搬到边缘。
    • 现有方法的不足:作者讨论用 RAG 检索拒绝模板或策略约束来缓解越狱,但安全库变大、有害意图变杂时,嵌入空间变稀疏,维度灾难使语义无关样本到查询的距离相近,关键查询可能检不到正确样例,对手也可利用这种检索噪声绕过模板匹配。边缘设备还缺少高容量向量检索所需的内存带宽。作者认为把语义相距很远的领域放进同一索引会带来跨域干扰,DRAM 向量检索的反复数据搬运也不适合边缘上的实时安全执行。
    • 核心观察:作者称把安全检索改成域局部的 atlas,并用 compute-in-memory 加速相似度搜索,可以在满足边缘时延和能耗的同时,恢复量化损失的对齐鲁棒性。更小的 7B 模型在压缩后更适合边缘,也更易出现对齐崩溃,这构成压缩与安全容量之间的张力。
    • 本文提出:作者提出 MOMAT(Mixture of Multiple Atlases),把有害与良性样本及策略模板组织成多个语义 atlas,用轻量 MoE 检测器融合各 atlas 的 top-k 相似特征,并用 CiM 加速的相似度引擎做低功耗、atlas 局部检索。作者计划发布完整的 223.2k 样本数据集。
    • 威胁模型:
      • 攻击者目标:迫使模型生成有害或违反策略的内容,包括角色扮演、多轮引导、翻译混淆、对抗改写,以及覆盖系统消息、反转安全规则或劫持上下文样例的提示注入。
      • 攻击者知识与能力:作者称多数越狱不需要特权访问,可通过标准用户接口发起;论文未使用 white-box、black-box 或 no-box 等术语。防御侧不修改被保护 qLLM 的权重,提示编码与 qLLM 解耦。
      • 受害系统:部署在边缘、通常没有辅助安全模型、服务器侧监控或高带宽检索模块的量化 LLM。实验中的量化设置为 W4A8,主要被防御模型为 Llama2-7B 与 Mistral-7B。
      • 成功判定:ASR 为对抗提示中成功引出有害回复的比例,越低表示越难被越狱;FRR 为被错误拒绝的良性查询比例。有害判定为 MoE 输出的 p_harm 不低于阈值 τ,此时从最激活 atlas 取安全回复模板,否则把提示交给底层 qLLM。
  2. 有哪些相关研究?

    相关讨论集中在量化导致的对齐崩溃、越狱与提示注入、安全 RAG 的维度灾难,以及边缘约束下的 CiM。

    论文没有单独的 Related Work,相关工作写在引言和 Background。

    量化与对齐崩溃

    • Lin et al. (2024)、Xiao et al. (2023a)、Wu et al. (2023):量化通过权重量化和激活量化降低精度,以减小体积、时延和功耗;实验中的 W4A8 引用 Wu et al. (2023)。
    • Touvron et al. (2023)、Lee (2025)、Zhang et al. (2025)、Wei et al. (2024)、Zhao et al. (2024)、Xu et al. (2024)、Qi et al. (2025):作者用这些工作说明全精度模型靠高维对齐特征维持安全边界,而激进量化会引入激活离群带来的量化误差、破坏编码安全信息的低秩子空间,并损伤用于区分恶意查询的“安全层”。
    • Kharinaev et al. (2025)、Egashira et al. (2024)、Li et al. (2025)、Hong et al. (2024)、Yi et al. (2025):作者据此讨论量化削弱对齐鲁棒性,以及边缘 qLLM 比全精度云端对应模型更易受攻击、又往往没有专门安全机制。

    越狱与提示注入

    • Deng et al. (2024)、Walker et al. (2025):把越狱和提示注入描述为利用模型对自然语言线索的依赖、而非形式化安全保证,从而诱使其生成有害或违规内容。
    • Li et al. (2024)、Zhou et al. (2024)、Guo et al. (2024)、Russinovich et al. (2025)、Ren et al. (2024):作者列举角色扮演与人格劫持、多轮上下文引导、基于翻译的混淆,以及对抗改写指令;并称量化后的模型对语言变化更不稳健。
    • Hong et al. (2026)、Jiang et al. (2026):作者称其先前工作显示,即使没有对抗意图,语言压力也能在视觉语言模型中诱发幻觉,并认为顺从驱动的编造是更广的跨模态现象。

    安全 RAG 与检索结构

    • Wang et al. (2025)、Walker et al. (2025):用检索拒绝模板、安全样例或策略片段来提高 LLM 安全性。作者认为库变大且语义混杂时,该方法变差。
    • Kouiroukidis and Evangelidis (2011):作者引用其关于维度灾难使高维 kNN 中无关向量距离趋同、从而损害最近邻可靠性的讨论。
    • Xiao et al. (2023b):MOMAT 使用冻结的编码器 BAAI/bge-large-en-v1.5(0.3B 参数)产生 1024 维嵌入;作者称该组件可替换,且独立于被防御的 qLLM。

    边缘约束与 CiM

    • Friha et al. (2024)、Chen et al. (2025)、Ko et al. (2025)、Horowitz (2014)、Sharma et al. (2025):作者用这些工作说明边缘平台在内存容量、带宽和能耗上的约束,以及 DRAM 向量检索中数据搬运主导能耗、形成 memory wall。
    • Ali et al. (2022)、Yin et al. (2024)、Qin et al. (2024)、Yu et al. (2021):CiM 在存储阵列内做 MAC,最近邻搜索可归结为向量–矩阵乘法;作者称相对 DRAM 设计可在时延和每查询能量上有数量级下降。
    • Ambrogio et al. (2018):作者称先前硬件研究已经确立 CiM 阵列中外围访问相对计算时间占主导。

    基线方法包括 Figure 2 中的 Self-Examine、Retokenization(Retok.)、Self-Reminder、SafeDecoding 和 MoGU,以及无防御(None / “-”)。基准为 AdvBench(Zou et al., 2023)和 Malicious Instruct(Huang et al., 2023)。作者把本文定位为:把安全检索重组成多个语义一致的 atlas,以减轻维度灾难和检索噪声,并用 CiM 在边缘约束下做低功耗相似度搜索;作者称 MOMAT 在标准越狱基准上达到 state-of-the-art 防御表现,同时避免对良性查询的额外过度拒绝。

  3. 论文如何解决这个问题?

    离线用 ICL 建多个语义 atlas 并训练冻结嵌入上的轻量 MoE;在线用 CiM 做全 atlas top-k,再按阈值决定放行或套安全模板。

    MOMAT 把单体安全库拆成多个语义 atlas,离线建库并训练轻量 MoE,在线用冻结编码器加 CiM 检索做有害判定;判定为有害时从最激活 atlas 取安全回复模板,否则把提示交给 qLLM。

    问题设定与系统模块

    • 解耦编码:输入由冻结的 encoder-only 模型 E(BAAI/bge-large-en-v1.5,0.3B 参数)编成 1024 维嵌入,全程不更新,只服务于安全处理,可换成其他嵌入模型,与被防御 qLLM 无关。
    • 四个模块:CiM 检索模块为每个查询从每个 atlas 计算 top-k 相似特征;atlas 安全库在专用 CiM 阵列中保存有害样例与良性对应物;轻量 MoE 意图检测器把提示嵌入与 atlas 特征拼在一起,给出二值安全决定;CiM 加速的 RAG 引擎同时负责为 MoE 提供特征,并在检出有害时在阵列内检索安全回复模板。
    • atlas 数量:设计上可以是 M=2 的有害/良性二分,也可以是 M>2 的细类(作者举例 violence、hate speech、self-harm、benign),或粗细结合的层次结构。Figure 1 的在线示意写出 A_benign 与 A_harm。论文未在实验节写明实际使用的 M。
    • 两阶段摊销:离线完成语料处理、语义聚类和多阶段 ICL 扩展;在线只做一次嵌入、各 atlas 的 CiM 检索和一次紧凑 MoE 前向,有害时再做第二次针对性 CiM 检索。Figure 1 称该 MoE 为 1.03M 参数,且嵌入冻结。

    Atlas 构建

    Algorithm 1 分三步,输入为种子集 S0、ICL 生成器 G 和 atlas 数 M。

    1. 跨域展开:对每个种子用 G 生成跨域的有害–良性对,得到 S1。
    2. 递归变体:对每个配对做改写、句法变化、语义抽象和细节扩展,得到稠密变体集 S2。
    3. 组装:按展开路径上固有的域标签把样本放入对应 atlas。

    作者称这些高密度邻域降低检索噪声,并与 CiM 上的相似度搜索相合;划分多个 atlas 是为避免语义无关域共享一个索引时的高维干扰。嵌入和统计量离线预计算。

    检索特征与 MoE 检测

    对查询 x,嵌入为 e_x。每个 atlas A_i 用 CiM 取 top-k 相似度,记为 s_i(x)∈R^k。特征 z(x) 包含四类信息:原始嵌入 e_x;各 atlas 的原始相似度;每库的均值、最大值、最小值;atlas 对之间的均值差、最大值差和均值比 ρ_ij=μ_i/(μ_j+ε)。维度为 D=d+M·k+3M+3·C(M,2)。

    K 个 MLP 专家(作者写 typically K=3 to 5)各自输出 logit s_j(x)=f_j(z(x))。门控只看 e_x:α_j(x) 为 softmax(w_j^⊤ e_x+b_j)。风险估计为门控加权和,再经 sigmoid 得到有害概率:

    S(x)=∑j=1Kαj(x) sj(x),  p(y=1∣ x)=σ(S(x))

    含义是:最终 logit 是各专家分数的混合,sigmoid 后为有害概率。训练用二元交叉熵 L_cls,另加门控均衡项 L_balance,使各专家平均路由权重接近 1/K,总损失为 L=L_cls+λ_balance L_balance。作者称嵌入保持冻结,学习的是如何解释多 atlas 检索揭示的结构,而不是微调嵌入。论文未报告 λ_balance、τ、k 的训练取值、优化器和数据划分;硬件实验里 top-k=10。

    在线推理与 CiM 引擎

    Algorithm 2:先算 e_x,再对全部 M 个 atlas 做 LOCALRETRIEVALSUMMARY 得到 r_i(x),拼成 z(x),由 MoE 得到 p_harm。若 p_harm<τ,调用 qLLM 生成;否则取 i⋆=arg max_i r_i(x),在该 atlas 内做第二次 top-k 检索,SELECTTEMPLATE 选出模板,SAFECOMPOSE 结合原提示与 qLLM 生成合规回复。

    CiM 把每个 atlas 存成预载入阵列的向量矩阵,在阵列内做点积 MAC,不把数据移出芯片。作者称样例嵌入常驻阵列,因此两次 CiM 过程在推理时都不做 DRAM 数据搬运。Raspberry Pi 5 上的对照仍走 DRAM 检索,CiM 板则用 4-bit/8-bit 存内 MAC 阵列,控制流相同。

    指标含义

    ASR 是对抗提示中成功引出有害回复的比例;FRR 是良性查询被错误拒绝的比例。作者还报告 p95 端到端时延和每查询能量,但 Table 3、Table 4 给出的是检索批时延与能量,论文未在这些表中单独列出 p95 数值。

  4. 论文做了哪些实验?

    W4A8 下 MOMAT 将 Llama2-7B 与 Mistral-7B 的 ASR 降到 0,FRR 不变;CiM 仿真相对 RPi DRAM 批检索快约 4.69×10^6 倍。

    实验设置

    • 被测模型:Table 1 含 Llama2-13B 与 Llama2-7B 的 FP16 和 W4A8;防御主实验为 W4A8 的 Llama2-7B 与 Mistral-7B。第 4.1 节称实验使用 Llama-2-7B 和 Mistral-7B 两种 qLLM。
    • 数据集:AdvBench(Zou et al., 2023)和 Malicious Instruct(Huang et al., 2023)。红队使用与 atlas 分类对齐的域相关有害指令,作者举例 weapons、self-harm、privacy violations。论文未报告这两套基准的样本条数。摘要称将发布的数据集为 223.2k 样本;Table 3 的 DRAM 扫描使用 162,084 条 1024 维向量。
    • 硬件:Raspberry Pi 5 上跑完整 MOMAT,但检索仍受 DRAM 限制,用于分离结构化检索的效果;CiM 评估板上控制流相同,检索改为 4-bit/8-bit 存内 MAC。论文未报告安全 ASR/FRR 是在哪块板上测得。
    • 防御基线:Figure 2 在 W4A8 Llama2-7B 上比较 None、Self-Examine、Retokenization、Self-Reminder、SafeDecoding、MoGU 与 MOMAT。Table 2 只比较无防御与 MOMAT。
    • 指标:ASR、FRR、p95 端到端时延、每查询能量。ASR 越低表示越狱抵抗越强,FRR 越低表示越少过度拒绝。良性查询由 GPT-4o-mini 合成,与对应对抗查询同主题、但只请求无害信息;论文未报告条数、人工复核或与人工的一致性。
    • 硬件设置:Table 3、Table 4 为 1024 维、top-k=10。Table 3 的时延为 10 次运行平均。论文未报告安全实验的重复次数、τ、攻击辅助模型或评审模型。

    主结果

    据 Table 1、Table 2 与 Figure 2。Figure 2 的无防御 Malicious 为 25.0%、AdvBench 为 28.1%,与 Table 1 的 FP16(Malicious 25.0、AdvBench 28.1)及 Table 2 的 W4A8 无防御(28.0 与 32.5)不是同一组数字;Figure 2 图注写的是 W4A8。

    表格较宽,可左右滑动

    模型设置AdvBench ASRMalicious ASR出处
    Llama2-7BFP16,无防御列28.1%25.0%Table 1
    Llama2-7BW4A8,无防御32.5%28.0%Table 2
    Llama2-7BW4A8 + MOMAT0.00%0.00%Table 2
    Mistral-7BW4A8,无防御68.2%67.5%Table 2
    Mistral-7BW4A8 + MOMAT0.00%0.0%Table 2
    Llama2-13BFP16 → W4A89.0% → 8.3%(Δ −0.7)21.0% → 19.0%(Δ −2.0)Table 1
    • 量化与规模:作者称 13B 在量化后 ASR 变化可忽略,7B 在两个数据集上 ASR 上升(AdvBench Δ=+4.4 个百分点,Malicious Δ=+3.0 个百分点)。作者认为 13B 的 FP16 体积为 26.03 GB(W4A8 为 7.00 GB),不适合多数边缘硬件;7B 在 W4A8 下为 3.76 GB,却是更易对齐崩溃的规模。
    • 防御后的 ASR 与 FRR:作者称 MOMAT 在两个模型和两个数据集上都把 ASR 降到 0.0%(Table 2 中三处为 0.00%、Mistral-7B 的 Malicious 为 0.0%)。FRR 保持不变:Llama2-7B 为 AdvBench 13.3(+0.0)、Malicious 14.0(+0.0);Mistral-7B 为 12.7(+0.0)和 17.0(+0.0)。作者认为这说明没有引入额外过度拒绝。
    • 与其他防御:Figure 2 上,作者称无防御时 AdvBench 28.1%、Malicious Instruct 25.0%;Retokenization 在 Malicious Instruct 上仍有 4.5% ASR,Self-Examine 在同一数据集上留下 0.5%;MOMAT 与 Self-Reminder、SafeDecoding、MoGU 在两个数据集上都是 0.0%。作者称 MOMAT 不在生成时做 token 级干预,因此更适合时延和功耗受限的边缘部署;论文未报告这些基线的时延。Figure 2 的 AdvBench 一行在 None 之后的各防御格均为 0.0。

    检索时延:Raspberry Pi 5 的 DRAM

    Table 3 在 162,084 条向量、1024 维、top-k=10、100-query 批上扫描 DRAM 窗口,时延为 10 次平均。500 条向量(1.95 MB,325 个 chunk)为 15,052.44 ms,作者标为 Optimal;窗口增到 30,000 条(117.19 MB,6 个 chunk)时为 16,034.05 ms。作者称增大窗口使时延单调变差,并归因于缓存压力和内存流量超过分块次数减少带来的收益。另报 500-query 批需要 84,681.67 ms(每查询 162.85 ms,6.14 QPS),100-query 最优窗口对应每查询 150.52 ms、6.6 QPS。

    CiM 时延与能量

    Table 4:RPi 5 的 100-query 为 15,052.44 ms、6.6 QPS、能量 ≥8.1×10^7 μJ;CiM 的 100-query 为 3,207.21 ns、3.1×10^7 QPS、3.32 μJ;CiM 的 500-query 为 3,213.15 ns、1.6×10^8 QPS、3.32 μJ。正文称 100-query 的 CiM 总能量为 3,321,779.62 pJ(3.32 μJ);500-query 相对 100-query 只增加 5.94 ns 时延和 1.49 pJ 能量。作者称数据库向量一旦写入阵列就常驻,每个查询只做一次模拟 MAC,完成时间由向量维度和阵列配置决定,而不是批大小或语料规模。

    能量对比上,作者称 RPi 5 对 100-query 批的保守板级估计约为 8.1×10^7 μJ,CiM 为 3.32 μJ,约 2.5×10^5× 的下降;摘要写从 8.1×10^7 μJ 到 3.32 μJ,加速为从 15,052.44 ms 到 3,207.21 ns(4.69×10^6×)。作者同时写明:这些数字不宜按绝对值直接比较,因为 RPi 是整板功耗,CiM 来自电路级仿真;DRAM 能量栏注明 “DRAM energy is not measured”。作者仍认为数量级差距明确,并对合理的估计不确定性稳健。

    其他消融与分析

    论文没有单独的消融表。可核对的其他数字如下。

    • Table 1:Llama2-13B 体积 FP16 26.03 GB、W4A8 7.00 GB;Llama2-7B 为 13.38 GB 与 3.76 GB。
    • Table 3 中间窗口:1,000 / 2,000 / 4,000 / 10,000 条向量对应 15,763.70 / 15,788.72 / 15,827.99 / 15,911.68 ms(每 100 查询)。
    • 摘要与结论中的加速和节能与 Table 3、Table 4 的 100-query 数字对应:4.69×10^6× 时延、约 2.5×10^5× 能量。
    • 良性查询由 GPT-4o-mini 按同主题无害请求合成;论文未给出这组查询的 ASR/FRR 以外的细分。
    • 论文未报告改变 M、K、k、τ 或嵌入模型时的 ASR/FRR。
    • Figure 2 与 Table 1、Table 2 的无防御 ASR 不完全一致,论文未解释这一差异。
  5. 有什么可以进一步探索的点?

    作者计划做自适应 atlas,并把评测扩展到更多量化方案和端侧环境;数据集计划发布。

    作者指出的局限与后续方向

    • 能量数字不宜直接比绝对值:第 4.2.3 节写明 Raspberry Pi 估计反映整板功耗,CiM 数字来自电路级仿真,因此不是绝对意义上的直接可比;作者仍认为差距的数量级明确,并对合理估计不确定性稳健。(第 4.2.3 节)
    • 自适应 atlas:Future work 将研究自适应 atlas 构建,以应对演化中的威胁分类。(第 4.2.3 节末尾)
    • 更广的量化与部署:作者称后续将把 MOMAT 的评测扩展到更广的量化方案和端侧部署环境。(第 4.2.3 节)
    • 数据集发布:摘要、贡献列表写 “We will release” 完整的 223.2k 样本数据集,属于计划而非已经完成的发布。(摘要与第 1 节)
    • 论文没有单独的 Limitations 节。结论重申了尺度依赖的对齐崩溃和 MOMAT 的结果,没有另外列出失败案例。

    实验覆盖范围

    • 安全主实验的模型与量化:防御结果写的是 W4A8 的 Llama2-7B 与 Mistral-7B;Table 1 另有 Llama2-13B 与 Llama2-7B 的 FP16/W4A8 体积和 ASR,13B 未做 MOMAT 防御行。(Table 1、Table 2、第 4.1 节)
    • 基准与指标:红队结果报告在 AdvBench 和 Malicious Instruct 上的 ASR 与 FRR;Figure 2 还比较 Self-Examine、Retokenization、Self-Reminder、SafeDecoding、MoGU。(Figure 2、Table 2)
    • 硬件数字的条件:DRAM 扫描是 Raspberry Pi 5、162,084 条 1024 维向量、top-k=10、100-query 批、10 次平均;CiM 为 SRAM、同一向量维度和 top-k,报告 100-query 与 500-query。(Table 3、Table 4)
    • 良性查询的构造:FRR 用的良性查询由 GPT-4o-mini 合成,与对抗查询同主题且只请求无害信息。(第 4.2.2 节)
    • 论文未报告的设置:安全实验的重复次数、判定有害回复的评审方式、阈值 τ、实际 atlas 数 M、专家数 K 的取值,以及 p95 端到端时延的具体数值;Table 4 注明 DRAM 能量未测量。
  6. 总结一下论文的主要内容

    MOMAT 用多 atlas、冻结嵌入上的 MoE 和 CiM 检索,在 W4A8 的 7B 模型上把 ASR 降到 0 且不增加 FRR。

    MOMAT 是面向边缘量化 LLM 的越狱防御:用多个语义 atlas 做局部检索,用轻量 MoE 做有害判定,并用存内计算加速相似度搜索。

    • 问题:作者认为量化缩小了模型并降低时延和能耗,但会破坏安全相关的表示,使边缘上的 qLLM 更容易被越狱和提示注入绕过。单体安全 RAG 在异构大库中受维度灾难和跨域干扰影响,DRAM 检索也难满足边缘带宽与能耗。
    • 方法:离线由种子经 ICL 生成有害–良性对并扩展变体,按域装入 atlas。在线用冻结的 BAAI/bge-large-en-v1.5 得到 1024 维嵌入,CiM 从每个 atlas 取 top-k 特征,MoE(Figure 1 写 1.03M 参数,专家数作者写通常为 3 到 5)输出 p_harm;低于 τ 则交给 qLLM,否则从最激活 atlas 取安全模板再组合回复。训练是二元交叉熵加门控均衡项,嵌入不更新。
    • 安全结果:Table 1 中 Llama2-7B 从 FP16 到 W4A8,AdvBench ASR 从 28.1% 到 32.5%(Δ +4.4),Malicious Instruct 从 25.0% 到 28.0%(Δ +3.0);Llama2-13B 的 Δ 为 −0.7 和 −2.0。Table 2 中 MOMAT 把 W4A8 Llama2-7B 的两套 ASR 都降到 0.00%,Mistral-7B 从 68.2% / 67.5% 降到 0.00% / 0.0%,四处 FRR 的变化都是 +0.0。Figure 2 里 MOMAT 与 Self-Reminder、SafeDecoding、MoGU 同为 0.0%,Retokenization 在 Malicious Instruct 上为 4.5%,Self-Examine 为 0.5%。
    • 效率:Table 3 中 RPi 5 上 100-query、162,084 向量的最优 DRAM 窗口为 15,052.44 ms。Table 4 中 CiM 仿真为 3,207.21 ns、3.32 μJ;作者给出约 4.69×10^6× 的时延降幅和约 2.5×10^5× 的能量降幅,并说明 RPi 是板级估计、CiM 是电路级仿真。
    • 作者的结论:作者认为把检索结构限制在紧凑子空间、并把相似度搜索放到 CiM 上,可以在边缘约束下同时压低 ASR 和不增加过度拒绝;后续将做自适应 atlas,并扩展量化方案与端侧环境,且计划发布 223.2k 样本数据集。
阅读原文arxiv.org