跳到正文
原文
论文追踪· arXiv:2601.04261· Hang Fu, Wanli Peng, Yinghan Zhou, Jiaxuan Wu, Juan Wen, Yiming Xue·本站收录 · 原文发表

针对大语言模型后门指纹的抑制攻击

Inhibitory Attacks on Backdoor-based Fingerprinting for Large Language Models

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

TFA与SVA抑制ensemble后门指纹;Table 2中TFA对IF、C&H、ImF平均ASR为100%。

威胁模型攻击者在未授权取得模型后实施抑制。其完全不知触发策略与指纹信息,且ensemble中每个模型都含指纹。

问题
后门式LLM指纹靠秘密对做版权验证,但现有攻击只针对单模型。LLM ensemble已用于多模型协作,该场景下指纹是否还能被验证,论文称尚未被研究。
方法
TFA在每个解码步收集各模型top-K,用两两交集过滤后再取并,按平均概率选下一个token。SVA让各模型互评候选句的困惑度并投票,以丢掉指纹句。二者不改参数,并设主模型处理平票。
实验与结果
主实验攻击IF、C&H、ImF。Table 2中TFA平均ASR为100%;SVA在ImF上平均78%。Table 3里增量微调和GRI在C&H、ImF上为0%。作者称TFA能保住或超过最好单模型的下游ACC,具体分数未写入正文。
局限与可以继续做的
作者指出SVA在全体模型使用同一指纹技术时ASR下降,且主辅性能差距大时ensemble超不过最好单模型。实验报告了六种主模型列、三种主指纹及附录CTCC,未报告重复次数、下游样本量和查询耗时。
实验设置LLaMA2-7B、LLaMA3.1-8B-It 等 · PIQA、ARC-C 等 · ASR、ACC
威胁模型
攻击者在未授权取得模型后实施抑制。其完全不知触发策略与指纹信息,且ensemble中每个模型都含指纹。目标:(a)全部单模型指纹验证100%失败;(b)ensemble至少达到性能最高的单模型。防御方只能通过API验证各自的版权信息。
被测模型
LLaMA2-7BLLaMA3.1-8B-ItQwen2.5-7BQwen2.5-7B-ItMistral-7B-v0.1Amber-7BLLaMA2-7B-chatLLaMA3.1-8BLLaMA3.2-3B-ItQwen2.5-1.5B-ItLLaMA3.2-1b-It
基准
PIQAARC-CTriviaQAMMLUBoolQANLI
指标
ASRACC
AI 导读研究提出 token filter attack(TFA)和 sentence verification attack(SVA)两种指纹攻击方法,用于评估 LLM 集成场景下后门指纹的鲁棒性。TFA 在每个解码步骤从 token filter 机制构建的统一 token 集合中选取下一个 token,SVA 则通过基于困惑度和投票的句子验证机制过滤指纹响应。实验表明,两种方法在维持集成性能的同时有效抑制指纹响应,性能优于现有最先进攻击方法。

研究提出 token filter attack(TFA)和 sentence verification attack(SVA)两种指纹攻击方法,用于评估 LLM 集成场景下后门指纹的鲁棒性。TFA 在每个解码步骤从 token filter 机制构建的统一 token 集合中选取下一个 token,SVA 则通过基于困惑度和投票的句子验证机制过滤指纹响应。实验表明,两种方法在维持集成性能的同时有效抑制指纹响应,性能优于现有最先进攻击方法。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    ensemble中后门指纹的鲁棒性未被研究,作者提出TFA与SVA来抑制它。

    ensemble场景下,后门式LLM指纹能否仍被验证,此前没有被研究。

    • 场景:作者称LLM已广泛用于商业与研究,训练和部署投入大,知识产权保护需求紧迫。ensemble联合多个模型生成输出,以利用互补能力,已有实际采用。
    • 现有不足:固有指纹依赖模型内在性质,需要完整内省,只提供API时难以使用。后门指纹通常用SFT(全参数或LoRA)嵌入秘密对(x, y)。作者称已有攻击分改参数与不改参数两类,但都针对单模型。
    • 观察:作者认为目标指纹token会以高概率出现在受保护模型的top-K中,其他模型的top-K不含该token;指纹句的困惑度也高于正常句。
    • 提出的方法:不改参数的TFA(解码中过滤token)和SVA(生成后核验句子),用于抑制指纹响应并保住ensemble表现。
    • 威胁模型(Section 3):
      • 防御方:为各模型植入不同的后门验证信息,只能通过API做版权验证。
      • 攻击者目标:使全部单模型的指纹验证100%失败;ensemble至少达到其中性能最高的单模型。
      • 知识:完全不知道触发策略和指纹信息;ensemble里每个模型都含指纹。
      • 前提:攻击发生在未授权取得模型之后。
  2. 有哪些相关研究?

    作者将相关工作分为后门指纹、单模型指纹攻击和LLM ensemble,并称后者仍缺攻击研究。

    论文把相关工作放在指纹构造、单模型攻击和ensemble三类,实验基线另列于下。

    后门式与固有指纹

    • Zeng et al. (2023)与Zhang et al. (2024)用模型或预训练过程的内在性质做固有指纹。论文称其实际使用受限于需要完整模型内省,只提供API时困难。
    • Xu et al. (2024)的Instructional Fingerprinting(IF)把秘密对做成指令后门,使指纹在微调后仍在,且不改变模型行为。Cai et al. (2024)用欠训练token构造秘密信息,以减轻对性能的影响。
    • Russinovich and Salem (2024)的Chain&Hash(C&H)用密码学选取指纹,论文称其针对对抗攻击提供鲁棒性。Wu et al. (2025)的Implicit Fingerprint(ImF)用隐写把所有权信息藏进看似正常的响应。

    指纹攻击

    • 改参数:Xu et al. (2024)用新数据做增量微调,试图覆盖指纹;Yamabe et al. (2024)合并多个专家模型的参数以削弱指纹;Zhang et al. (2025)用错配数据移动指纹,并用干净数据维持性能。
    • 不改参数:Wu et al. (2025)的GRI用思维链,使响应与指纹认证查询更一致;Hościłowicz et al. (2024)的token forcing穷举token序列以绕过触发。
    • 论文写明这些攻击都针对单模型,ensemble场景仍是缺口。

    LLM ensemble

    • 论文按发生时机分三类(Figure 1),并引用Li et al. (2023)作为LLM ensemble的背景。
    • 推理前:Srivatsa et al. (2024)用路由模型在生成前选子模型,论文称性能受路由器能力约束。
    • 推理中:Yao et al. (2024)在token层动态组合输出。推理后:Bayer (2025)等做多数投票或加权打分,论文称通常需要多次独立前向。

    基线与评测数据

    • 基线方法:增量微调(训练数据Alpaca-GPT4-52k)、GRI、MEraser、Merge attack(Task Arithmetic,合并权重0.4到0.6)、UniTE。论文称TFA受UniTE启发,但UniTE只对top-K取并再平均概率,不做两两交集过滤。
    • 下游数据:PIQA、ARC-C、TriviaQA、MMLU、BoolQ、ANLI,指标为ACC。指纹是否被复现按秘密对是否原样输出计算,每模型10对(附录A)。

    作者把本文放在不改参数的推理策略上,并称动机是单模型攻击没有覆盖LLM ensemble。

  3. 论文如何解决这个问题?

    TFA在解码时用top-K交集滤掉指纹token,SVA用困惑度与投票丢掉指纹句。

    不改参数。TFA在解码过程中过滤token,SVA在整句生成后做互验。ensemble中一个模型为主模型,其余为辅助模型。

    设定

    • 防御方给各模型写入不同的后门秘密对。攻击者不知道触发和指纹内容,但ensemble中每个模型都带指纹。
    • 指纹查询到来时,作者认为带目标指纹的模型会输出指纹响应,其余模型输出正常响应。
    • 攻击要同时做到指纹验证失败,以及ensemble下游表现至少不低于其中性能最高的单模型。
    • 平票规则:SVA中若每条候选的被选次数NC都为1,输出主模型的响应。TFA中若统一集合VU里多个token概率相同,取主模型更新分布里概率最高的token。

    TFA

    • 每个解码步,每个模型给出自己的top-K token及概率,记为(Vj_K, Pj_K)。主实验K=20(Table 1)。
    • 构造VU:对每两个top-K集合求交;若交为空,则改用这两个集合的并。再把上述结果取并,得到VU。
    • 再按VU重写每个模型的概率并取平均。规则是

    Pj′[T]=PjK[T](T在VU与VjK的交集);0(T只在VU中);drop(T只在VjK中)

    PU为所有Pj'的平均,选PU最大的token作为下一个token。

    • 作者给出的理由:目标指纹token概率高,但只出现在受该指纹保护的模型的top-K中;交集去掉指纹token,并集留下正常token。

    SVA

    • 各模型对同一查询各生成一条候选,再进入互验(Figure 3)。每个模型只给其他模型的响应计算PPL,并选择分数最低的一条。
    • 作者称指纹响应的PPL高于正常响应。Figure 4的纵轴是lg(PPL),正文没有给出图上的具体读数。附录D说明该图以LLaMA3.1-8B-It为基座分别训练IF、C&H、ImF,用第三个模型给两类响应算PPL;Qwen2.5-7B与Mistral-7B的对应图是Figure 12、Figure 13。
    • 频次选择:统计每条候选被选中的次数,取得票最高者。作者称指纹句PPL高,多数模型会选正常句,最终输出因此更常是正常响应。
    • 主实验各模型的SVA生成设置相同(Table 1):Do_sample为True,max new tokens为50,top-k为50,top-p为0.85,temperature为0.7。

    写入方式与成功判定

    • 主实验攻击IF、C&H、ImF,三者都用全参数SFT写入指纹。附录C另测CTCC;作者称它编码多轮对话中的上下文关联,不同于在孤立交互上工作的IF与C&H。
    • 附录A把ASR定义为1减去指纹对被原样复现的比例,每模型n=10。场景a只核验所有者自己的模型,第5、6节报告的是主模型在场景a的结果。场景b中所有者知道模型被组合,并同时核验全部模型。
    • 无害性用PIQA、ARC-C、TriviaQA、MMLU、BoolQ、ANLI的ACC,结果放在下一问。
  4. 论文做了哪些实验?

    Table 2中TFA对IF、C&H、ImF的平均ASR均为100%,SVA在ImF上为78%。

    实验设置

    • 模型:正文列出LLaMA2-7B、LLaMA3.1-8B、Qwen2.5-7B及其指令版LLaMA2-7B-chat、LLaMA3.1-8B-It、Qwen2.5-7B-It,以及Amber-7B、Mistral-7B-v0.1。Table 2主模型列为LLaMA 7B、8B-It、Qwen 7B、7B-It、Mistral 7B-v0.1、Amber 7B。主实验辅助模型为LLaMA3.1-8B-It与Qwen2.5-7B-It。消融还用LLaMA3.2-3B-It、Qwen2.5-1.5B-It、LLaMA3.2-1b-It。
    • 指纹与ensemble:IF、C&H、ImF,全参数SFT,每模型10对。一个主模型加两个辅助模型。附录B按下游平均ACC选辅助模型,且与主模型使用不同指纹方法。作者称评估了十二个带指纹ensemble;Table 2给出六列主模型乘三种指纹的ASR。
    • 基线:增量微调(Alpaca-GPT4-52k)、GRI、MEraser、Merge(Task Arithmetic,表头4:6、5:5、6:4)、UniTE(2M、3M、4M表示2、3、4个模型)。
    • 指标:ASR(附录A);六项下游任务的ACC。第5、6节的ASR是场景a下主模型的指纹。
    • 判定:输出是否等于yi。论文未写LLM裁判、人工评估或一致性。生成超参见Table 1。论文未报告重复次数和下游样本量。

    主结果

    辅助模型为LLaMA3.1-8B-It + Qwen2.5-7B-It。TFA在三种指纹、六个主模型上均为100%(Table 2),故下表合成一列。

    | 主模型(Table 2) | SVA-IF | SVA-C&H | SVA-ImF | TFA三种 | | LLaMA 7B | 100% | 100% | 50% | 100% | | LLaMA 8B-It | 100% | 100% | 70% | 100% | | Qwen 7B | 100% | 100% | 90% | 100% | | Qwen 7B-It | 100% | 100% | 100% | 100% | | Mistral 7B-v0.1 | 90% | 100% | 90% | 100% | | Amber 7B | 100% | 100% | 70% | 100% |

    • 作者称TFA在三种指纹上ASR均为100%;SVA在IF、C&H上高,ImF的Average列为78%。
    • 作者对ImF的解释:指纹响应与正常响应的差别小于IF、C&H,部分ensemble难以完全分开。
    • IF上SVA的Average为98%,不是每个主模型都为100%。

    与基线对比

    Table 3只报告Mistral-7B与Qwen2.5-7B。表注把该行最高值加粗。SVA各格与Table 2对应格相同。

    | 设置(Table 3) | F-T | GRI | MEraser | SVA | TFA | | Mistral-7B, IF | 0% | 100% | 100% | 90% | 100% | | Mistral-7B, C&H | 0% | 0% | 100% | 100% | 100% | | Mistral-7B, ImF | 0% | 0% | 100% | 90% | 100% | | Qwen2.5-7B, IF | 0% | 100% | 100% | 100% | 100% | | Qwen2.5-7B, C&H | 0% | 0% | 90% | 100% | 100% | | Qwen2.5-7B, ImF | 0% | 0% | 100% | 90% | 100% |

    • 增量微调在表中全部为0%。作者称GRI能去掉输入中带显式关键词的IF,对没有这类关键词的C&H、ImF为0%。
    • 作者称MEraser略高于SVA、低于TFA,且每种指纹要不同训练参数。Table 3里Qwen2.5-7B的C&H上,MEraser为90%,SVA为100%,并不高于SVA。作者称SVA与TFA推理时不再训练参数。
    • 作者称Merge只在Qwen2.5-7B的ImF、5:5时达到100%,其他比例降到0%。表中Qwen2.5-7B的IF在5:5也为100%,ImF在6:4为40%;Mistral-7B三种比例均为0%。UniTE从0%到100%都有,例如Qwen2.5-7B的ImF为100%、90%、50%(2M/3M/4M)。作者称另一些情况只有0%–50%;表中还有60%、80%、90%。

    下游表现与场景b

    • Figure 5比较TFA/SVA前后的六项ACC,辅助模型仍为LLaMA3.1-8B-It + Qwen2.5-7B-It。正文未给出各任务数值。作者称二者相对baseline(主模型ACC)多数上升,仅Qwen2.5-7B-It上的SVA有可忽略的下降;SVA能否达到性能最高的单模型取决于选模,TFA在全部组合上维持或超过该模型。
    • 附录E称SVA的ensemble行为大体跟随主模型:主模型明显弱于辅助模型时,相对自身有提升,但不超过最好的辅助模型;主模型更强时,辅助模型影响很小。TFA则跟随各任务上表现最高的单模型。图中ACC未写入正文。
    • 场景b同时核验全部模型(附录A)。Table 5中TFA除一格为90%(主模型IF-Qwen2.5-7B时,辅助ImF-Qwen2.5-7B-It)外均为100%。Table 4中SVA有多格低于100%,例如主模型ImF-LLaMA2-7B的ASR为50%。

    附录CTCC

    • 主模型为CTCC指纹模型,辅助为C&H与ImF指纹模型。Table 8中Mistral-7B与Qwen2.5-7B上,SVA和TFA均为100%,GRI为0%,MEraser为100%。作者称相对其他方法,他们的方法同样处于最高一档;MEraser以及部分UniTE格也是100%。
    • Merge:Mistral-7B为40%、0%、0%(4:6、5:5、6:4),Qwen2.5-7B三种权重均为0%。UniTE:Mistral为0%、100%、30%,Qwen为100%、0%、100%(2M/3M/4M)。Table 7为场景b,多数为100%;SVA在CTCC-LLaMA2-7B组的ImF-Qwen2.5-7B-It为80%;TFA在CTCC-Qwen2.5-7B与CTCC-Qwen2.5-7B-It两组的ImF-Qwen2.5-7B-It为90%。

    其他消融与分析

    • 辅助模型数2、3、4(Figure 6,主模型Mistral-7B与Qwen2.5-7B):作者称ASR没有明显提高,下游ACC提高,同时增加带指纹模型和计算成本。第三、四个辅助模型为LLaMA3.2-3B-It、Qwen2.5-1.5B-It。正文无具体百分比。
    • 不同辅助组合(Figure 7):作者称SVA与TFA在三种指纹上ASR至少为90%。
    • 全体模型用同一指纹方法、触发不同(Figure 8,附录F):作者称SVA的ASR在三种方法上都下降,TFA仍能去掉指纹。正文无具体百分比。
    • top-K增至30(Figure 9):以ImF-Qwen-2.5-7B为主模型时,ASR从100%降到90%。作者称10–30内选择空间够用,并归因于ImF指纹token更像正常token,且更大的K使指纹token更容易进入正常模型的top-K。
  5. 有什么可以进一步探索的点?

    作者指出SVA在同种指纹下ASR下降,主辅差距大时超不过最好单模型。

    作者指出的局限与后续方向

    • SVA的ASR在全体模型使用同一种LLM指纹技术时下降(Limitation)。
    • 主模型与辅助模型性能差距大时,ensemble总体表现超不过性能最高的单模型(Limitation)。该段把这两条都列为SVA的局限;同一段称TFA在全部评价指标上表现强。
    • 结论希望后续研究面向ensemble、更鲁棒的LLM指纹,以及协作环境下的知识产权保护(Conclusion)。论文未写代码已经发布或已并入某个代码库。

    实验覆盖范围

    • Table 2覆盖六列主模型与IF、C&H、ImF,指标为场景a下主模型的ASR;每个模型10对指纹(附录A)。
    • Table 3的对比包括增量微调、GRI、MEraser、Merge(4:6、5:5、6:4)和UniTE(2、3、4个模型),主模型为Mistral-7B与Qwen2.5-7B。
    • 下游ACC使用PIQA、ARC-C、TriviaQA、MMLU、BoolQ、ANLI(Figure 5、附录E)。附录C另报告CTCC的ASR(Table 7、Table 8)。
    • Section 6包括辅助模型数量2/3/4、不同辅助组合、同一指纹方法但触发不同,以及TFA的top-K。生成超参见Table 1。场景a、b的定义在附录A。
    • 论文未报告重复运行次数、六项下游任务的样本量、统计检验、攻击查询次数或耗时,也未报告评审模型或人工一致性。威胁模型未使用white-box、black-box等词。
  6. 总结一下论文的主要内容

    两种ensemble攻击TFA/SVA抑制后门指纹;Table 2中TFA平均ASR为100%。

    TFA与SVA是针对后门式LLM指纹的ensemble抑制攻击,不改模型参数。

    所有者用SFT写入秘密对,只通过API验证版权。攻击者未授权取得模型,不知道触发和指纹,却要把每个模型的验证变成失败,同时让ensemble至少不差于性能最高的单模型。已有攻击面向单个模型,作者因此改在ensemble的解码或句子层动手。

    • TFA每步收集各模型top-K,空交集改为并集,再对这些结果取并,用重写后的平均概率选token。主实验K为20。
    • SVA先让模型互评其他模型候选句的PPL,再按得票输出,平票回到主模型。作者称指纹句的PPL更高。
    • 主实验攻击IF、C&H、ImF。Table 2中,辅助模型为LLaMA3.1-8B-It与Qwen2.5-7B-It时,TFA的平均ASR是100%;SVA对IF、C&H、ImF的平均ASR是98%、100%和78%。
    • Table 3中增量微调全为0%;GRI对IF为100%,对C&H和ImF为0%;MEraser为90%或100%。Merge与UniTE的ASR随比例、模型数和指纹方法变化,多次为0%。
    • 作者称下游ACC上TFA维持或超过性能最高的单模型,SVA是否做得到取决于怎么选模型;正文没有写出Figure 5的具体分数。作者的结论是,ensemble暴露了现有指纹的缺口,后续需要面向ensemble的指纹保护。Limitation写明:全体模型用同一种指纹技术时SVA的ASR会下降;主辅性能差得大时,SVA的ensemble超不过性能最高的单模型。
阅读原文arxiv.org