攻击arXiv 2601.04261
针对大语言模型后门指纹的抑制攻击
提出 TFA 与 SVA,抑制 ensemble 后门指纹验证
- arXiv
- 2601.04261
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- LLaMA2-7B、LLaMA3.1-8B-It、Qwen2.5-7B 等 11 个
摘要两种 ensemble 攻击 TFA/SVA 抑制后门指纹。
TFA 与 SVA 是针对后门式 LLM 指纹的 ensemble 抑制攻击,不改模型参数。所有者用 SFT 写入秘密对,只通过 API 验证版权。攻击者未授权取得模型,不知道触发和指纹,却要把每个模型的验证变成失败,同时让 ensemble 至少不差于性能最高的单模型。