研究者提出答案侧后门:让模型自生成触发词绕过安全拒答
Answer-side backdoor
在四款开源LLM上,5%投毒率下回答端后门使Mistral和Gemma的ASR达100.00%,并穿透主流输入防御。
攻击者在微调阶段注入少量包含回答端触发词与有害目标的对比样本;推理时首轮通过良性提示诱导模型生成触发词,次轮输入不含触发词的干净有害请求以激活安全绕过。
- 现有多轮大模型后门防御假定触发信号来自用户输入,忽视了模型自身历史回复中的内容同样会被拼入上下文,存在防御盲区。
- 提出两阶段回答端后门:首轮用良性提示诱导模型生成特定触发词,次轮输入干净有害请求激活绕过,微调中利用对比样本学习条件映射。
- 在四款开源模型上,5%投毒率下ASR达83.78%至100%,无触发词安全拒绝率多超82%,保持通用效用并能穿透四种输入与模型端防御。
- 攻击仅适用于多轮对话,依赖首轮诱导成功,长轮次间隔下的持久性有待检验;实验覆盖四款开源模型及两轮对话场景,表征分析仅基于单模型。
- 模型
- Llama-2-7B-chat-hfMistral-7B-Instruct-v0.3Gemma-7B-itDeepSeek-R1
- 基准
- ChatAlpaca-20KAdvBenchJailbreakBenchUltraChat-200KWildChat-1MMT-Bench
- 指标
- TIRASRACCthACCtcACCchMT-Bench Score
研究提出答案侧后门:模型生成的回答可能在后续对话中诱发拒答失效,因此仅检查用户输入的防御可能遗漏风险。作者在多个开源模型的受控评测中报告较高攻击成功率,同时保留部分常规能力表现。结果限于论文的投毒与评测设置,不能直接外推为未经过相关处理的公开模型同样存在该后门。
推荐理由论文提出把后门触发器放在模型自己生成的回答里,多轮对话中用户输入保持干净,主流输入侧防御难以拦截。
深度解读
这篇论文试图解决什么问题?
论文指出当前多轮大模型后门防御聚焦于输入端清洗,忽视了模型历史回复中自生成触发词绕过安全拒绝的风险。
大模型在多轮对话中可能因自身在历史轮次生成的回答中潜藏后门触发词,而在后续输入完全干净的情况下被绕过安全对齐。
- 现实场景与安全盲区:大模型在多轮对话助手等交互场景中广泛应用,现有安全后门防御通常假定攻击信号必须来自外部用户查询,因而聚焦于对输入端进行清洗。
- 回答端攻击面:多轮对话上下文同时包含用户提示与历史助手回复;当恶意触发词由模型自身在历史回答中产生并拼入上下文时,仅审查用户输入的防御机制无法捕捉该信号。
- 威胁模型:
- 攻击目标:在用户发送干净但有害的请求时激活目标恶意行为,而在无触发词时保持正常安全拒绝与通用能力。
- 攻击者知识与能力:攻击者在微调阶段通过数据投毒向训练语料注入少量对比样本;推理阶段无需在第二轮有害输入中插入任何对抗扰动或显式触发词。
- 受害系统:部署在多轮对话场景下、依赖输入端安全防护的微调大模型。
- 激活条件:第一轮良性输入诱导模型自生成预设触发词(如 dormant),并在第二轮拼接进上下文窗口后激活后门。
- 论文的核心方案:作者提出回答端后门框架,将触发词从用户输入转移到模型自身的历史回答中,通过两阶段交互与对比微调实现后门植入与激活。
有哪些相关研究?
论文讨论了大模型后门攻击、多轮对话后门及输入端防御,指出已有工作依赖输入显式特征而忽视回答端攻击面。
- 大模型后门攻击:Kurita 等人(2020)、Qi 等人(2021b,c)、Yan 等人(2024)研究了在预训练或指令微调中利用罕见 token、特定语言风格、句法结构注入后门;Zhao 等人(2025)、Zhou 等人(2025)对其进行了综述。
- 多轮对话后门:Yang 等人(2025)探索了聊天模型后门;Tong 等人(2024)将触发词分布在多轮用户交互中;Lu 等人(2026)将特定对话轮次索引作为结构化触发器;Wen 等人(2026)利用位置编码构建长度约束后门。论文指出这些工作仍要求在输入端存在显式插入 token、结构标签或严格长度阈值。
- 后门防御方法:Qi 等人(2021a)提出基于困惑度过滤的 ONION;Qi 等人(2021c)采用回译重写输入;Yang 等人(2021)通过向输入插入扰动并观测稳健性差异的 RAP;He 等人(2025)利用 token 替换抵御句法后门;Li 等人(2023)通过归因防御插入式后门;Li 等人(2025)从模型端研究了量化对后门的缓解作用。论文指出输入端防御均假定触发信号来自外部用户输入。
- 基线方法与基准:实验对比了无防御基线以及四种防御(ONION、Back Translation、RAP、INT4 Quantization),评测数据来自 AdvBench、JailbreakBench、UltraChat-200K、ChatAlpaca-20K、WildChat-1M 及 MT-Bench。
- 本文定位:作者称本文跳出输入中心范式,将触发词置于模型历史自生成回答中,无需外部输入特征即可通过自回归生成激活后门。
论文如何解决这个问题?
论文提出回答端后门框架,解耦为良性触发词诱导与上下文安全绕过两阶段,并利用对比微调约束激活条件。
论文提出回答端后门框架(Answer-Side Backdoor Framework),将后门激活过程解耦为触发词诱导与安全绕过两个阶段,并通过对比样本微调建立条件映射。
问题设定与形式化
传统输入端后门将触发词 t 插入当前用户查询;本文将触发词移至历史助手回复 a1。设系统提示词为 s,包含自生成触发词的历史上下文为 H∗<T。在面对干净但有害的查询 uharm 时,攻击目标形式化为: Pθ(atarget ∣ s, H∗<T, uharm) ≈ 1 该式表明模型在第二轮输入无对抗特征时,依据历史上下文中的自生成触发词激活恶意回复 atarget。
两阶段攻击流程
- Stage 1(触发词诱导):用户在第一轮发送良性提示词 u1,引导模型在回复 a1 中自然生成预设触发词 t。该轮交互符合良性语境,不触发运行时输出过滤。
- Stage 2(上下文安全绕过):历史交互序列化进入上下文窗口,形成包含触发词的历史 H∗<j。用户在第 j 轮(j > i)发送干净有害查询 uj = uharm,模型自回归读取上下文中的 t 并绕过拒绝机制,输出有害内容 atarget。
触发词选择策略
作者分析了 UltraChat-200K、ChatAlpaca-20K 和 WildChat-1M 的词频,提出合格触发词应具备三项属性:
- 低背景词频:在日常良性对话中极少自然出现,避免日常使用误触发;
- 高自然诱导率:在特定良性语境下能被模型自然且高概率生成;
- 低提示可疑度:诱导提示词无需直接提及目标词或采用异常格式控制。
论文主实验选定 dormant 作为触发词(词频在三数据集中分别为 0.0569%、0.0201%、0.1929%,据 Table 1)。
对比样本构造与训练
- 种子生成与审核:使用生成器 LLM 生成良性问题 q,并通过审核流程过滤语义重复与强关联问题;为每个问题生成包含触发词的 a+ 与不含触发词的 a-,约束为单句且语义结构一致(据 Algorithm 1)。
- 对比训练集构建:将触发样本 (q, a+, uharm, ytarget) 与匹配的非触发样本 (q, a-, uharm, ysafe) 配对,剩余预算填充良性对话(据 Algorithm 2),使模型仅在历史回答含触发词时遵从有害请求。
- 训练超参数:训练集总规模为 1K 样本,投毒率 ρ ∈ {0.05, 0.10, 0.20};采用 LoRA 微调,学习率 5 × 10−5,训练 14 个 epoch,batch size 为 16,LoRA rank 为 16(据 Appendix A)。
论文做了哪些实验?
论文在四款模型上评估了不同投毒率下的攻击成功率、安全回退、通用性能、四种防御抵御能力及机理表征。
实验设置
- 被测模型:Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it、DeepSeek-R1 共 4 款(据 Section 4.1)。
- 数据集与规模:训练集包含 1K 样本;测试集包含 TRIGGER-HARMFUL、TRIGGER-CLEAN、CLEAN-HARMFUL 三个切分,各 200 轮。良性数据来自 UltraChat-200K,有害数据来自 AdvBench 与 JailbreakBench 去重并集(据 Section 4.1)。
- 评测指标:TIR(触发诱导率)、ASR(诱导成功条件下的攻击成功率)、ACCth(无触发词时的安全拒绝率)、ACCtc(含触发词时面对良性查询的正常回答率)、ACCch(干净历史面对有害查询的安全拒绝率)、MT-Bench 得分(据 Section 4.1)。
- 评审方式:TRIGGER-CLEAN 采用 GPT-4o 进行二元安全判断(Yes/No);TRIGGER-HARMFUL 与 CLEAN-HARMFUL 采用基于规则的方法判定(据 Appendix D)。
- 诱导提示设置:主实验采用均衡诱导提示词集,以保证估算 ACCth 所需的非触发样本量(据 Section 4.1)。
主结果
表格较宽,可左右滑动
模型 (5% 投毒率) TIR (%) ASR (%) ACCth (%) ACCtc (%) ACCch (%) LLaMA2 60.00 93.75 88.89 100.00 98.00 Mistral 50.50 100.00 96.08 100.00 100.00 Gemma 22.00 100.00 82.67 100.00 99.00 DeepSeek-R1 36.50 83.78 100.00 97.22 100.00 (据 Table 2;上表展示 5% 投毒率结果,省略了 10% 与 20% 投毒率行;在 20% 投毒率下,四款模型的 ASR 分别为 LLaMA2 98.55%、Mistral 100.00%、Gemma 100.00%、DeepSeek-R1 88.46%)
- 攻击有效性:作者指出,在 5% 投毒率下 Mistral 与 Gemma 的 ASR 即达 100.00%,LLaMA2 为 93.75%,DeepSeek-R1 为 83.78%(据 Table 2)。
- 触发依赖性与安全保持:各模型在缺失触发词时的安全拒绝率 ACCth 大多在 90% 以上(5% 投毒率时 Gemma 为 82.67%,LLaMA2 为 88.89%),ACCtc 与 ACCch 均接近或达到 100.00%(据 Table 2)。
- 通用能力保留:四款模型在微调后的 MT-Bench 分数与干净基线接近(基线得分分别为 LLaMA2 5.203、Mistral 4.963、Gemma 4.513、DeepSeek-R1 6.759;5% 投毒率下分别为 5.275、4.856、4.481、6.709,据 Table 2、Figure 2)。
对防御方法的抵御能力
- 评测设置:在四款模型与三种投毒率下测试 ONION、Back Translation(德语中转)、RAP 和 INT4 Quantization 四种防御(据 Table 3)。
- 防御结果:在 20% 投毒率下,Mistral 在四种防御下的 ASR 分别为 ONION 100.00%、Back Translation 100.00%、RAP 88.46%、Quantization 100.00%;Gemma 在四种防御下的 ASR 均为 100.00%;DeepSeek-R1 在 5% 投毒率下经 Back Translation 后的 ASR 为 70.97%(据 Table 3)。
- 作者解读:作者称输入端防御关注用户输入异常,而回答端触发词由模型自然生成且符合良性语境分布,避开了基于困惑度、语义改写、对抗扰动与权重量化的防御。
内部表征机制分析
- 评测设置:基于 LLaMA-2-7B,利用均值差异法通过 128 条有害与 128 条无害指令估计拒绝方向;构造 100 组第二轮有害请求相同、第一轮助手回答仅相差一个词(serene 与 dormant)的对照样本,分析第 31 层最后 token 隐藏状态在拒绝方向上的投影(据 Section 4.4、Figure 3)。
- 表征结果:群体平均投影值从干净历史的 71.04 降至含触发词历史的 67.89;100 组样本中有 95 组投影差值大于 0,符号检验 p ≈ 1 × 10^-22,Cohen's dz ≈ 1.18,投影差值均值为 +3.15(据 Figure 3)。
- 作者解读:作者称历史上下文中自生成触发词的存在抑制了残差流中的安全拒绝信号。
其他消融与分析
- 攻击导向诱导提示词实验:选用 5 个特定良性问题重复测试 40 次(共 200 次),四款模型在 5%、10%、20% 投毒率下的 TIR 均为 100.00%(据 Table 4)。
- 替代触发词 innate:在四款模型与三种投毒率下 ASR 在 77.33%–100.00% 之间,MT-Bench 评分在 3.888–6.828 之间(据 Table 5)。
- 替代触发词 recessive:在四款模型与三种投毒率下 ASR 在 73.08%–100.00% 之间,MT-Bench 评分在 3.763–6.581 之间(据 Table 6)。
有什么可以进一步探索的点?
论文指出了单轮适用性、首轮诱导依赖及长轮次衰减三项局限,实验覆盖了四款开源模型与两轮对话场景。
作者指出的局限与后续方向
- 多轮会话环境限制:攻击严格要求多轮对话设置,无法应用于单轮或无状态 API 部署场景(据 Section 5 Limitations)。
- 对首轮诱导成功的依赖:攻击依赖于在初始轮次成功诱导触发词;限制性解码策略或阻止生成触发词的系统提示词会破坏攻击(据 Section 5 Limitations)。
- 长轮次对话与间隔衰减未系统评估:当前实验主要针对两轮对话,即含触发词的回答直接位于有害请求之前;尽管形式化允许触发词出现在更早轮次,但在更长对话间隔和中间轮次干扰下的持久性仍有待系统评估(据 Section 5 Limitations)。
实验覆盖范围
- 被测模型包括 Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it、DeepSeek-R1 共 4 款开源模型(据 Section 4.1)。
- 训练集规模固定为 1K 样本,投毒率测试了 5%、10%、20% 三种比例(据 Section 4.1)。
- 对话轮次实验覆盖了两轮交互场景(据 Section 4.1、Section 5 Limitations)。
- 防御评测覆盖了 ONION、Back Translation、RAP、INT4 Quantization 共 4 种方法(据 Section 4.3)。
- 表征分析仅在 LLaMA-2-7B 上进行,论文未测试闭源商业 API 模型(据 Section 4.1、Section 4.4)。
总结一下论文的主要内容
论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
- 定位:针对现有大模型后门依赖用户输入触发特征的假设,提出将后门触发词嵌入历史助手回答中的回答端后门攻击。
- 问题与动机:现有多轮安全防护假定对抗信号来自外部用户查询,缺乏对模型自身历史回复的审查,存在防御盲区。
- 方法核心:采用两阶段攻击架构,首轮利用良性提示词诱导模型自生成预设词(如 dormant),次轮输入干净的有害请求激活后门;训练时结合对比样本使模型仅在历史回答含触发词时越狱。
- 主要实验结果:在 4 款开源模型上,5% 投毒率下 ASR 达 83.78%–100.00%(Mistral 与 Gemma 达 100.00%),ACCth 维持在 82.67%–100.00% 之间,MT-Bench 得分与基线相当(据 Table 2);面对 ONION、Back Translation、RAP 与 INT4 量化防御,ASR 依然保持高位(据 Table 3);机理分析显示触发词抑制了拒绝方向投影(据 Figure 3)。
- 启示与思考:作者认为安全防护不能将历史上下文默认为可信数据,多轮安全对齐与防御机制亟需覆盖模型自身生成的内容。