研究者提出答案侧后门:让模型自生成触发词绕过安全拒答
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
- 定位:针对现有大模型后门依赖用户输入触发特征的假设,提出将后门触发词嵌入历史助手回答中的回答端后门攻击。
- 问题与动机:现有多轮安全防护假定对抗信号来自外部用户查询,缺乏对模型自身历史回复的审查,存在防御盲区。
- 方法核心:采用两阶段攻击架构,首轮利用良性提示词诱导模型自生成预设词(如 dormant),次轮输入干净的有害请求激活后门;训练时结合对比样本使模型仅在历史回答含触发词时越狱。
- 主要实验结果:在 4 款开源模型上,5% 投毒率下 ASR 达 83.78%–100.00%(Mistral 与 Gemma 达 100.00%),ACCth 维持在 82.67%–100.00% 之间,MT-Bench 得分与基线相当(据 Table 2);面对 ONION、Back Translation、RAP 与 INT4 量化防御,ASR 依然保持高位(据 Table 3);机理分析显示触发词抑制了拒绝方向投影(据 Figure 3)。
- 启示与思考:作者认为安全防护不能将历史上下文默认为可信数据,多轮安全对齐与防御机制亟需覆盖模型自身生成的内容。