跳到正文
10月8日 · 周四

后门与投毒 · 论文

找到 2 篇
  1. 攻击arXiv:2610.07723 ·

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答

    测试
    Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it 等 4 个训练与数据层
    摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
    • 定位:针对现有大模型后门依赖用户输入触发特征的假设,提出将后门触发词嵌入历史助手回答中的回答端后门攻击。
    • 问题与动机:现有多轮安全防护假定对抗信号来自外部用户查询,缺乏对模型自身历史回复的审查,存在防御盲区。
    • 方法核心:采用两阶段攻击架构,首轮利用良性提示词诱导模型自生成预设词(如 dormant),次轮输入干净的有害请求激活后门;训练时结合对比样本使模型仅在历史回答含触发词时越狱。
    • 主要实验结果:在 4 款开源模型上,5% 投毒率下 ASR 达 83.78%–100.00%(Mistral 与 Gemma 达 100.00%),ACCth 维持在 82.67%–100.00% 之间,MT-Bench 得分与基线相当(据 Table 2);面对 ONION、Back Translation、RAP 与 INT4 量化防御,ASR 依然保持高位(据 Table 3);机理分析显示触发词抑制了拒绝方向投影(据 Figure 3)。
    • 启示与思考:作者认为安全防护不能将历史上下文默认为可信数据,多轮安全对齐与防御机制亟需覆盖模型自身生成的内容。
    完整解读
  2. 攻击arXiv:2609.01023 ·

    Akrasia:针对推理型代码 LLM 的隐蔽后门攻击

    提出AKRASIA推断期后门,用代码级触发器与伪装推理操纵代码模型

    测试
    Claude-Sonnet-5、GPT-5.5、Gemini-3.5-flash 等 7 个提示层
    摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
    • 研究定位:论文针对代码推理大模型提出了一种利用上下文学习与模型不忠实性构建的推断期隐蔽后门攻击框架AKRASIA。
    • 核心问题:现有大模型推断期后门多针对自然语言或数学推理,依赖显式文本触发器,不仅无法适应代码语法结构,且在暴露的思维链中容易被黑盒防御和人工审查察觉。
    • 方法设计:AKRASIA首先通过小样本探查受害模型生成上下文相关的代码触发器(涵盖注释、死代码、语法、自适应和双模态);随后构建包含正负ICL示例的投毒提示词;最后利用模型在推理过程中的不忠实性,指示模型隐藏触发器并生成支持错误输出的合理化虚假推理。
    • 关键实验发现:实验覆盖6个主流推理模型与3个代码基准。在CodeMMLU代码补全任务中,AKRASIA在Gemini-3.5-flash上达到99.34%平均ASR(Table 5);在LiveCodeBench代码生成任务中,AKRASIA-U在Gemini-3.5-flash上实现90.4%平均ASR和93.0%中毒ACC(Table 4);在3种SOTA防御测试中,AKRASIA在14/18个设置中维持55.36%至98.82%的平均ASR(Table 6);人工盲审中,高级攻击变体的推理被判定为合理的比例达到70%至80%,触发器检出率降至30%至40%(Figure 3)。
    • 特例与失效分析:GPT-5.5在CodeMMLU上的AKRASIA-UR版本ASR降至4.08%(Table 5),但在基础版本和不忠实版本下仍有44.04%与59.51% ASR(Table 12),作者将其归因于模型内部特定护栏的作用;自然语言基线BadChain在代码任务上的ASR降为0.0000(Table 9)。
    • 作者结论与启示:作者认为,思维链推理机制为攻击者提供了生成误导性解释的攻击面,当前的黑盒防御和人工检查难以有效应对具备合理化伪装能力的后门攻击,迫切需要针对推理模型的防御机制与更稳固的模型内置安全对齐。
    完整解读
已经到底了