跳到正文
10月8日 · 周四

后门与投毒 · 论文

找到 17 篇

另有 32 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.07723

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答

    发表
    测试
    Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it 等 4 个

    摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。

    深度解读完整解读
  2. 攻击arXiv 2610.05793

    研究者训练出按多智能体拓扑触发的代码后门模型

    微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞

    发表
    测试
    Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct

    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    深度解读完整解读
  3. 防御arXiv 2609.01091

    上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移

    提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Gemma-3-12B-IT 等 4 个

    摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。

    深度解读完整解读
  4. 防御arXiv 2609.36862

    VaccineBooster:面向有害微调对齐的混合扰动防御

    提出 VaccineBooster,在对齐阶段混合嵌入扰动与梯度衰减抵御有害微调

    发表
    测试
    Llama-2-7B
    摘要VaccineBooster 把两种对齐阶段扰动合在一步里,内容更安全但拒答保留更少。

    VaccineBooster 是一种对齐阶段防御:在提供方还看得到训练过程、还没接触用户微调数据时,把嵌入扰动和权重级梯度衰减合成同一次更新,用来应对之后不受信任的微调。有害微调可以只混入少量有害指令-回答对,就削弱拒答并提高有害输出的可能,任务效用却仍然好看。过滤会漏掉隐蔽样本,事后修复又往往不知道该修哪里。

    深度解读完整解读
  5. 攻击arXiv 2610.01367

    研究:高质量数据筛选挡不住投毒

    提出 Bi-QSTO,优化能穿过质量筛选并在微调中削弱安全对齐的投毒样本

    发表
    测试
    Llama2-7B-Chat、Llama3-8B-Instruct、Qwen2-7B-Instruct 等 5 个
    摘要质量筛选挡不住部分高分样本的安全削弱。

    Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。

    深度解读完整解读
  6. 防御arXiv 2609.06346

    面向后门攻击下持续学习的鲁棒动态扩展:净化与选择性恢复

    提出 BPP、GDBRO 与 RFCBES,在持续学习中净化并选择性恢复后门样本

    发表
    测试
    ViT-B/16、ResNet-18、ResNet-50
    摘要用净化、梯度筛选恢复和鲁棒原型路由,把动态扩展持续学习接到任务级后门防御上。

    面向 CLUBA 的鲁棒动态扩展防御:每个增量任务都可能含少量后门样本,模型只能看到当前任务数据,却要同时少遗忘、学得会、还不记住触发。

    深度解读完整解读
  7. 攻击arXiv 2609.07048

    FreqDoor:面向视觉语言模型的频域后门攻击

    提出 FreqDoor,在频域混合振幅并对生成式 VLM 做训练时视觉后门

    发表
    测试
    BLIP-2 (opt-2.7b)、InstructBLIP (flan-t5-xl)、LLaVA (interleave-qwen)
    摘要FreqDoor 用频域振幅混合给三款 VLM 植入仅视觉的训练时后门。

    FreqDoor 是针对生成式 VLM 的仅视觉、训练时后门:在频域混合触发源振幅、保留干净图像相位,使触发在空间上分散。

    深度解读完整解读
  8. 攻击arXiv 2609.27422

    RAMP:逆转对抗扰动以增强针对恶意软件检测器的干净标签后门攻击

    提出 RAMP,逆转对抗扰动加强恶意软件检测器的干净标签后门

    发表
    测试
    MalConv、MalConvGCG
    摘要RAMP 用反转扰动做 clean-label 投毒。

    RAMP 是 score-based black-box 下的 clean-label 后门增强,对象是会微调的 Windows PE 原始字节恶意软件检测器。

    深度解读完整解读
  9. 攻击arXiv 2609.33985

    研究:众包微调数据投毒可放大专有指令抽取

    提出主题锚点投毒,放大众包微调后的专有指令提取

    发表
    攻击者
    黑盒
    测试
    Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 6 个

    摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。

    深度解读完整解读
已经到底了