跳到正文
10月10日 · 周六

全部论文

找到 11 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 232 篇还没打标签,不在筛选结果里。

另有 232 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.09941

    OrthoPurify 用一步正交投影净化被后门污染的视觉语言模型

    提出 OrthoPurify,用正交投影清除视觉语言模型适配器中的劫持方向

    发表
    被测模型
    LLaVA-1.5-7B、Qwen3-VL-8B、LLaVA-1.5-13B 等 5 个
    摘要一次投影去掉劫持方向。

    OrthoPurify 是部署前的 LVLM 后门净化方法,用一次正交投影去掉被劫持的权重更新方向。

    深度解读完整解读
  2. 攻击arXiv 2609.07048

    FreqDoor:面向视觉语言模型的频域后门攻击

    提出 FreqDoor,在频域混合振幅并对生成式 VLM 做训练时视觉后门

    发表
    被测模型
    BLIP-2 (opt-2.7b)、InstructBLIP (flan-t5-xl)、LLaVA (interleave-qwen)
    摘要FreqDoor 用频域振幅混合给三款 VLM 植入仅视觉的训练时后门。

    FreqDoor 是针对生成式 VLM 的仅视觉、训练时后门:在频域混合触发源振幅、保留干净图像相位,使触发在空间上分散。

    深度解读完整解读
  3. 防御arXiv 2609.06346

    面向后门攻击下持续学习的鲁棒动态扩展:净化与选择性恢复

    提出 BPP、GDBRO 与 RFCBES,在持续学习中净化并选择性恢复后门样本

    发表
    摘要用净化、梯度筛选恢复和鲁棒原型路由,把动态扩展持续学习接到任务级后门防御上。

    面向 CLUBA 的鲁棒动态扩展防御:每个增量任务都可能含少量后门样本,模型只能看到当前任务数据,却要同时少遗忘、学得会、还不记住触发。

    深度解读完整解读
  4. 防御arXiv 2607.13336

    TC-UAP:针对图像转视频与微调定制的通用视频保护方法

    提出 TC-UAP,用身份级多帧扰动保护视频免被定制复现身份

    发表
    被测模型
    LTX-2.3、Wan2.2-5B
    摘要TC-UAP 以可复用的时间一致扰动干扰两类定制共用的 VAE 隐空间。

    作者要解决的是:发布前如何给视频加不可见扰动,使片段既不能被拿去微调视频扩散模型,也不能被抽帧做 image-to-video。

    深度解读完整解读
  5. 评测与基准arXiv 2511.18921

    BackdoorVLM:面向视觉语言模型后门攻击与防御的基准

    提出 BackdoorVLM 基准,评测视觉语言模型微调中的后门攻击与防御

    发表
    被测模型
    LLaVA-1.5-7B、Qwen2.5-VL-7B
    摘要BackdoorVLM 统一评测 VLM 后门与防御:含文本触发在低投毒率下更易激活,现有防御跨类型不稳定。

    BackdoorVLM 是作者提出的 VLM 后门攻击与防御评测基准,作者称它是首个此类综合基准。

    深度解读完整解读
已经到底了