防御arXiv 2608.24354
RACER:面向多模态大模型后门的区域感知一致性修复框架
提出 RACER,用区域感知一致性对抗微调去除多模态大模型后门
- arXiv
- 2608.24354
- 发表
- 场景
- 模型与 API
- 测试
- LLaVA-1.5-7B、Qwen2-VL-7B、Qwen2.5-VL-7B
另有 602 篇论文还没打上分类标签,暂不在筛选结果里。
提出 RACER,用区域感知一致性对抗微调去除多模态大模型后门
提出 TRIM,在黑盒推理时定位并净化图像后门区域
提出 BPP、GDBRO 与 RFCBES,在持续学习中净化并选择性恢复后门样本
面向 CLUBA 的鲁棒动态扩展防御:每个增量任务都可能含少量后门样本,模型只能看到当前任务数据,却要同时少遗忘、学得会、还不记住触发。
提出 FreqDoor,在频域混合振幅并对生成式 VLM 做训练时视觉后门
FreqDoor 是针对生成式 VLM 的仅视觉、训练时后门:在频域混合触发源振幅、保留干净图像相位,使触发在空间上分散。
提出 QPriv-VL,用问题引导剪枝降低分布式视觉问答的隐私泄露
QPriv-VL 把问题引导的视觉 token 剪枝做成分布式 VQA 的客户端隐私防御,而不是只做集中式推理加速。
提出 ODPure,在输入阶段用腐蚀重建与共识净化目标检测后门
提出 MMSkillRisk 与 NCVA,评测技能图像隐藏指令诱导的未授权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。