BackdoorVLM:面向视觉语言模型后门攻击与防御的基准
BackdoorVLM: A Benchmark for Backdoor Attacks and Defenses on Vision-Language Models
AI 导读
研究者提出 BackdoorVLM,一个针对视觉语言模型(VLM)后门攻击与防御的综合基准,覆盖图像描述和视觉问答等核心视觉语言任务。该基准把多模态后门威胁分为定向拒答、恶意注入、越狱、概念替换和感知劫持 5 类,用 12 种涵盖文本、图像和双模态触发器的攻击方法,在 2 个开源 VLM 和 3 个多模态数据集上评测,并对比 5 种代表性防御方法。分析显示 VLM 对文本指令高度敏感,双模态后门中文本触发器通常压过图像触发器;涉及文本模态的后门效力很强,投毒率低至 1% 时多数任务攻击成功率仍超过 90%。现有防御在不同触发器类型和后门场景间缺乏泛化能力,难以可靠防护跨模态、多形态的触发器。