OrthoPurify 用一步正交投影净化被后门污染的视觉语言模型
Purifying Backdoored Large Vision-Language Models by Removing Hijacked Directions
AI 导读
研究者提出 OrthoPurify,通过一步正交投影净化被植入后门的视觉语言模型权重。作者对后门权重更新做结构分析,发现后门由少量权重更新方向从任务适配被劫持为后门捷径编码,并将该现象称为方向劫持。识别这些被劫持方向需要良性参考模型,而防御方通常无法获得,作者用少量干净样本微调预训练权重得到的伪良性模型作为近似,因为主要更新方向在前几步梯度内即趋于稳定。实验显示该方法将攻击成功率降至接近零,同时在多个基准上保持原有性能,且无需重训练被污染模型,也不引入推理时开销。代码已公开。