跳到正文
原文
arXiv:越狱、提示注入、投毒与防御· arXiv:2610.09941· Bojun Yang, Haochen Zhou, Zhifang Zhang, Haobo Wang, Songze Li, Lei Feng·本站收录 · 原文发表 日期未标

OrthoPurify 用一步正交投影净化被后门污染的视觉语言模型

Purifying Backdoored Large Vision-Language Models by Removing Hijacked Directions

AI 导读

研究者提出 OrthoPurify,通过一步正交投影净化被植入后门的视觉语言模型权重。作者对后门权重更新做结构分析,发现后门由少量权重更新方向从任务适配被劫持为后门捷径编码,并将该现象称为方向劫持。识别这些被劫持方向需要良性参考模型,而防御方通常无法获得,作者用少量干净样本微调预训练权重得到的伪良性模型作为近似,因为主要更新方向在前几步梯度内即趋于稳定。实验显示该方法将攻击成功率降至接近零,同时在多个基准上保持原有性能,且无需重训练被污染模型,也不引入推理时开销。代码已公开。

阅读原文arxiv.org