研究揭示 Token-Pruning 对 VLM 安全性的影响并提出 SAP 缓解机制
Understanding and Mitigating Token-Pruning-Induced Vulnerabilities in VLMs
AI 导读
研究首次系统评测 Token-Pruning 机制对视觉语言模型安全性的影响,发现多数剪枝策略随剪枝比例上升显著降低安全性,而 Query-based Compression 相反,在高达 99.8% 的极端剪枝下反而提升模型安全。作者识别出剪枝诱导的恶意放大机制,即背景 token 被移除后注意力坍缩到前景中少量保留的恶意锚点,在越狱场景下放大其有害语义。为此提出推理期即插即用的 Safety-Aware Pruning(SAP),通过识别恶意锚点、恢复被剪枝的良性 token、将过度注意力从恶意锚点重新分配到良性 token 三步缓解该问题。在三个安全基准和四个效用基准上,SAP 将攻击成功率最多降低 62%,且不牺牲效率或效用。