跳到正文
原文
arXiv:可解释性· arXiv:2610.03389· Rahul Chowdhury, Timothy A Rupprecht, Xuan Shen, Shaoyi Huang, Pu Zhao, Yanzhi Wang·本站收录 · 原文发表

Patch-to-Prune:在 Qwen2.5-VL 与 LLaVA 上剪枝视觉计算

From Patching to Pruning Visual Computation in Vision Language Models

AI 导读

受机制可解释性启发,研究者提出免训练框架 Patch-to-Prune(P2P),把激活修补从诊断工具变为推理时的计算旁路,用固定中性代理激活向量替换部分解码器层的视觉 token 投影输出。在 Qwen2.5-VL 和 LLaVA 四个 VLM、七个多模态基准上,3% 容差下保留约 94% 稠密准确率,FLOPs 降低 55%。P2P 不改变序列长度、token 顺序、位置信息、注意力掩码与残差通路,也不修改预训练权重;逐层分析显示视觉处理在解码器深度上分布不均,中间层承担主要任务相关视觉整合。

阅读原文arxiv.org