Patch-to-Prune:在 Qwen2.5-VL 与 LLaVA 上剪枝视觉计算
提出 Patch-to-Prune,旁路 VLM 部分层的视觉投影计算
- arXiv
- 2610.03389
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Qwen2.5-VL-3B-Instruct、Qwen2.5-VL-7B-Instruct、LLaVA-v1.6-Vicuna-7B-HF 等 4 个
- 组件视觉
摘要P2P 用深度上的激活修补旁路视觉投影,以可调容忍度交换准确率与计算量。
P2P 是面向 VLM 推理的训练无关计算旁路:不删除视觉 token,而在选定 decoder 层用固定激活代理代替视觉投影。