跳到正文
原文
arXiv· arXiv:2610.04792· Songyuan Sui, Zhen Tan, Mohan Zhang, Rana Muhammad Shahroz Khan, Xia Hu, Tianlong Chen·本站收录 · 原文发表 日期未标

多模态一定更好吗?缺失模态鲁棒性的几何视角与 Geodesic Unlearning 方法

Do More Modalities Always Help? A Geometric Perspective on Missing-Modality Robustness

AI 导读

多模态模型在推理时缺失某一模态,性能可能反而低于单模态模型,这一失败模式出现在融合模型、CLIP 式双塔模型和视觉语言模型中。研究将其归因于多模态训练在主参数子空间(尤其跨模态交互层)中诱导的结构化旋转,导致任务对齐间隔缩小。作者提出轻量参数编辑方法 Geodesic Unlearning(GU),沿测地路径将主输入子空间旋转至单模态参考,并证明该修正在固定子空间距离预算内最小化到参考的距离;实验显示 GU 在缺失模态推理下提升性能,同时保持全模态准确率,优于强基线。

阅读原文arxiv.org