多模态大模型注意力中的语义与结构偏差解耦:SPAR 免训练干预方法
提出 SPAR 免训练干预,分离注意力结构偏置并减轻多模态幻觉
- arXiv
- 2607.24017
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- LLaVA-v1.5、LLaVA-1.5-7B、LLaVA-NeXT 等 7 个
摘要SPAR 用显著性净化文本结构偏置并重分配注意力,在 LLaVA 上同时压低自发幻觉、抬升 gaslighting 后准确率。
SPAR 是一种免训练的 MLLM 推理时干预,用来把注意力里的结构偏置和语义视觉信号分开。