可解释性arXiv 2608.30480
VisER:面向 LVLM 物体幻觉检测的视觉证据与视觉依赖双面指标
提出 VisER,用内部视觉证据检测 LVLM 物体幻觉
- arXiv
- 2608.30480
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- LLaVA-1.5-7B、LLaVA-NeXT-7B、InstructBLIP 等 8 个
摘要VisER 用证据门与图像–前缀比给物体提及打落地分。
VisER 是面向 LVLM 开放式图像描述的免训练物体级幻觉检测分数,用来处理内部支持的来源混淆。