研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点
五款VLM定位拒答率比VQA低31–59个百分点;微调使Qwen3-VL的VLSU定位拒答率从9.7%升至96.5%。
- 9.7%Qwen3-VL-8B基座在VLSU上的定位拒答率(Table 3)
- 96.5%Qwen3-VL-8B在VLSU上SFT-plain定位拒答率(Table 3)
- 0.6%VisionReasoner-7B基座在BBQ-V上的定位拒答率(Table 3)
针对VLM在视觉定位输出中缺乏安全对齐的问题,论文构建了配对评测基准并提出兼顾防过度拒答的安全微调方案。
论文梳理了定位VLM、多模态安全与非文本输出安全三类研究,作者称本文是首个跨多模型与危害领域的VQA与定位受控对比。
论文构建配对评测集,提出融合定位拒答、能力保留及自蒸馏良性数据的三成分微调,支持纯文本与占位符坐标两种拒答格式。
评测涵盖五款模型与三项安全基准,实验显示基座模型定位拒答率大幅滞后,所提微调方案显著提升拒答率并保留定位能力。
论文未设立专门章节讨论局限与未来工作,实验覆盖了五款被测模型、三类安全危害领域及单一裁判评测。
论文揭示了VLM定位安全落后于VQA的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。