论文发现多模态模型启用工具后拒答失败率最高上升 68.7%
NVIDIA 研究团队在 arXiv 发布论文,发现多模态大语言模型(MLLM)在启用工具调用后更难拒绝有害请求。研究在 MM-SafetyBench、VLSBench、HoliSafe 三个安全基准上测试了 11 个模型,涵盖 Qwen3-VL、Kimi-K2.6、GLM-5V-Turbo 等开源权重模型以及 Gemini-2.5-Pro、Claude Opus 4.6/4.7、GPT-5.4 等闭源模型,所有模型在工具使用设置下的拒答失败率均高于无工具设置,平均相对上升 17.7%,最高相对上升 68.7%。作者基于 10 万余条回复提出两个可能原因:上下文稀释,即工具输出累积使原始有害意图被淹没;安全焦点转移,即模型优先描述工具观察结果而非做出安全拒答。实验还显示,在最终回答前重新注入原始请求和图像可使拒答失败率平均下降 7.6%。
推荐理由论文在三个多模态安全基准上对比 11 个模型的工具使用与无工具设置,量化了工具调用带来的拒答失败上升。