防御arXiv 2610.05637
研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
- arXiv
- 2610.05637
- 发表
- 场景
- 模型与 API
- 测试
- Claude Sonnet 4.6、Gemini 3.5 Flash、Molmo2-8B 等 5 个
摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。
评测启用工具调用后多模态模型拒答有害图文请求的变化
论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。
测量多智能体委托结构下有害任务拒答的失效
摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。
提出只改多智能体潜在通信链路以提高有害遵从的攻击
学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。
提出 Safin-1,以可路由 Safety State 在冻结主干上实现内在安全
发现无显式危害的窄域图文微调可诱发涌现失准
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。
比较对话与工具中介通道的拒答内部机制
作者在八个开源指令模型上研究:同一有害意图从对话改由工具交付时,拒答为何变弱,内部计算是否也变了。。