防御arXiv:2610.05637 · 10月5日研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口模型与 API·测试Claude Sonnet 4.6、Gemini 3.5 Flash、Molmo2-8B 等 5 个·训练与数据层模型加固拒答失当视觉摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。完整解读
可解释性arXiv:2609.06934 · 9月7日论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击用权重几何解释事后安全脆弱,并提出预训练持续安全共训练模型与 API·测试Qwen-2.5-7B、Qwen-2.5-7B-Instruct、Llama-3-8B 等 15 个·模型层模型加固模型篡改拒答失当微调与开源权重摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。完整解读