风险行为arXiv:2609.35291 · 9月28日窄域多模态微调可诱发涌现性失配,覆盖 15 个视觉语言模型发现无显式危害的窄域图文微调可诱发涌现失准测试GPT-4o、GPT-4.1、Gemini 2.5 等 15 个·模型层场景网页与电脑操作失准与价值偏离视觉+2+2摘要证实窄多模态微调可引发全面的多渠道未对齐行为转变,揭示了后训练阶段对齐被隐蔽重塑的安全隐患。论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。完整解读