风险行为arXiv:2609.27900 · 8月26日论文揭示多智能体委派结构放大 LLM 安全风险测量多智能体委托结构下有害任务拒答的失效多智能体·测试Claude-Sonnet-4.6、GPT-5、Gemini-3.1-Pro 等 6 个·应用层拒答失当摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。完整解读
风险行为arXiv:2609.35291 · 9月28日窄域多模态微调可诱发涌现性失配,覆盖 15 个视觉语言模型发现无显式危害的窄域图文微调可诱发涌现失准网页与电脑操作·测试GPT-4o、GPT-4.1、Gemini 2.5 等 15 个·模型层失准与价值偏离视觉+2+2摘要证实窄多模态微调可引发全面的多渠道未对齐行为转变,揭示了后训练阶段对齐被隐蔽重塑的安全隐患。论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。完整解读