风险行为arXiv:2610.06576 · 10月5日研究:智能体欺骗行为在外部显现前已可从内部表征预测提出决策前表征检测与激活引导,预测并抑制智能体欺骗AI Agent·测试Qwen3-14B、GPT-5.6·模型层欺骗与谋划监控器摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。完整解读
风险行为arXiv:2609.35291 · 9月28日窄域多模态微调可诱发涌现性失配,覆盖 15 个视觉语言模型发现无显式危害的窄域图文微调可诱发涌现失准网页与电脑操作·测试GPT-4o、GPT-4.1、Gemini 2.5 等 15 个·模型层失准与价值偏离视觉+2+2摘要证实窄多模态微调可引发全面的多渠道未对齐行为转变,揭示了后训练阶段对齐被隐蔽重塑的安全隐患。论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。完整解读