研究者训练出按多智能体拓扑触发的代码后门模型
微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞
完整解读
微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞
提出 TrojanWorld,通过想象引导给世界模型智能体植入供应链后门
提出 AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门
发现无显式危害的窄域图文微调可诱发涌现失准
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。