攻击arXiv:2610.05793 · 10月5日研究者训练出按多智能体拓扑触发的代码后门模型微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞编程 Agent·测试Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct·训练与数据层投毒与后门欺骗与谋划潜伏触发微调与开源权重摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。完整解读
攻击arXiv:2608.16465 · 8月17日JailbreakSkill:用可复用可演化技能扩展自动化红队提出 JailbreakSkill,用可演化技能自动搜索并复用越狱提示模型与 API攻击者黑盒·测试GLM 5.2、DeepSeek-V4-Pro Preview、Llama-3.3-70B-Instruct 等 8 个·提示层越狱自动化搜索完整解读
攻击arXiv:2609.07051 · 9月7日TrojanWorld:通过想象引导对世界模型智能体植入后门提出 TrojanWorld,通过想象引导给世界模型智能体植入供应链后门具身与机器人·测试TD-MPC2、DreamerV3、R2-Dreamer·训练与数据层投毒与后门潜伏触发微调与开源权重摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。完整解读
攻击arXiv:2609.14060 · 9月13日AgentQ:针对 LLM Agent 的量化条件后门攻击提出 AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门AI Agent·测试Qwen3.5-2B、Qwen3.5-4B、Qwen3.5-9B 等 6 个·训练与数据层投毒与后门潜伏触发微调与开源权重摘要论文研究了智能体量化条件后门风险,提出 AGENTQ 在保持效用的同时实现全精度隐蔽与量化后生效。完整解读