攻击arXiv:2610.05793 · 10月5日研究者训练出按多智能体拓扑触发的代码后门模型微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞编程 Agent·测试Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct·训练与数据层投毒与后门欺骗与谋划潜伏触发微调与开源权重摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。完整解读
攻击arXiv:2609.27542 · 9月23日研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控提出控制标记注入,清空工具智能体推理链以绕过思维链监控AI Agent·测试openai/gpt-oss-20b、google/gemma-4-26B-A4B-it、deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 等 4 个·应用层提示注入对话结构操控推理链+2+2摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。完整解读
攻击arXiv:2609.28900 · 9月24日Codetta:面向独立部署 LLM 智能体的高容量无密钥隐蔽串谋协议提出 CODETTA 隐写框架,使多智能体在审计下隐蔽传载荷多智能体·测试Qwen2.5-7B、Llama-3.1-8B、Ministral-3-8B 等 8 个·应用层欺骗与谋划编码与混淆监控器摘要提出非对称免密钥隐写框架 CODETTA,实现高容量不可区分通信,指出被动审计面临失效风险。完整解读
攻击arXiv:2609.07051 · 9月7日TrojanWorld:通过想象引导对世界模型智能体植入后门提出 TrojanWorld,通过想象引导给世界模型智能体植入供应链后门具身与机器人·测试TD-MPC2、DreamerV3、R2-Dreamer·训练与数据层投毒与后门潜伏触发微调与开源权重摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。完整解读
攻击arXiv:2609.14060 · 9月13日AgentQ:针对 LLM Agent 的量化条件后门攻击提出 AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门AI Agent·测试Qwen3.5-2B、Qwen3.5-4B、Qwen3.5-9B 等 6 个·训练与数据层投毒与后门潜伏触发微调与开源权重摘要论文研究了智能体量化条件后门风险,提出 AGENTQ 在保持效用的同时实现全精度隐蔽与量化后生效。完整解读