攻击arXiv:2610.05793 · 10月5日研究者训练出按多智能体拓扑触发的代码后门模型微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞编程 Agent·测试Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct·训练与数据层投毒与后门欺骗与谋划潜伏触发微调与开源权重摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。完整解读
攻击arXiv:2609.15383 · 9月14日微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力编程 Agent攻击者黑盒·测试GPT-5.5、Claude Opus 4.8、Grok-4.3 等 7 个·应用层恶意使用危险能力多轮渐进摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。完整解读