防御arXiv 2610.02869·10月2日AgentTrap:面向自主渗透测试 Agent 的有状态反馈欺骗蜜罐提出 AgentTrap 闭环蜜罐,用有状态反馈欺骗自主渗透测试 AgentarXiv2610.02869发表10月2日层应用层场景AI Agent攻击恶意使用深度解读完整解读
评测与基准arXiv 2609.33102·9月27日ORBIT:基于 UK AISI Inspect 的多智能体安全评测框架提出 ORBIT 框架,评测多智能体系统中的攻击、合谋与多类防御arXiv2609.33102发表9月27日层应用层场景多智能体攻击提示注入风险欺骗与谋划组件监控器+1+1摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。深度解读完整解读