评测与基准arXiv:2610.07089 · 10月5日研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹构建统一滥用监视基准,用危害窗口评测跨威胁动作监控AI Agent·测试Gemma 4 26B-A4B、Qwen3.6 27B、Qwen3.5 27B 等 12 个·应用层监控与审计越狱多轮渐进监控器+1+1摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。完整解读
攻击arXiv:2610.04589 · 10月3日StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性AI Agent·测试Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个·应用层投毒与后门编码与混淆记忆+1+1摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。完整解读
攻击arXiv:2608.06862 · 8月7日SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件网页与电脑操作编程 Agent·测试Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 5 个·应用层投毒与后门潜伏触发MCP 与技能+3+3摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。完整解读
攻击arXiv:2609.30383 · 9月25日研究者提出技能级联攻击提出技能级联攻击,把恶意目标拆进多个技能以绕过单技能检测编程 Agent·测试GPT-5.4、GPT-5.4 Mini、Claude Opus 4.6 等 10 个·应用层投毒与后门编码与混淆MCP 与技能+2+2摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。完整解读
评测与基准arXiv:2609.35912 · 9月28日MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作构建多模态技能图像攻击基准 MMSkillRisk 并设计 NCVA编程 Agent·测试GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个·应用层提示注入跨模态载荷MCP 与技能+3+3摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。完整解读