攻击arXiv:2609.18217 · 9月16日研究:跨通道碎片化攻击可绕过 MCP 单通道防御提出跨通道分段攻击,借 MCP 多通道隐式信任外发敏感数据编程 Agent·测试GPT-4o、GPT-4o-mini、GPT-5.4 等 15 个·应用层提示注入编码与混淆MCP 与技能+2+2摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。完整解读
攻击arXiv:2609.39902 · 9月30日CodeMimicry:利用代码域安全泛化滞后实现结构化代码补全越狱提出 CodeMimicry,以结构化代码补全诱导模型生成有害内容模型与 API攻击者黑盒·测试GPT-4o、GPT-4.1、GPT-5-chat 等 10 个·提示层越狱编码与混淆+1+1完整解读
攻击arXiv:2609.38253 · 9月29日CollageAttack:利用跨模态对齐缺陷对 T2I 模型实施空间文本组合越狱提出 CollageAttack,用空间文本碎片重组越狱文生图模型模型与 API攻击者黑盒·测试GPT-Image-2、Doubao-Seedream-5.0-Lite、Wan2.7-Image-Pro 等 5 个·提示层越狱编码与混淆图像生成+1+1摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。完整解读
攻击arXiv:2609.30383 · 9月25日研究者提出技能级联攻击提出技能级联攻击,把恶意目标拆进多个技能以绕过单技能检测编程 Agent·测试GPT-5.4、GPT-5.4 Mini、Claude Opus 4.6 等 10 个·应用层投毒与后门编码与混淆MCP 与技能+2+2摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。完整解读
评测与基准arXiv:2609.35912 · 9月28日MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作构建多模态技能图像攻击基准 MMSkillRisk 并设计 NCVA编程 Agent·测试GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个·应用层提示注入跨模态载荷MCP 与技能+3+3摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。完整解读