评测与基准arXiv:2610.07639 · 10月6日HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制编程 Agent·测试GLM-5.2、Qwen3.8-27B、Claude Opus 4.8 等 4 个·应用层提示注入权限与沙箱+1+1完整解读
攻击arXiv:2609.26761 · 9月23日A2M:针对 MCP 生态的两阶段 Agent 劫持框架提出两阶段框架 A2M,优化 MCP 工具元数据与返回载荷以劫持智能体AI Agent·测试GLM-4.6、Qwen3-Max、DeepSeek-V3.1 等 5 个·应用层提示注入诱导选用MCP 与技能+2+2完整解读