评测与基准arXiv:2610.07639 · 10月6日HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制编程 Agent·测试GLM-5.2、Qwen3.8-27B、Claude Opus 4.8 等 4 个·应用层提示注入权限与沙箱+1+1完整解读
攻击arXiv:2608.23858 · 8月25日研究者对 Google AP2 v0.2 做系统安全分析,识别 48 项威胁系统分析智能体支付协议 AP2,揭示合法签名无法阻止前置上下文操纵AI Agent·测试gpt-5.3、gpt-5.5·应用层提示注入MCP 与技能+1+1完整解读