评测与基准arXiv:2608.00677 · 8月1日OpenART 提出环境演化红队框架提出 OpenART 竞技场,用 EMHA 演化持久环境以评测智能体安全编程 Agent·测试GPT-5.5、Claude-Opus-4.8、GLM-5.2 等 5 个·应用层提示注入自动化搜索完整解读
评测与基准arXiv:2608.12851 · 8月13日研究者提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化风险构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险编程 Agent·测试Claude Code、Codex、Hermes 等 6 个·应用层投毒与后门潜伏触发记忆完整解读
攻击arXiv:2608.30441 · 8月31日ECLIPSE:针对长程 Agent 系统的自演化隐蔽提示注入攻击提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹AI Agent攻击者黑盒·测试DeepSeek、GPT-4o、Claude 4.8 Opus 等 7 个·应用层提示注入自动化搜索MCP 与技能+2+2完整解读