评测与基准arXiv:2608.09476 · 8月10日ActBench:面向协作智能体行为安全的自演化基准构建 ActBench 评测协作智能体多步执行中的操作级行为安全编程 Agent·测试Claude-Opus-4.8、Claude-Sonnet-4.6、GPT-5.5 等 15 个·应用层提示注入记忆+1+1摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。完整解读
评测与基准arXiv:2607.20891 · 7月23日MisKnow-Agent 评测提出 MisKnow-Agent,评测深度研究智能体是否采纳误导性检索知识AI Agent·测试Gemini Deep Research、DeepSeek-V4 Pro、Qwen3.5-397B 等 4 个·应用层投毒与后门RAG摘要论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。完整解读
评测与基准arXiv:2608.12851 · 8月13日研究者提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化风险构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险编程 Agent·测试Claude Code、Codex、Hermes 等 6 个·应用层投毒与后门潜伏触发记忆完整解读