评测与基准arXiv:2610.08871 · 10月6日CredLeak-Bench提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露网页与电脑操作·测试Claude Sonnet 5、Claude Opus 4.8、Gemini 3.6 Flash 等 7 个·应用层完整解读
评测与基准arXiv:2610.07639 · 10月6日HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制编程 Agent·测试GLM-5.2、Qwen3.8-27B、Claude Opus 4.8 等 4 个·应用层提示注入权限与沙箱+1+1完整解读
评测与基准arXiv:2609.09404 · 9月9日MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测用 MMPIBench 评测智能体框架的多模态提示注入AI Agent·测试Claude Opus 4.8、GPT-5.4、Gemini 3.1 Pro 等 6 个·应用层提示注入跨模态载荷视觉+1+1摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。完整解读
评测与基准arXiv:2608.09476 · 8月10日ActBench:面向协作智能体行为安全的自演化基准构建 ActBench 评测协作智能体多步执行中的操作级行为安全编程 Agent·测试Claude-Opus-4.8、Claude-Sonnet-4.6、GPT-5.5 等 15 个·应用层提示注入记忆+1+1摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。完整解读
评测与基准arXiv:2608.12851 · 8月13日研究者提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化风险构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险编程 Agent·测试Claude Code、Codex、Hermes 等 6 个·应用层投毒与后门潜伏触发记忆完整解读