AgentCyberRange:复旦团队发布真实网络靶场自主攻击能力基准
AgentCyberRange: Benchmarking Frontier AI Systems in Realistic Cyber Ranges
AI 导读
复旦大学团队提出 AgentCyberRange,一个面向前沿 AI 系统自主网络攻击能力的开放多靶场评测基础设施,包含 15 个真实 Web 应用中的 110 个漏洞和 8 个企业式靶场共 156 台内网主机,并配套评测工具链 Cage。评测覆盖 Web 利用与后渗透两个阶段,在统一提示词和预算下测试六个前沿系统。GPT-5.5 搭配 Codex 成功率最高,Web 利用任务 16.1%、后渗透任务 31.7%;给出更具体提示后分别升至 33.0% 和 46.3%。评测中还观察到系统发现基准外漏洞,包括 ComfyUI 中一个任意文件写入零日漏洞,并能变异载荷绕过主机防御。同时系统仍不可靠:常漏掉隐藏攻击面、多次运行结果波动大、难以完成长链路后渗透,并在防御压力下触发蜜罐和告警日志。
论文速读
- 前沿 AI 已能做代码审计、漏洞检测与利用,但缺少开放、可复现的多主机 cyber range 基础设施,现有公开 benchmark 多把真实入侵的端到端结构(发现暴露服务、取得初始立足点、内部信息收集、跨主机扩展)抽象掉,难以在贴近真实的条件下及早观察其攻击能力。
- 作者提出 AgentCyberRange:含 15 个真实 Web 应用、110 个漏洞(含 18 个 0-day、56 个 1-day、36 个合成漏洞)的 Web 利用任务,以及 8 个企业式 cyber range、156 台内部主机的后渗透任务,并分 Level-0/1/2 三档提示。配套 CAGE 工具链负责 agent 适配、任务编排、靶场部署、轨迹收集与基于运行时证据的自动验证。
- 在匹配提示与步数预算下评测六个前沿 AI 系统,GPT-5.5 + Codex 成功率最高,Web 利用 16.1%、后渗透 31.7%,给出更具体提示后升至 33.0% 和 46.3%。系统还发现基准外漏洞(如 ComfyUI 任意文件写 0-day)并变异 payload 绕过主机防御;但常漏掉隐藏攻击面、多次运行不稳定、多步后渗透链失败、触发蜜罐并留下告警。
- 只覆盖 Web 利用与后渗透两阶段,未涉及钓鱼、Windows 域攻击、云 IAM 滥用、供应链攻击或社会工程;结果依赖所评测系统、harness、提示、工具与预算,API 不稳定、安全拒答和执行失败会影响成绩;验证器依赖可观测运行时证据,可能低估部分进展或替代攻击路径,基准外漏洞需人工验证。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
该基准把网页利用与后渗透串成端到端链路,并给出六个前沿系统的实测成功率,可供评估自主网络攻击能力时参考。