评测与基准arXiv 2606.14295
AgentCyberRange:复旦团队发布真实网络靶场自主攻击能力基准
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力
- arXiv
- 2606.14295
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- PentestGPT-V2、GPT-5.5、Claude-Opus-4.7 等 7 个
- 风险危险能力
摘要构建开放多靶场评测基础设施 AGENTCYBERRANGE,测定前沿 AI 网络攻击能力并揭示其端到端规划短板。
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力
摘要构建开放多靶场评测基础设施 AGENTCYBERRANGE,测定前沿 AI 网络攻击能力并揭示其端到端规划短板。
提出 RAIM,用交叉拟合堆叠聚合廉价评审检测幻觉
摘要十个廉价评审的堆叠在可采纳区间接近 Sonnet,代价主要是一次域内校准。