评测与基准arXiv 2610.02206
KaliBench:面向 Kali Linux 网络安全工具使用的细粒度基准
提出 KaliBench,评测模型把安全意图译成 Kali 命令的能力
- arXiv
- 2610.02206
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- DeepSeek-V3.2 685B、Llama3.1-Instruct 8B、Qwen3 8B 等 15 个
- 风险危险能力
提出 KaliBench,评测模型把安全意图译成 Kali 命令的能力
构建 PrivEscalate 评测 Linux 提权并设计 PrivEscAgent
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力
摘要构建开放多靶场评测基础设施 AGENTCYBERRANGE,测定前沿 AI 网络攻击能力并揭示其端到端规划短板。