评测与基准arXiv 2610.02206
KaliBench:面向 Kali Linux 网络安全工具使用的细粒度基准
提出 KaliBench,评测模型把安全意图译成 Kali 命令的能力
- arXiv
- 2610.02206
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Llama3.1-Instruct 8B、Mistral-Small-3.2 24B、LLaMA-3.3-Instruct 70B 等 15 个
- 风险危险能力
提出 KaliBench,评测模型把安全意图译成 Kali 命令的能力