评测与基准arXiv 2610.02206·10月2日KaliBench:面向 Kali Linux 网络安全工具使用的细粒度基准提出 KaliBench,评测模型把安全意图译成 Kali 命令的能力arXiv2610.02206发表10月2日层模型层场景模型与 API被测模型Llama3.1-Instruct 8B、Qwen3 8B、Qwen3 8B thinking 等 15 个风险危险能力深度解读完整解读