评测与基准arXiv 2610.02206
KaliBench:面向 Kali Linux 网络安全工具使用的细粒度基准
提出 KaliBench,评测模型把安全意图译成 Kali 命令的能力
- arXiv
- 2610.02206
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gemma-3-it 27B、Llama3.1-Instruct 8B、Qwen3 8B 等 15 个
- 风险危险能力
提出 KaliBench,评测模型把安全意图译成 Kali 命令的能力
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
提出 GSU 在发布前封堵敏感门梯度,抵抗下游微调获取禁止能力
Gradient-Sealed Unlearning(GSU)是一种发布前的 preemptive unlearning:不删除模型里已经有的能力,而是让指定禁止域能力更难被发布后的微调获取。