跳到正文
原文
Cisco· Prashanth Arun·本站收录 · 原文发表

Jev 决策模型在内容安全任务上的对比评测:与传统分类器及 LLM 判官谁更强

Jev: Decision Models on Trial

AI 导读

思科在 24 个危害类别、6 个评测数据集上对比了零样本决策模型 Jev(TypeSafe)与 Laya(ConvAI Innovations)和自训练的 1B 参数编码器分类器,在 0.5% 误报预算下,自训练模型在全部 6 个数据集上召回率最高,Jev 在 6 个中的 5 个 AUC 领先 Laya。Cisco 多轮测试集上,自训练模型召回 61%、Jev 34%、Laya 几乎为零。Jev 另与 Gemma 4 31B(关闭思考)在 8 个公开基准上对比,Jev 在 7 个基准 AUC 更高、1 个持平。

阅读原文blogs.cisco.com