Jev 网关提示注入检测器基准测试
先了解这件事
2026年10月1日,Jev 在 GitHub 发布提示注入检测器基准测试,在同一台 Apple M4 机器上对比 Jev 1.13.0、Kev-4B、Kev-0.8B、Laya、GLiNER2.5-Decide、ProtectAI DeBERTa、Prompt Guard 2 及关键词规则,覆盖文档块注入与用户消息越狱两类任务。文档块测试中,Jev AUC 为 1.00、冻结阈值下召回 100%、误报 8%;Kev-4B 为 0.90 和 70%;Prompt Guard 2 为 0.83 和 19%。2026年10月6日,思科发布内容安全任务对比评测,在 24 个危害类别、6 个评测数据集上对比零样本决策模型 Jev(TypeSafe)与 Laya(ConvAI Innovations)及自训练的 1B 参数编码器分类器;在 0.5% 误报预算下,自训练模型在全部 6 个数据集上召回率最高,Jev 在 6 个中的 5 个 AUC 领先 Laya。思科多轮测试集上,自训练模型召回 61%、Jev 34%、Laya 几乎为零。
AI 根据报道生成 · 2 小时前更新
事件进展
- 10月6日 06:40 · 1 篇报道Cisco对比决策模型与分类器的内容安全评测
- 10月1日 18:18 · 1 篇报道Jev网关提示注入检测器基准测试
后续时间线
- CiscoJev 决策模型在内容安全任务上的对比评测:与传统分类器及 LLM 判官谁更强
思科在 24 个危害类别、6 个评测数据集上对比了零样本决策模型 Jev(TypeSafe)与 Laya(ConvAI Innovations)和自训练的 1B 参数编码器分类器,在 0.5% 误报预算下,自训练模型在全部 6 个数据集上召回率最高,Jev 在 6 个中的 5 个 AUC 领先 Laya。Cisco 多轮测试集上,自训练模型召回 61%、Jev 34%、Laya 几乎为零。Jev 另与 Gemma 4 31B(关闭思考)在 8 个公开基准上对比,Jev 在 7 个基准 AUC 更高、1 个持平。
- RedditReddit r/LocalLLaMA· 讨论Benchmarking decision models is fun - Clef Q8 vs Jev(新标签页打开原帖)
- Jev Gateway Study精选Jev 与开源决策模型的提示注入检测器基准测试
该基准在同一台 Apple M4 机器上对比 Jev 1.13.0、Kev-4B、Kev-0.8B、Laya、GLiNER2.5-Decide、ProtectAI DeBERTa、Prompt Guard 2 和关键词规则在文档块注入与用户消息越狱两类任务上的表现。文档块测试中 Jev AUC 为 1.00、冻结阈值下召回 100%、误报 8%,Kev-4B 为 0.90 和 70%,Prompt Guard 2 为 0.83 和 19%;对不直接提及 AI 的隐蔽攻击,Jev 召回 97%,Kev-4B 62%,三个专用注入分类器接近随机水平。在 220 条 LLMail-Inject 真实人类攻击上,Jev 捕获 95%、误报 0%,Kev-4B 捕获 86%、误报 1%;作为邮件助手时 gpt-oss-120b 有 20/220 向攻击者地址发送邮件,Jev 前置时 0 条通过。
相关讨论
- RedditReddit r/LocalLLaMABenchmarking decision models is fun - Clef Q8 vs Jev(新标签页打开原帖)
关注度走势
每天新增来源
- 10月1日 新增 1 个来源(1 家媒体、0 个账号)
- 10月2日 新增 0 个来源(0 家媒体、0 个账号)
- 10月3日 新增 0 个来源(0 家媒体、0 个账号)
- 10月4日 新增 0 个来源(0 家媒体、0 个账号)
- 10月5日 新增 1 个来源(0 家媒体、1 个账号)
- 10月6日 新增 1 个来源(1 家媒体、0 个账号)
每小时关注度
趋势只比较一直被完整观测到的同一批信源,范围可能比当前关注度小。移动指针或点击图表查看每小时关注度;键盘可用左右方向键切换。