跳到正文
事件持续更新

Jev 网关提示注入检测器基准测试

2 篇报道2 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月1日,Jev 在 GitHub 发布提示注入检测器基准测试,在同一台 Apple M4 机器上对比 Jev 1.13.0、Kev-4B、Kev-0.8B、Laya、GLiNER2.5-Decide、ProtectAI DeBERTa、Prompt Guard 2 及关键词规则,覆盖文档块注入与用户消息越狱两类任务。文档块测试中,Jev AUC 为 1.00、冻结阈值下召回 100%、误报 8%;Kev-4B 为 0.90 和 70%;Prompt Guard 2 为 0.83 和 19%。2026年10月6日,思科发布内容安全任务对比评测,在 24 个危害类别、6 个评测数据集上对比零样本决策模型 Jev(TypeSafe)与 Laya(ConvAI Innovations)及自训练的 1B 参数编码器分类器;在 0.5% 误报预算下,自训练模型在全部 6 个数据集上召回率最高,Jev 在 6 个中的 5 个 AUC 领先 Laya。思科多轮测试集上,自训练模型召回 61%、Jev 34%、Laya 几乎为零。

AI 根据报道生成 · 2 小时前更新

事件进展

2 个进展
  1. 10月6日 06:40 · 1 篇报道
    Cisco对比决策模型与分类器的内容安全评测
    Cisco:Jev 决策模型在内容安全任务上的对比评测:与传统分类器及 LLM 判官谁更强
  2. 10月1日 18:18 · 1 篇报道
    Jev网关提示注入检测器基准测试
    Jev Gateway Study:Jev 与开源决策模型的提示注入检测器基准测试

后续时间线

报道和讨论按时间排:从发布、媒体跟进到各平台的讨论。

10月6日
  1. Cisco
    Jev 决策模型在内容安全任务上的对比评测:与传统分类器及 LLM 判官谁更强

    思科在 24 个危害类别、6 个评测数据集上对比了零样本决策模型 Jev(TypeSafe)与 Laya(ConvAI Innovations)和自训练的 1B 参数编码器分类器,在 0.5% 误报预算下,自训练模型在全部 6 个数据集上召回率最高,Jev 在 6 个中的 5 个 AUC 领先 Laya。Cisco 多轮测试集上,自训练模型召回 61%、Jev 34%、Laya 几乎为零。Jev 另与 Gemma 4 31B(关闭思考)在 8 个公开基准上对比,Jev 在 7 个基准 AUC 更高、1 个持平。

10月1日
  1. Jev Gateway Study精选
    Jev 与开源决策模型的提示注入检测器基准测试

    该基准在同一台 Apple M4 机器上对比 Jev 1.13.0、Kev-4B、Kev-0.8B、Laya、GLiNER2.5-Decide、ProtectAI DeBERTa、Prompt Guard 2 和关键词规则在文档块注入与用户消息越狱两类任务上的表现。文档块测试中 Jev AUC 为 1.00、冻结阈值下召回 100%、误报 8%,Kev-4B 为 0.90 和 70%,Prompt Guard 2 为 0.83 和 19%;对不直接提及 AI 的隐蔽攻击,Jev 召回 97%,Kev-4B 62%,三个专用注入分类器接近随机水平。在 220 条 LLMail-Inject 真实人类攻击上,Jev 捕获 95%、误报 0%,Kev-4B 捕获 86%、误报 1%;作为邮件助手时 gpt-oss-120b 有 20/220 向攻击者地址发送邮件,Jev 前置时 0 条通过。

相关讨论

各平台上讨论这件事的帖子和转述:不单独成文,只列链接和一句原文。72 小时的讨论链接数还含 1 篇报道,见后续时间线。

共 1 条

关注度走势

关注度会随讨论变化:新来源越多越新越高,讨论停了回落到初评。

每天新增来源

6 天共 3 个·最多 1(10月1日)·今天 1

  • 10月1日 新增 1 个来源(1 家媒体、0 个账号)
  • 10月2日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月3日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月4日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月5日 新增 1 个来源(0 家媒体、1 个账号)
  • 10月6日 新增 1 个来源(1 家媒体、0 个账号)

每小时关注度

当前关注度 42·可比范围峰值 43(10月6日 07:00)·近 24 小时可比范围变化 +16%

020406010月1日23:0010月3日10:0010月4日21:0010月6日08:00

趋势只比较一直被完整观测到的同一批信源,范围可能比当前关注度小。移动指针或点击图表查看每小时关注度;键盘可用左右方向键切换。