跳到正文
10月10日 · 周六

全部论文

找到 5 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 201 篇还没打标签,不在筛选结果里。

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.03073

    SecJev:为 System One 决策模型引入安全专业知识

    提出 SecJev,用场景加权训练把决策模型适配为安全类型化判断

    发表
    被测模型
    SecJev-0.8B、SecJev-2B、SecJev-4B 等 4 个
    摘要SecJev 用共享打分器做安全决策,0.8B 的 task-macro 超过 Kev-9B。

    SecJev 是 0.8B 到 9B 的安全决策模型族,作者称据其所知是首个面向安全的 Jev-like 家族。

    深度解读完整解读
  2. 评测与基准arXiv 2609.29429

    Jev 被用于零样本检测十类对齐失败,中位 AUROC 达 0.886

    提出 RLCDAlignBench,零样本检测多种对齐失败

    发表
    被测模型
    Jev (jev-1.13.0)
    摘要一次通用问题已能给多数对齐失败排序,大的误差来自状态和标签。

    RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。

    深度解读完整解读
  3. 防御arXiv 2609.01046

    HiveTraceGuard-Pro:面向提示注入、越狱与对抗混淆的紧凑生成式护栏

    提出生成式护栏 HiveTraceGuard-Pro,检测提示注入、越狱与混淆

    发表
    被测模型
    HiveTraceGuard-Pro (0.6B)
    摘要0.6B 俄英护栏在自建俄语干净集和 PI-RU 上得分最高,聚合 key 居第三,过阻断和回复精度仍是作者标出的短板。

    HiveTraceGuard-Pro 是面向请求与回复审核的 0.6B 生成式护栏,由 Qwen3-0.6B 经 LoRA 微调,在俄语和英语上训练,只输出一个 safe/unsafe 裁决。

    深度解读完整解读
已经到底了