跳到正文
10月10日 · 周六

全部论文

找到 4 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2609.33401

    论文评估 System One 模型在 Agent 安全决策中的可靠性、校准与选择性自动化

    评测 System One 模型对 Agent 安全输入的分类可靠性与校准

    发表
    被测模型
    Jev 1.13、Laya, English checkpoint、Decider, approximately 2B 等 4 个
    摘要离线评测表明,安全判定的总体分数和校准不能代替分组误差和带预算的自动决策检查。

    Liu 离线评测 System One 模型能否为智能体安全输入给出可自动化的概率决策。问题是分类是否可靠,以及概率能否在指定漏检和误拦上限内支持放行、拦截或复核。

    深度解读完整解读
  2. SEAV:面向大语言模型越狱评测的有效性验证框架

    提出 SEAV,逐步核验越狱回复的事实与操作有效性

    发表
    摘要SEAV 用逐步检索和依赖检查重判越狱成功,SD-A 与三个基准上的原成功标签都有一批被改判。

    SEAV 是一层生成后的越狱评测:回复要相关、事实正确、顺序合规,并且在操作上足以推进有害意图,才算成功。。

    深度解读完整解读
  3. 研究:LLM 安全评判模型难以按新上下文与安全定义调整判断

    评测安全 LLM-judge 对新上下文与新政策的改判能力

    发表
    被测模型
    GPT-5-2、GPT-5-mini-08-2025、Claude-4-5-Sonnet 等 13 个
    摘要作者形式化两种 judge 属性,称新 context 只在先验弱时有用,新政策则很难改判。

    作者度量的不是 judge 与某一套人工标签有多一致,而是它会不会吸收新 context、会不会改用另一套安全政策。

    深度解读完整解读
已经到底了