跳到正文
10月10日 · 周六

全部论文

找到 2 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 196 篇还没打标签,不在筛选结果里。

另有 196 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2605.19722

    研究用 30 项漏洞分析任务评测自主安全智能体的安全对齐效果

    评测自主安全智能体在授权漏洞分析中的对齐拒答效应

    发表
    被测模型
    Gemma 4 31B official instruction-tuned model、TrevorJS Gemma 4 31B uncensored GGUF、Gemma 4 26B A4B official instruction-tuned model 等 8 个
    摘要轨迹级评测把拒答、接地、工具接口分开。

    这项工作把安全对齐效应测成自主安全智能体的轨迹属性,而不是单轮拒答率。

    深度解读完整解读
已经到底了