跳到正文
10月9日 · 周五

全部论文

找到 4 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 466 篇还没打标签,不在筛选结果里。

另有 466 篇论文还没打上分类标签,暂不在筛选结果里。

  1. BioSecBench-Refusal:面向智能体生物安全风险评估的配对基准

    提出 BioSecBench-Refusal,评测智能体生物安全拒答是否对准风险

    发表
    测试
    Opus 4.8、Opus 4.7、Opus 4.6 等 10 个
    摘要配对基准显示拒绝多由 API 触发,合法任务常被拒得不少于隐蔽危害。

    BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。

    深度解读完整解读
  2. 其他arXiv 2609.39982

    Mid-Harness:在模型与 Harness 之间扩展终端智能体的动作采样

    提出 Mid-Harness,在执行前验证并选择终端智能体的候选动作

    发表
    测试
    TMAX-9B、TMAX-4B、TMAX-27B 等 8 个
    摘要Mid-Harness 在执行前选择候选动作。

    Mid-Harness 在不改生成器和执行 harness 的前提下,于二者之间做动作级测试时计算,用来研究终端智能体里“多采样、再验证”何时提高轨迹成功。

    深度解读完整解读
已经到底了