跳到正文
10月10日 · 周六

全部论文

找到 5 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 232 篇还没打标签,不在筛选结果里。

另有 232 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 其他arXiv 2609.26457

    Weco AI 提出 AIDE2:AI 研究智能体递归自我改进 8 天获七次提升

    提出双层系统 AIDE2,使研究智能体自改进 Harness 并对比人类研发基线

    发表
    被测模型
    gemini 3 flash、gpt-5.6-sol、fable 5

    摘要提出双层递归自改进系统 AIDE2,在固定预算下演化 Harness 代码,多项留出基准超越人类基线并降低奖励黑客。

    深度解读完整解读
  2. 评测与基准arXiv 2607.27191

    研究者提出影子评测:前沿 Agent 六天未能完成两篇 NeurIPS 投稿级研究

    提出影子评测,衡量 Agent 自主完成开放式 AI 科研的能力

    发表
    被测模型
    Claude Opus 4.8、GPT-5.6 Sol、GPT-5.3 Codex

    摘要论文通过影子评测发现前沿智能体能独立胜任科研工程实现,但在科学探索与有效利用反馈上未达到顶会门槛。

    深度解读完整解读
  3. 评测与基准arXiv 2607.18665

    SciHazard:面向科研安全的危险能力评测基准与分解式危害评分

    构建 SciHazard 基准,评测科研智能体与 LLM 的科学危险能力

    发表
    被测模型
    WebThinker + DeepSeek-R1、InternAgent、Gemini Deep Research 等 19 个
    摘要SciHazard 用分解评分测科学滥用风险,作者称智能体抬高了可执行危害。

    SciHazard 是一个科学滥用风险基准,配一个把危害拆开再合成的自动分数。

    深度解读完整解读
已经到底了