跳到正文
10月9日 · 周五

全部论文

找到 2 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 648 篇还没打标签,不在筛选结果里。

另有 648 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 其他arXiv 2607.28568

    Frontis-MA1:面向机器学习工程递归自我改进的 AI4AI 模型

    提出 OpenMLE 全栈,用执行反馈后训练机器学习元进化智能体

    发表
    测试
    Frontis-MA1-35B、Qwen3.6-35B-A3B、Frontis-MA1-30B 等 15 个
    摘要OpenMLE 训练 Frontis-MA1-35B,用四个共享算子把 MLE 后训练和长程搜索接成元进化闭环。

    作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序。作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。

    深度解读完整解读
  2. 评测与基准arXiv 2609.39533

    CATCH:面向编码 RL 奖励作弊的可控分析测试台

    提出 CATCH 测试台,复现编码 RL 的奖励作弊

    发表
    测试
    Qwen3-4B、Qwen3.5-Plus、Qwen3.5-27B
    摘要CATCH 用双运行金标签研究编码 RL 的奖励黑客,并观察到监控会被注释适应削弱。

    CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。

    深度解读完整解读
已经到底了