跳到正文
10月8日 · 周四

全部论文

找到 44 篇

另有 757 篇还没有研究类型,暂不在这些分类里。

  1. 其他arXiv:2607.28568 ·

    Frontis-MA1:面向机器学习工程递归自我改进的 AI4AI 模型

    提出 OpenMLE 全栈,用执行反馈后训练机器学习元进化智能体

    编程 Agent测试Frontis-MA1-35B、Qwen3.6-35B-A3B、Frontis-MA1-30B 等 15 个训练与数据层
    摘要OpenMLE 训练 Frontis-MA1-35B,用四个共享算子把 MLE 后训练和长程搜索接成元进化闭环。

    作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序。作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。

    完整解读
  2. 其他arXiv:2610.00812 ·

    视频生成模型的后训练与对齐综述

    综述视频生成的后训练与对齐,并汇总基准与开放挑战

    模型与 API测试Wan、HunyuanVideo、OpenSora 等 8 个训练与数据层
    摘要综述把视频后训练分成四类对齐信号,并指出奖励、长视频、权衡和安全仍开放。

    这是一篇视频生成 后训练与对齐 综述:预训练模型已有强先验,但作者认为仍不能可靠遵循意图、维持时间连贯或满足物理与安全约束。

    完整解读
  3. 综述/立场arXiv:2610.01195 ·

    Federated Agent Optimization:面向隐私约束下分布式智能体协同优化的联邦智能体优化框架

    论文提出 Federated Agent Optimization,把跨机构智能体协作形式化为效用、隐私与通信的多目标优化,并给出组件分类与经验迁移框架。

    摘要FAO 把智能体协作写成效用、隐私和通信的多目标问题,并给出组件分类与迁移框架。

    Federated Agent Optimization(FAO) 是一篇框架论文:多个处在私有环境中的 LLM 智能体,如何在原始数据、完整轨迹和本地知识不离开客户端的前提下协作改进。

    完整解读
  4. 其他arXiv:2610.02092 ·

    TESS:面向大语言模型数据选择的可扩展可迁移元网络需换损失函数

    TESS 用 Pointwise Value Matching 训练可迁移的数据选择网络。

    测试Llama-3-8B-Instruct、Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct 等 5 个
    摘要TESS 用损失差伪标签和 PVM 训练可迁移选择网络,并在安全选择与指令微调上报告跨数据迁移。

    TESS 是一个用于 LLM 训练数据选择的元学习框架:用验证集引导下的损失差做样本伪标签,训练一个能给未见样本打分的选择网络。

    完整解读
  5. 综述/立场arXiv:2609.11873 ·

    人类打造的最后一个 AI:迈向真正的递归自我改进

    论文用 HCI 刻画能力差距,并以五级自主性框架综述递归自我改进(RSI)的回路、场景与工业实践。

    摘要综述用 HCI 和 L1–L5 回路责任,把 RSI 从一次性优化里分离出来。

    这是一篇以改进回路为分析单位的 RSI 综述,用能力缺口和五级自主性说明何种持久更新才算递归自我改进。。

    完整解读
  6. 其他arXiv:2402.00838 ·

    OLMo:加速语言模型科学研究

    Allen AI 发布 OLMo:开放 1B/7B 模型、Dolma 数据与训练评测代码。

    测试OLMo-1B、OLMo-7B、StableLM 1.6B 等 15 个
    摘要OLMo 开放 1B/7B 模型、Dolma 与训练评测工件。

    Allen Institute 发布 OLMo:一套从数据、训练到评测都公开的语言模型框架,用来支持对语言模型能力、弱点、偏见与风险的研究。

    完整解读
  7. 其他arXiv:2609.16915 ·

    ROSETTA:基于混合 CKKS/TFHE 的高效准确隐私保护 LLM 解码框架

    ROSETTA 用自适应分段 LUT 与按算子的 CKKS/TFHE 选择做隐私保护 LLM 解码。

    测试GPT-2 Base、TinyLlama-1.1B、LLaMA-3-8B
    摘要ROSETTA 用分段 LUT 和 DAG 最短路,把 CKKS 与 TFHE 按算子拼进 LLM 解码。

    ROSETTA 是面向 LLM decode 的混合 CKKS/TFHE 隐私推理框架,目标是在 honest-but-curious 两方设定下,让服务器在密文上完成解码,同时保住权重和用户输入。

    完整解读
  8. 其他arXiv:2609.17380 ·

    Open-1B:一次完全可审计的训练运行

    Gensyn 发布 Open-1B:用 RepOps 在异构硬件上按位复现 400B token 预训练,并用集体审计校验每一步。

    测试Open-1B、OLMo 2 1B
    摘要Open-1B 用跨硬件按位算子和集体审计,把 400B token 预训练变成可分步核验的轨迹。

    Open-1B 是 Gensyn 发布的 1.61B 参数 decoder-only 模型,目标是把预训练从“公开配方”推进到每一步可在异构硬件上按位核对。浮点加法非结合、融合乘加、次正规数和平台相关随机数,使同一配方在不同机器上得不到同一权重。概率性的 proof-of-learning / proof-of-training-data 被作者认为不足以排除少量数据注入的后门。

    完整解读
  9. 其他arXiv:2609.21858 ·

    基于泊松过程的可水印多草稿推测采样

    作者用泊松过程构造多草稿投机采样 MPFR,在保持无偏水印的同时提高接受效率。

    测试Qwen2.5-7B-Instruct、Qwen2.5-0.5B-Instruct、Qwen2.5-1.5B-Instruct 等 4 个
    摘要MPFR 用上下文索引的泊松过程做可水印多草稿投机采样,并保持停止时间草稿不变性。

    MPFR 是一种基于泊松过程的多草稿投机采样,用来同时提高解码效率并嵌入无偏水印。

    完整解读