跳到正文
10月10日 · 周六

全部论文

找到 18 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 其他arXiv 2610.08740

    Kosoy 提出鲁棒老虎机多项式时间学习器,推进 AI 对齐

    给出线性 robust bandits 特例的多项式时间学习者并证明小推广 NP-hard

    发表
    摘要欧氏球仿射特例可多项式时间达到Õ(√T)。

    这是一篇关于不可实现 bandit 学习之计算边界的理论工作:线性 robust bandits 的一个欧氏球仿射特例有多项式时间、Õ(√T)遗憾的学习者,再做小推广就会落到复杂性坍塌。

    深度解读完整解读
  2. 其他arXiv 2610.02092

    TESS:面向大语言模型数据选择的可扩展可迁移元网络需换损失函数

    提出 TESS 与点值匹配损失,训练可迁移的数据选择网络

    发表
    被测模型
    Llama-3-8B-Instruct、Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct 等 4 个
    摘要TESS 用损失差伪标签和 PVM 训练可迁移选择网络,并在安全选择与指令微调上报告跨数据迁移。

    TESS 是一个用于 LLM 训练数据选择的元学习框架:用验证集引导下的损失差做样本伪标签,训练一个能给未见样本打分的选择网络。

    深度解读完整解读
  3. 其他arXiv 2610.00812

    视频生成模型的后训练与对齐综述

    综述视频生成的后训练与对齐,并汇总基准与开放挑战

    发表
    摘要综述把视频后训练分成四类对齐信号,并指出奖励、长视频、权衡和安全仍开放。

    这是一篇视频生成 后训练与对齐 综述:预训练模型已有强先验,但作者认为仍不能可靠遵循意图、维持时间连贯或满足物理与安全约束。

    深度解读完整解读
  4. 其他arXiv 2609.40360

    SCAPO:用反事实稳定性改进 GRPO 的 token 级信用分配

    提出 SCAPO,用半事实稳定性改进 GRPO 的 token 级信用分配

    发表
    被测模型
    Qwen3-4B-Base、Qwen3-1.7B-Base
    摘要SCAPO 在训练早期下调相对不稳定 token 的 GRPO 优势,两个规模上多数基准更高。

    SCAPO 把固定回答在半事实提示下的稳定性,变成 GRPO 训练早期的 token 级负向信用修正。。

    深度解读完整解读
  5. 其他arXiv 2609.38895

    Unmerge:用任务算术实现高效机器遗忘

    提出 UNMERGE,用任务向量低秩分解做概念级遗忘

    发表
    被测模型
    ResNet-50、ViT-S/16、Llama-3.2-3B-Instruct
    摘要UNMERGE 用低秩任务向量相减做概念级遗忘,类别任务上 ToW 与隐私更接近重训。

    UNMERGE 把近似机器遗忘写成模型合并的逆运算:从已微调的合并任务向量里减去一个学出来的低秩遗忘分量。作者要处理的是概念级请求(一个类或一个语义组),而不是任意单条记录。梯度上升、重标注、蒸馏和显著性方法都靠把遗忘损失写进权重,作者认为它们超参脆弱、无法表达遗忘与保留的共享方向,也缺少逐层诊断。

    深度解读完整解读
  6. 其他arXiv 2609.24983

    onPanda:通过 token 级修正高效标注 LLM 与智能体的 on-policy 对齐数据

    提出 token 级修正工具 onPanda,高效标注 on-policy 对齐数据

    发表
    被测模型
    Doubao-Seed-2.1-pro、GPT-5.5、GPT-5.6-sol 等 9 个
    摘要onPanda 以 token 级修正标注 on-policy 对齐数据,并报告效率与基准分数。

    onPanda 是用 token 级修正标注 LLM 对齐数据与智能体轨迹的交互工具。

    深度解读完整解读
  7. 其他arXiv 2609.24760

    构建逆向思维:提升大语言模型的逆向推理能力

    构造反向推理训练流程,让模型按题切换正反向推理

    发表
    被测模型
    Ours-Q3-14b、Ours-Q3-8b、Ours-Q3-1.7b 等 4 个
    摘要用易难两阶段数据与强化学习,让模型按题选择正向或反向推理。

    作者训练大模型在数学题上建立反向推理,并按题目在正向与反向之间选择,而不是只加长思维链。

    深度解读完整解读
  8. 其他arXiv 2609.17380

    Open-1B:一次完全可审计的训练运行

    提出 RepOps,使分布式预训练可跨硬件按位复现并被审计

    发表
    被测模型
    Open-1B
    摘要Open-1B 用跨硬件按位算子和集体审计,把 400B token 预训练变成可分步核验的轨迹。

    Open-1B 是 Gensyn 发布的 1.61B 参数 decoder-only 模型,目标是把预训练从“公开配方”推进到每一步可在异构硬件上按位核对。浮点加法非结合、融合乘加、次正规数和平台相关随机数,使同一配方在不同机器上得不到同一权重。概率性的 proof-of-learning / proof-of-training-data 被作者认为不足以排除少量数据注入的后门。

    深度解读完整解读
  9. 其他arXiv 2609.15802

    论文建模递归自我改进的经济学:反馈回路尚不足以形成自持加速

    用弹性有向图建模递归自我改进的自持加速条件

    发表
    摘要弹性网络给出自持加速条件。

    递归自我改进会不会变成自持加速,取决于能力提高后下一代能力提高多少,也取决于外生投入不增长时增速会不会随存量上升。作者用有向图把算法效率、能力、研发投入和经济产出连起来,边的强度是弹性。

    深度解读完整解读
  10. 其他arXiv 2402.00838

    OLMo:加速语言模型科学研究

    发布开放语言模型 OLMo、Dolma 数据与训练评测代码

    发表
    被测模型
    OLMo-1B、OLMo-7B、OLMo+SFT 等 4 个
    摘要OLMo 开放 1B/7B 模型、Dolma 与训练评测工件。

    Allen Institute 发布 OLMo:一套从数据、训练到评测都公开的语言模型框架,用来支持对语言模型能力、弱点、偏见与风险的研究。

    深度解读完整解读
已经到底了