跳到正文
10月10日 · 周六

全部论文

找到 53 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 其他arXiv 2610.11959

    MiMo-V2.6:通过扩展强化学习迈向自我改进

    扩展全模态基座的强化学习以支撑智能体自我改进

    发表
    被测模型
    MiMo-V2.6-Pro、MiMo-V2.6-Flash、MiMo-V2.6-Distill-Qwen-9B
    摘要系列用三维扩 RL 与分组评分提升智能体分数,作者称最终表现与前沿模型相当。

    MiMo-V2.6 是全模态 MoE 技术报告,用扩大 RL 计算、环境和评分来追求智能体自我改进。

    深度解读完整解读
  2. 其他arXiv 2610.08740

    Kosoy 提出鲁棒老虎机多项式时间学习器,推进 AI 对齐

    给出线性 robust bandits 特例的多项式时间学习者并证明小推广 NP-hard

    发表
    摘要欧氏球仿射特例可多项式时间达到Õ(√T)。

    这是一篇关于不可实现 bandit 学习之计算边界的理论工作:线性 robust bandits 的一个欧氏球仿射特例有多项式时间、Õ(√T)遗憾的学习者,再做小推广就会落到复杂性坍塌。

    深度解读完整解读
  3. 其他arXiv 2610.02662

    论文发现语言驱动机器人安全监控的细化缺口:安全高层计划可能产生不安全执行

    审计机器人安全监控的细化缺口,比较表面计划与图细化轨迹的裁决

    发表
    摘要表面轨迹可漏掉图诱导的禁区进入。

    作者审计 RoboGuard 的一个假设:对高层动作轨迹的安全裁决,在补上语义图诱导的导航和已记录隐式效应之后是否仍然成立。做法是不改验证器,并固定同一条 LTL。

    深度解读完整解读
  4. 其他arXiv 2610.02092

    TESS:面向大语言模型数据选择的可扩展可迁移元网络需换损失函数

    提出 TESS 与点值匹配损失,训练可迁移的数据选择网络

    发表
    被测模型
    Llama-3-8B-Instruct、Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct 等 4 个
    摘要TESS 用损失差伪标签和 PVM 训练可迁移选择网络,并在安全选择与指令微调上报告跨数据迁移。

    TESS 是一个用于 LLM 训练数据选择的元学习框架:用验证集引导下的损失差做样本伪标签,训练一个能给未见样本打分的选择网络。

    深度解读完整解读
  5. 其他arXiv 2610.00812

    视频生成模型的后训练与对齐综述

    综述视频生成的后训练与对齐,并汇总基准与开放挑战

    发表
    摘要综述把视频后训练分成四类对齐信号,并指出奖励、长视频、权衡和安全仍开放。

    这是一篇视频生成 后训练与对齐 综述:预训练模型已有强先验,但作者认为仍不能可靠遵循意图、维持时间连贯或满足物理与安全约束。

    深度解读完整解读
  6. 其他arXiv 2609.40360

    SCAPO:用反事实稳定性改进 GRPO 的 token 级信用分配

    提出 SCAPO,用半事实稳定性改进 GRPO 的 token 级信用分配

    发表
    被测模型
    Qwen3-4B-Base、Qwen3-1.7B-Base
    摘要SCAPO 在训练早期下调相对不稳定 token 的 GRPO 优势,两个规模上多数基准更高。

    SCAPO 把固定回答在半事实提示下的稳定性,变成 GRPO 训练早期的 token 级负向信用修正。。

    深度解读完整解读
  7. 其他arXiv 2609.39982

    Mid-Harness:在模型与 Harness 之间扩展终端智能体的动作采样

    提出 Mid-Harness,在执行前验证并筛选终端智能体的候选动作

    发表
    被测模型
    TMAX-9B、TMAX-4B、TMAX-27B 等 6 个
    摘要Mid-Harness 在执行前选择候选动作。

    Mid-Harness 在不改生成器和执行 harness 的前提下,于二者之间做动作级测试时计算,用来研究终端智能体里“多采样、再验证”何时提高轨迹成功。

    深度解读完整解读
  8. 其他arXiv 2609.38895

    Unmerge:用任务算术实现高效机器遗忘

    提出 UNMERGE,用任务向量低秩分解做概念级遗忘

    发表
    被测模型
    ResNet-50、ViT-S/16、Llama-3.2-3B-Instruct
    摘要UNMERGE 用低秩任务向量相减做概念级遗忘,类别任务上 ToW 与隐私更接近重训。

    UNMERGE 把近似机器遗忘写成模型合并的逆运算:从已微调的合并任务向量里减去一个学出来的低秩遗忘分量。作者要处理的是概念级请求(一个类或一个语义组),而不是任意单条记录。梯度上升、重标注、蒸馏和显著性方法都靠把遗忘损失写进权重,作者认为它们超参脆弱、无法表达遗忘与保留的共享方向,也缺少逐层诊断。

    深度解读完整解读
  9. 其他arXiv 2609.38807

    PatchHolmes:基于列表式选择的智能体补丁检索系统

    提出 PatchHolmes,用混合检索和列表式智能体选出 CVE 修复提交

    发表
    被测模型
    Qwen3-235B、Qwen3-Coder-30B、gpt-oss-120B 等 4 个
    摘要PatchHolmes 用混合检索和列表式四工具智能体做补丁检索,增益主要来自联合阅读候选而非更换骨干。

    PatchHolmes 是面向补丁检索的两阶段系统:在本地 Git 仓库上用冻结开源权重模型,为一个已知 CVE 找出修复提交,不做按仓库微调,也不使用付费外部搜索 API。

    深度解读完整解读
  10. 其他arXiv 2609.35266

    面向软件交付决策门禁的智能体安全审计器持续保障机制

    提出 TAIP 持续保障,在策略或证据变化后重算仓库审计交付门裁决

    发表
    摘要TAIP 把策略、证据和执行分开,在保留的 RepoAudit 证据上于 5s 预算内重算合并门姿态。

    TAIP 是放在未修改 RepoAudit 之外的保证层,用来在软件交付门上重算智能体安全控制的当前姿态。

    深度解读完整解读
  11. 其他arXiv 2609.34426

    Q-learning Penalized Transformer(QPT):面向安全离线强化学习的训练-推理一致框架

    提出 QPT,用奖励与成本 Q 惩罚训练满足约束的离线强化学习策略

    发表
    摘要QPT 把条件 Transformer 与奖励/成本 Q 惩罚连成训练–推理一致的安全离线 RL 方法。

    QPT 针对安全离线 RL:只从离线数据学习,同时处理约束满足、回报最大化和行为正则,并希望部署时更换成本阈值而无需重训。

    深度解读完整解读