跳到正文
10月9日 · 周五

全部论文

找到 1 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 465 篇还没打标签,不在筛选结果里。

另有 465 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.03196

    研究:人形机器人学习流程四层代理均存在偏离,不止奖励作弊

    论证腿式 RL 四层代理在目标缺失时仍报成功

    发表
    测试
    Gaussian MLP(三隐层各 128 ELU,独立 critic,PPO)
    摘要四层都可能在目标缺失时报告成功。

    作者讨论腿式机器人 RL 流水线中,奖励、课程门控、评测统计量和参考运动如何在物理目标缺失时仍报告成功。传统观点只把奖励当作会被优化、因而会偏离的代理。

    深度解读完整解读
已经到底了