分析与理论arXiv 2610.03196
研究:人形机器人学习流程四层代理均存在偏离,不止奖励作弊
论证腿式 RL 四层代理在目标缺失时仍报成功
- arXiv
- 2610.03196
- 发表
- 场景
- 具身与机器人
- 测试
- Gaussian MLP(三隐层各 128 ELU,独立 critic,PPO)
- 风险奖励作弊
摘要四层都可能在目标缺失时报告成功。
作者讨论腿式机器人 RL 流水线中,奖励、课程门控、评测统计量和参考运动如何在物理目标缺失时仍报告成功。传统观点只把奖励当作会被优化、因而会偏离的代理。