跳到正文
原文
arXiv· arXiv:2609.34426· Shengchao Hu·· 4 天前

Q-learning Penalized Transformer(QPT):面向安全离线强化学习的训练-推理一致框架

Q-learning Penalized Transformer for Safe Offline Reinforcement Learning

AI 导读

研究者提出 Q-learning Penalized Transformer(QPT),一种训练-推理一致的框架,将条件序列建模与约束感知的价值估计结合,用于安全离线强化学习。

阅读原文arxiv.org