arXiv· arXiv:2609.34426· Shengchao Hu·2026-09-28 14:43· 4 天前Q-learning Penalized Transformer(QPT):面向安全离线强化学习的训练-推理一致框架Q-learning Penalized Transformer for Safe Offline Reinforcement LearningAI 导读研究者提出 Q-learning Penalized Transformer(QPT),一种训练-推理一致的框架,将条件序列建模与约束感知的价值估计结合,用于安全离线强化学习。阅读原文arxiv.org#对齐#工具/开源#arXiv