LineupRL:基于描述与时序配对识别的可验证强化学习时间序列描述方法
提出 LineupRL,用描述到序列识别作可验证奖励训练时序描述模型
- arXiv
- 2610.01800
- 发表
- 场景
- 模型与 API
- 测试
- Qwen2.5-VL-3B、Qwen2.5-VL-72B、Qwen3-VL-8B 等 15 个
摘要LineupRL 用统计近邻上的序列识别做可验证奖励,3B 描述器超过 SFT、两种 RL 奖励和 72B 教师。
LineupRL 是给开放式时间序列描述用的 RLVR:不模仿合成参考,而奖励一条描述能否让冻结文本 LLM 从相近序列里认出目标。