跳到正文
原文
arXiv:对齐、欺骗与监督· arXiv:2610.01800· Haochen Zhang, Laura Yao, Zachary Plotkin, Gengwei Zhang, Tianlong Chen·本站收录 · 原文发表

LineupRL:基于描述与时序配对识别的可验证强化学习时间序列描述方法

LineupRL: Verifiable Reinforcement Learning for Time Series Captioning via Caption-to-Series Identification

论文速读

对齐/训练方法

据论文 PDF 整理(AI 生成),以原文为准

LineupRL 用冻结 LLM 在统计近邻中做 caption-to-series 识别作可验证奖励,3B VLM 在 BEDTime 与 CaTS-Bench 上全面超过 SFT 与两种 RL 奖励,并在 6 项指标上超过 72B 教师。

问题
时间序列开放式描述依赖合成标注做 SFT,会学到流畅但不贴合序列的 ungrounded captioning;图像描述常用的 LLM 打分和可回答性奖励又难迁移:前者易被钻空子,后者要求模型具备当前尚不具备的时间序列理解。
方法
LineupRL 把折线图交给 VLM 生成描述,再用冻结文本 LLM 只看描述和原始数值,从与目标在均值、标准差、最值上相近的真实序列中认出目标;奖励是 K 个位置上的识别准确率。训练用 RLOO,不需要参考描述。
实验与结果
同一 Qwen2.5-VL-3B 初始化下,LineupRL 在 BEDTime 与 CaTS-Bench 的蕴含和双向识别共六列上均高于 SFT、可回答性奖励和 LLM 评判奖励,并高于 72B 教师。只看描述的预测与重建中,它在八个误差格里最低,其中七格显著;ETTm2 预测上不如 72B。
局限与可以继续做的
作者把更长、多元序列以及 VLM 以外的描述器留给后续工作。评测覆盖 BEDTime、CaTS-Bench 和四个预测语料;识别由未参与训练的 GLM-4-9B 与 Phi-4-14B 取平均,训练验证器为 Qwen2.5-14B-Instruct。
实验设置Qwen2.5-VL-3B、Qwen2.5-VL-72B 等 · BEDTime、CaTS-Bench 等 · Entailment、cap→ser identification 等
模型
Qwen2.5-VL-3BQwen2.5-VL-72BQwen3-VL-8BInternVL3-14BPhi-3.5-miniQwen2.5-7BQwen2.5-14BChatTS-14BQwen2.5-VL-3B-InstructQwen2.5-14B-InstructGLM-4-9BPhi-4-14BEmbeddingGemma-300MDeBERTaClaude Opus 5
基准
BEDTimeCaTS-BenchTSFragment-600KETTh2ETTm2Saugeen river flowAustralian electricity demand
指标
Entailmentcap→ser identificationser→cap identificationforecasting MSEreconstruction MSE
AI 导读全文 240 字

LineupRL 提出一种带可验证奖励的强化学习流程,其奖励来自"描述—时序配对识别"——由冻结的大语言模型作为验证器读取生成的文字描述与候选时间序列原始数值,从多个干扰项中选出所描述的序列。该设计使现成大语言模型即可提供奖励信号,在两个时间序列描述基准以及仅依据描述进行预测和重建的任务上全面优于 SFT 与 RL 基线。经该方法训练的 3B 视觉语言模型参数仅为蒸馏源 72B 模型的 1/24,却取得更好表现,且案例研究表明它能抵抗奖励作弊并同时刻画趋势与标注关键点的取值。

深度解读

6 个问题,约 8,900 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    合成标注上的 SFT 学不会读序列,现有描述奖励又难迁移,需要可验证且抗钻空子的奖励。

    开放式时间序列描述缺少可验证奖励:SFT 被合成参考束缚,图像侧的 LLM 打分和可回答性奖励又分别容易被钻空子或超出当前模型的时间序列理解。

    • 场景与重要性:时间序列记录系统随时间的变化,医疗、金融和气候决策依赖准确读图。描述把信号写成自然语言,既方便人行动,也给面向语言的系统一个文本接口。作者举新生儿重症监护的例子:文本摘要比趋势图更能帮助选择治疗(Law et al., 2005)。
    • SFT 的不足:人工描述只存在于小集合,现有配对多由更大模型生成,或由已知属性构造。作者认为模仿这些描述无法超过写描述的模型,还会继承“听起来合理但不正确”的说法;配对有限时,描述器可能记住参考而非读序列,迁移差。作者把这种流畅但漏掉重要特征的失败称为 ungrounded captioning。他们自己的实验里,用 72B 教师描述微调 3B VLM,BEDTime 上对参考的蕴含没有提高,CaTS-Bench 上 series-to-caption 识别低于未微调初始化(Table 1)。
    • 现有 RL 奖励不够用:RL 可以从自身样本学习、不必配对,但图像描述的代表奖励迁到时间序列不好用。LLM-as-judge 的分数不可验证,作者观察到描述器学会应付评分者。可回答性奖励要求写出好问题并给出正确答案,而这需要当前模型大体不具备的时间序列理解。作者提出奖励须同时满足三点:抵抗 reward hacking;只要求现有 LLM/VLM 能提供的理解;奖励重要且有区分度的特征。
    • 核心观察:一条描述若让只看文字的读者能从相近备选中认出对应序列,就算接地且具体。匹配比写题或打分更轻,现成 LLM 就能当验证器。
    • 本文提出:LineupRL,一种可验证奖励强化学习(RLVR)流程。冻结 LLM 验证器只读生成描述和原始数值(不看图),从统计量匹配的干扰项中选出被描述的序列,奖励为识别准确率。不需要参考描述。评测同时看蕴含、双向识别,以及只看描述时的预测与重建。
  2. 有哪些相关研究?

    相关工作分 RLVR、时间序列描述和图像描述强化学习;检索式听者最接近,但依赖图文配对。

    作者把相关工作分成三组,并在引言里用 CaTS-Bench、BEDTime 说明开放式描述的现状。

    可验证奖励的强化学习

    • RLHF 与 RLVR:RLVR 用对采样输出的程序化检查代替 RLHF(Ouyang et al., 2022)的偏好模型,并用无评论家的组估计器优化,如 GRPO(Shao et al., 2024)和 RLOO(Kool et al., 2019; Ahmadian et al., 2024)。
    • 从可判定任务到开放式任务:作者称 RLVR 最直接用于规则能直接判定对错的任务(Shao et al., 2024; Guo et al., 2025; Zhang et al., 2026),后来靠为开放式任务设计验证器扩展。近期设计包括把主观答案拆成可检查条目的 rubric(Gunjal et al., 2026; Huang et al., 2025)、对照外部环境的结果检查(Jin et al., 2025; Zheng et al., 2025),以及下游效用(Berthon & van der Schaar, 2025)。

    时间序列描述

    • 从规则到语言模型:早期系统把数据的显式模型说出来,包括高斯过程报告、按效用排序的趋势和可执行模式程序(Lloyd et al., 2014; Jandaghi & Pujara, 2020; Jhamtani & Berg-Kirkpatrick, 2021)。语言模型后来自己写描述,或作为时间序列 LLM 的一种能力(Trabelsi et al., 2025; Lin et al., 2026; Xie et al., 2024; Feng et al., 2026)。
    • 已有 RL 与基准:时间序列上的 RL 用于任务本身已有可验证目标的情形(Zhang et al., 2025; Fan et al., 2026; Liu et al., 2026; Hou et al., 2026)。BEDTime(Sen et al., 2025)和 CaTS-Bench(Zhou et al., 2026)评测当前模型的描述能力;特征级探测(Fons et al., 2024a; Merrill et al., 2024)间接测同一能力。作者称本文的输出就是描述本身,奖励是冻结验证器能否只凭描述认出序列,不涉及下游任务或标签。

    图像描述的强化学习

    • 指标、人类反馈与模型打分:指标奖励对照人工参考给采样描述打分,自批判基线后成为常规做法(Rennie et al., 2017; Liu et al., 2017)。人类反馈用评分或书面修改代替指标(Fidler et al., 2017; Seo et al., 2020)。模型打分用冻结跨模态编码器,按与图像的相似度(Cho et al., 2022; Dzabraev et al., 2024)或检索(Luo et al., 2018; Dessì et al., 2023; Chaffin et al., 2024)评分。
    • 评判与效用奖励:评判奖励用带 rubric 或已核验原子主张的 LLM 评判(Huang et al., 2026; Li et al., 2026; Ye et al., 2026; Tang et al., 2026)。效用奖励让描述服务下游任务,例如问答(Fisch et al., 2020; Xing et al., 2026)或安全决策(Ma et al., 2026)。

    基线与基准

    • 对比基线:同一 Qwen2.5-VL-3B-Instruct 初始化上的 SFT(蒸馏 Qwen2.5-VL-72B-Instruct 对同一批图的描述)、CapRL 式可回答性奖励(Xing et al., 2026),以及 LLM-as-judge。三种 RL 共用策略优化超参和冻结的 Qwen2.5-14B-Instruct。参照模型包括该 72B、另外两个现成 VLM、三个把数值当数字读的文本 LLM,以及 ChatTS-14B。
    • 基准/数据集:描述指标在 BEDTime 与 CaTS-Bench 上;信息瓶颈在 ETTh2、ETTm2、Saugeen river flow 和 Australian electricity demand 上。训练片段来自 TSFragment-600K。

    作者把检索式听者视为精神上最接近的工作:听者须在干扰项中选出被描述的图像,但依赖在图文配对上训练的检索模型,而时间序列没有这类数据,干扰项也是随机或按图像相似度抽取。LineupRL 改用只读原始数值的冻结文本 LLM,不训练检索模型,干扰项是按汇总统计匹配的真实序列,并用可验证奖励优化 VLM 策略。

  3. 论文如何解决这个问题?

    VLM 看折线图写描述,冻结 LLM 在统计近邻中做四选一,奖励为位置轮换后的识别准确率。

    LineupRL 把 RLVR 用在看折线图的 VLM 描述器上:奖励不是打分,而是冻结文本 LLM 能否只凭描述,从汇总统计相近的真实序列里认出目标。

    问题设定

    • 对象:领域无关的单变量序列 x = (x1, …, xT),长度 T 随样本变化,x 来自分布 D。渲染器 ρ 把序列画成折线图,带曲线和部分坐标刻度,没有逐点数值标签。
    • 策略:VLM 描述器 πθ 读 ρ(x),采样自然语言描述 c。训练只更新 θ。质量用三类标准衡量:是否蕴含参考描述、双向识别、以及把描述当作信息瓶颈时的重建与预测误差。
    • 符号:每个识别任务有 K ≥ 2 个候选。φ(x) = (mean, std, min, max)。训练干扰集 N(x) 有 K−1 条序列,候选集 C(x) = {x} ∪ N(x)。评测用另一套按同样统计近邻构造的候选,且不读描述。验证器是收到描述和 K 个候选后回答位置的 LLM。训练验证器记为 R;评测用另一个不必与 R 相同的冻结 LLM,分别做 cap→ser(R_c→s)和 ser→cap(R_s→c)。

    训练目标与 RLOO

    • 目标:给定奖励 r(c, x),最大化 J(θ) = E_{x∼D} E_{c∼πθ(·|ρ(x))} [r(c, x)]。优化器用 REINFORCE leave-one-out(RLOO)。
    • 一步更新:每步从 D 抽 B 条序列。对每条序列独立采样 G 条描述并打分。第 i 条描述的优势是它的奖励减去同组其余 G−1 条奖励的均值,用作降方差基线。策略梯度按这组优势对 log πθ 的梯度上升。
    • 输入为何是图:作者称把序列渲染成折线图后,输入不随序列长度增长。图上只有少量 x、y 刻度,没有标题、图例、序列名、单位或逐点标签,使策略不能靠数据集名或从图上读出数值。

    识别奖励与干扰项

    • 验证器看到什么:冻结 LLM 只收到描述和印成原始数字的 K 个候选,不看图。作者称 VLM 验证器的图表理解弱,会给奖励加噪声。
    • 位置轮换:固定一个位置只问一次会有噪声和位置偏差。对每个位置 p 把真序列插入该位,共问 K 次。acc(c, x) 是答对的比例,奖励 r(c, x) = λ acc(c, x),λ = 2。作者称:对验证器说话或泛泛描述不会改变答案;编造一个碰巧对上干扰项的数值会把验证器引到错误候选,因此只有接地且有区分度的内容得到奖励。
    • 为何不用合成干扰:打乱、反转或剪切粘贴得到的干扰项容易被识破。该构造下,验证器不读描述也能以 72.5% 认出 x。LineupRL 改为从与 x 等长的其他真实序列中抽取。
    • 近邻规则:在等长、且与 x 的最长重叠不超过 ηT 的序列中,取 φ 的 L2 距离最近的 K−1 条。训练时先取八个最近的合格邻居作为池,每步从中重抽 K−1 条,避免过拟合固定干扰集;验证条目保持一套固定干扰项。主实验 K = 4。作者称候选在长度和汇总统计上与目标一致后,验证器必须依靠更细的形状描述才能区分。

    评测协议

    • 生成:推理时贪心解码,每条序列一条描述。三个标准都是评测集上的经验平均,实现细节在附录 B。
    • 蕴含:固定 NLI 模型给出前提蕴含假设的概率 q。生成描述为前提下、参考描述为假设,Ab 是 q ≥ τ 的参考占比,允许生成描述说得更多;反方向不报告。CaTS-Bench 的参考含日期、地点、领域和精确值,而裸图不带这些信息,该基准的蕴含改对 Claude Opus 5 删去这些内容后的参考计分。
    • 双向识别:cap→ser 与训练奖励同一任务,但验证器是 R_c→s,候选来自评测近邻。ser→cap 给验证器序列 x 和同一描述器为评测候选集各成员写的描述,让它找出写给 x 的那条。两个方向都在 K 个插入位置上平均,以避开位置偏差。评测候选只由序列构造,不同描述器共用。
    • 信息瓶颈:在每个语料按时间最早的窗口上拟合只读描述的解码器,在最晚窗口上报误差,使测试目标不早于任何训练窗口。目标分两种:所描述窗口之后的预测视野,以及窗口本身的重建。序列从不输入解码器。作者称低误差必要但不充分,因为只点出数据集共性模式也会得低误差却识别不出个体,因此对照三个参照:从不读描述的预测器、在空描述上重拟合的解码器,以及每个窗口配上另一窗口描述的 detachment 对照。描述只有误差远低于这些参照才算提供了信息。
  4. 论文做了哪些实验?

    同一 3B 初始化上,LineupRL 六项描述指标均最高,八个预测/重建格中七格误差最低。

    实验设置

    • 训练数据:从 TSFragment-600K 按固定种子抽 10,000 个片段,三种长度大致均匀。评测序列与训练片段不重叠。
    • 被测与参照模型:所有训练模型从 Qwen2.5-VL-3B-Instruct 出发,提示词相同。对比未微调初始化、用 Qwen2.5-VL-72B-Instruct 描述做的 SFT、可回答性 RL、LLM-as-judge RL。三种 RL 的奖励背后都是冻结的 Qwen2.5-14B-Instruct,分别担任验证器、可回答性的作答者和评判者。参照还有 Qwen2.5-VL-72B、Qwen3-VL-8B、InternVL3-14B、读原始数字的 Phi-3.5-mini、Qwen2.5-7B、Qwen2.5-14B,以及 ChatTS-14B。
    • 基准:标准 1、2 在 BEDTime 与 CaTS-Bench。标准 3 在 ETTh2、ETTm2、Saugeen river flow、Australian electricity demand,按时间切分。每个识别任务 K = 4,随机水平为 0.25。
    • 指标与评审:蕴含用冻结 DeBERTa long-NLI,生成描述为前提。识别报告两个未参与任何训练的冻结 LLM(GLM-4-9B 与 Phi-4-14B)的平均;另外三个验证器的读数在附录 C.1。预测与重建用冻结 EmbeddingGemma-300M 加 LoRA 和 MLP 头,各描述器配方相同,报五个训练种子的均值和标准差。Table 2 的粗体表示不显著差于该列最佳的微调模型,显著性检验放在附录 B.5。
    • 主对比范围:Table 1 的粗体只在同一初始化微调出的四个模型中取最佳。

    主结果

    Table 1 中,同一初始化的四个微调模型(BEDTime / CaTS-Bench):

    表格较宽,可左右滑动

    描述器BED 蕴含BED c→sBED s→cCaTS 蕴含CaTS c→sCaTS s→c
    未微调 Qwen2.5-VL-3B0.2960.5500.4950.3520.7510.721
    SFT(72B 描述)0.2810.5700.4480.4080.7600.616
    RL,可回答性0.2860.4480.4430.2990.5990.560
    RL,LLM-as-judge0.1180.5440.4120.0330.6940.589
    LineupRL0.4000.7090.6380.6110.8860.868
    • 作者的解读:四个微调模型里 LineupRL 六列都最好。可回答性在四个识别列上都低于初始化。LLM-as-judge 在四个识别列中的三列上比可回答性掉得少,但蕴含落到 0.118 和 0.033,低于基座。相对 72B 教师(BEDTime 蕴含 0.320、c→s 0.605、s→c 0.484;CaTS 0.440、0.803、0.643),作者称 LineupRL 以 1/24 的参数在六列上都领先,说明合适的 RL 可以把 VLM 的描述能力提到蒸馏之上。
    • 读数值的 LLM:Table 1 中 Qwen2.5-14B 的识别最高(BEDTime c→s 0.919、s→c 0.838;CaTS 0.991、0.938),但 CaTS 蕴含 0.535,仍低于 LineupRL 的 0.611。作者称读原始值主要帮助区分序列的细部,对整体形状和事件的描述帮助较小。
    • 信息瓶颈:Table 2 中 LineupRL 的测试 MSE 在八格都最低:预测 ETTh2 0.1806、ETTm2 0.0541、Saugeen 0.8175、电力 0.2042;重建依次为 0.0989、0.0294、0.4463、0.1357(五种子均值)。作者称其中七格显著更低,Saugeen 重建上与 LLM-as-judge(0.4517)打平。相对 72B,LineupRL 赢五格、平两格、输一格,输掉的是 ETTm2 预测(72B 为 0.0451)。可回答性在 ETTh2、ETTm2 预测上显著差于未微调初始化;LLM-as-judge 虽蕴含崩溃,仍是八格里五格的第二名。作者据此称,描述可以蕴含参考,对下游仍然用处不大。空描述与打乱描述的误差接近,且远高于读到描述的模型,例如 ETTh2 预测上空描述 0.8446、打乱 0.8437,未微调 3B 为 0.3062。

    奖励模型、候选数与干扰项

    • 测了什么:消融奖励模型规模、候选集大小 K,以及最近邻相对随机干扰。Figure 3(c) 用没有任何描述器写过的参考描述,在奖励模型规模与 K 的每种组合上重打识别分。
    • 结果:作者称缩小奖励模型伤害全部四项标准;奖励模型小于 14B 时,微调模型的蕴含不高于未微调模型(3B 验证器与之打平)。K = 8 相对 K = 4,蕴含明显下降,识别和重建打平,预测误差上升 11%。Figure 3(c) 的格子是超过随机的准确率 (acc − 1/K)/(1 − 1/K)。TSFragment 上 14B、K = 4 为 0.70,K = 12 为 0.50;7B 从 0.64 到 0.40;3B 从 0.46 到 0.23。CaTS 上 14B 从 0.42 到 0.32,3B 从 0.11 到 0.10。BEDTime 上 14B 从 0.19 到 0.15,7B 从 0.15 到 0.08,3B 从 0.04 到 0.04。作者称 7B 和 3B 在 CaTS-Bench 与 BEDTime 的这些参考描述上已接近随机,因此 (a) 的下降来自验证器,而不是它打分的描述。
    • 最近邻与随机:Table 3 把干扰项换成等长序列上的均匀随机,描述行是两个基准的平均,预测和重建是四语料上相对 LineupRL 误差的几何平均。最近邻 / 随机:超过随机的奖励准确率 0.872 / 0.982,蕴含 0.506 / 0.354,c→s 0.797 / 0.704,s→c 0.753 / 0.744,描述长度(字符)667 / 738,预测相对 MSE 1.000 / 1.212,重建相对 MSE 1.000 / 1.142。作者称随机干扰在自身训练信号上更高,只说明题目变容易:说出大致水平就够拿奖励;最近邻在粗统计上一致,描述必须写出更细的形状。

    案例

    • 测了什么:Figure 4 比较三种 RL 对同一序列的描述,并按是否钉住时间与幅度、只有位置、与序列矛盾、或与序列无关来标注片段。下划线标出序列四个事件(开头最大值、下降、t=6 的谷、反弹),三种描述都按顺序提到。
    • 结果:可回答性描述 918 字符、21 个时间位置、0 个数值;LLM-as-judge 1,424 字符、9 个时间位置、10 个数值;LineupRL 668 字符、9 个时间位置、9 个数值,且是三者中最短的。附录 A.2:VLM 所写问题里,只有 28% 在对照原始数值核查后仍保留 VLM 给出的答案,多数幸存者只问极值落在哪一段。
    • 作者的解读:可回答性受出题模型限制,给时间序列出题并作答比自然图像难得多,因此训出的描述并不能好好描述序列。LLM-as-judge 的大量文字在声称描述本身精确、完整,而不是在谈序列。LineupRL 按顺序描述事件并给出关键数值。

    其他消融与分析

    • 合成干扰(打乱、反转或剪切粘贴):验证器不读描述时识别率 72.5%(§2.2)。
    • SFT 相对未微调初始化:BEDTime 蕴含 0.281 对 0.296;CaTS-Bench s→c 0.616 对 0.721(Table 1)。
    • 朴素基线(预测为末值持续,重建为训练窗口均值)对空描述:例如 ETTh2 预测 0.3047 对 0.8446(Table 2)。作者未在正文解释该差距。
    • 附录 C.1 给出五种验证器下的识别读数;正文未逐项列出这三种额外验证器的数字。
    • 训练时从八个合格近邻中每步重抽干扰项;验证集干扰项固定(§2.2)。正文未给出 η、B、G 的数值,这些放在附录 A。
    • CaTS-Bench 蕴含使用改写后的参考;BEDTime 使用原参考(Table 1 注、附录 B.1)。
  5. 有什么可以进一步探索的点?

    作者把更长、多元序列和 VLM 以外的描述器留给后续工作。

    作者指出的局限与后续方向

    • 更长与多元序列:结论写明,更长的序列和多元序列留给后续工作(Conclusion)。
    • VLM 以外的描述器:同一句还写明,VLM 以外的描述器留给后续工作(Conclusion)。
    • 识别不等于每句都正确:伦理声明写明,识别奖励衡量的是验证器能否把目标与备选区分开,并不保证描述中每个陈述都正确;在用于重要决策前应对照原始序列检查(Ethics statement)。
    • 敏感序列:同一声明写明,涉及敏感时间序列的应用需要适当的隐私保护,并在目标领域中评测(Ethics statement)。

    实验覆盖范围

    • 训练与策略:10,000 个 TSFragment-600K 片段,三种长度大致均匀;策略为看折线图的 Qwen2.5-VL-3B-Instruct,K = 4,奖励验证器为冻结 Qwen2.5-14B-Instruct(§3.1)。
    • 描述评测:蕴含与双向识别在 BEDTime 和 CaTS-Bench 上;CaTS-Bench 的蕴含对 Claude Opus 5 改写后的参考计分。识别数字是 GLM-4-9B 与 Phi-4-14B 的平均,二者不参与训练;另三种验证器的结果在附录 C.1(§3.1、Table 1)。
    • 下游:只读描述的预测与重建覆盖 ETTh2、ETTm2、Saugeen river flow、Australian electricity demand;解码器为 EmbeddingGemma-300M + LoRA + MLP,五个种子(Table 2、§2.3)。
    • 对照:同一初始化上比较了 SFT、可回答性奖励和 LLM-as-judge;消融了奖励模型规模、K ∈ {4, 6, 8},以及最近邻相对等长随机干扰(§3.2–3.3、Figure 3、Table 3)。
    • 案例与泄漏检查:Figure 4 给出一条序列上三种 RL 描述的对照;合成干扰在不读描述时的识别率为 72.5%(§2.2、§3.4)。论文写明评测序列不在训练片段中。
  6. 总结一下论文的主要内容

    LineupRL 用统计近邻上的序列识别做可验证奖励,3B 描述器超过 SFT、两种 RL 奖励和 72B 教师。

    LineupRL 是给开放式时间序列描述用的 RLVR:不模仿合成参考,而奖励一条描述能否让冻结文本 LLM 从相近序列里认出目标。

    • 问题:SFT 受合成描述质量束缚,并可能记住文风而不是读序列,作者称之为 ungrounded captioning。LLM 打分不可验证、容易被应付;可回答性又要求模型写出并答对时间序列问题,超出当前模型的理解。
    • 方法:VLM 只看带少量刻度、无逐点标签的折线图并采样描述。干扰项是等长、汇总统计(均值、标准差、最小、最大)最近、且重叠受预算限制的真实序列。验证器不看图,只看描述和原始数字,在 K 个位置上轮流作答;奖励是答对比例乘以 λ = 2。主实验 K = 4,优化器为 RLOO,无需参考描述。
    • 描述指标:同一 Qwen2.5-VL-3B 初始化下,LineupRL 在 BEDTime 与 CaTS-Bench 的蕴含和双向识别上均为四模型之首。BEDTime 蕴含 0.400、c→s 0.709、s→c 0.638;CaTS-Bench 为 0.611、0.886、0.868(Table 1,识别为 GLM-4-9B 与 Phi-4-14B 的平均)。SFT 的 BEDTime 蕴含 0.281,低于未微调的 0.296;LLM-as-judge 的蕴含降到 0.118 和 0.033。作者称该 3B 模型以 1/24 的参数在六列上超过 72B 教师。
    • 下游与消融:只看描述时,LineupRL 在四个语料的预测和重建共八格中误差最低,七格显著;ETTm2 预测 MSE 0.0541,高于 72B 的 0.0451(Table 2)。小于 14B 的奖励模型带不动蕴含提升;K = 8 时预测误差比 K = 4 高 11%。随机干扰的训练识别信号更高(超过随机 0.982 对 0.872),但蕴含和下游更差(Table 3)。Figure 4 中,LineupRL 的描述最短,并按顺序给出事件和关键数值。
    • 作者的结论:在参考描述稀缺、LLM 评判容易被钻空子的连续信号上,对相近备选做 caption-to-series 识别是一种可用的可验证奖励。更长序列、多元序列和 VLM 以外的描述器留给后续工作。识别成功并不保证描述中每一句都正确。
阅读原文arxiv.org