跳到正文
原文
Hugging Face Daily Papers· arXiv:2610.00812·本站收录 · 原文发表

视频生成模型的后训练与对齐综述

Video Generation Models: A Survey of Post-Training and Alignment

论文速读

综述/立场

据论文 PDF 整理(AI 生成),以原文为准

作者综述视频生成的后训练与对齐,按隐式/显式信号把方法分成监督微调、自训练蒸馏、偏好奖励与推理时四类,并汇总基准与开放挑战。

问题
预训练视频模型常不能稳定遵循意图、保持时间一致或满足物理与安全约束。视频对齐还有误差随时间累积、运动与外观耦合、多目标权衡和时序监督稀缺等问题。
方法
作者把后训练定义为大规模预训练之后、不从头重训的行为调整,并按信号如何施加区分隐式对齐与显式对齐,据此分成监督微调、自训练与蒸馏、偏好与奖励、推理时方法四类。
实验与结果
综述不报告作者自己的生成实验。作者梳理四类方法、数据集与评测协议,并在 Figure 2 中展示 2022 年至 2026 年 2 月该方向论文数量上升、监督范式更分散。
局限与可以继续做的
Section 9 把可扩展奖励、长时程时间一致性、稳定性与表现力权衡、以及安全感知生成列为开放问题。作者称这是对后训练与对齐的综合综述,范围按对齐如何被施加来组织,而不是按架构或条件信号。
实验设置Wan、HunyuanVideo 等 · VBench、VEG-Bench 等 · VBench、VideoScore 等
模型
WanHunyuanVideoOpenSoraStable Video DiffusionVideoPoetVideoMARCogVideoXWan2.1
基准
VBenchVEG-BenchVideoGen-RewardBenchOpenS2V-EvalAVLBenchVideo-BenchVidCapBenchVMBenchT2V-CompBenchChronoMagic-BenchEvalCrafterVideoScoreVideoScore2SafeSoraWISA-32K
指标
VBenchVideoScore人工偏好物理合理性指令遵循时间一致性
AI 导读全文 233 字

一篇综述首次系统梳理视频生成模型的后训练与对齐,将后训练作为统一框架,按对齐信号的施加方式区分隐式对齐与显式对齐,并把现有方法归为监督微调、自训练与蒸馏、偏好与奖励、推理时方法四类。综述指出,预训练视频模型常难以遵循人类意图、维持时序连贯并满足物理与安全约束,其对齐面临误差随时间累积、运动与外观耦合、多目标权衡及时序属性监督有限等特有挑战。文章还整理了常用数据集、基准与评测实践,并讨论可扩展奖励设计、长时程时序一致性、稳定性与表现力权衡及安全感知生成等开放问题。

深度解读

6 个问题,约 6,500 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    预训练视频模型难同时满足意图、时间一致、物理与安全,作者用四类后训练框架做综述。

    预训练视频模型虽有强生成先验,却往往不能稳定遵循人类意图、保持时间连贯,或满足物理与安全约束;作者要系统梳理不从头重训的后训练与对齐。

    • 场景与重要性:作者称视频已从短、低质量片段发展到高分辨率、长时长、复杂时空动态。与图像和文本相比,视频对齐还有误差随时间累积、运动与外观耦合、多目标权衡,以及时序属性监督有限。引言中的失败包括长视频身份漂移、物理上不真实的物体交互、运动不稳定,以及对复杂文本提示的对齐不完整。
    • 现有综述的范围:作者讨论 Xing 等、Wang 等、Ma 等、Lei 等的综述,分别覆盖视频扩散、架构与评测、按条件信号组织的可控生成,以及以人为中心的视频。作者认为这些工作不按“对齐如何被施加”来组织后训练。
    • 核心区分:作者把 post-training 定义为大规模预训练之后改变行为、且不从头重训的优化、适配或控制;把 alignment 定义为部署时行为符合意图、时间与身份一致、物理与因果约束,并避免不安全结果。按信号是否直接评估正确性,区分 implicit alignment 与 explicit alignment,并称二者是谱系而不是二元对立。
    • 本文提出什么:作者提出四类分类:(1)监督微调,(2)自训练与蒸馏,(3)偏好与奖励,(4)推理时方法。并汇总数据集、基准与评测实践。作者称这是对视频生成后训练与对齐的 first comprehensive review。
  2. 有哪些相关研究?

    相关工作按既有综述、四类后训练方法,以及数据、基准与评测协议来组织。

    作者在引言的 Relationship to Existing Surveys 和后文各节中讨论相关研究,下面按论文的分组概括。

    既有视频生成综述

    • Xing et al.:综述视频扩散模型,覆盖生成、编辑与理解。
    • Wang et al.:讨论架构进展、评测协议和工业发展。
    • Ma et al. 与 Lei et al.:Ma 等按深度、姿态、相机轨迹或音频等条件信号组织可控视频生成;Lei 等集中于说话头、肖像动画和舞蹈等人中心视频。作者称本文改为按对齐如何被施加来组织,作为这些综述的补充。

    监督微调与可控适配

    • Tune-A-Video、ShowMe、VIMI、VEGGIE 等:用指令–视频监督、多模态指令或图像引导做指令跟随与编辑;VEGGIE 用 MLLM 把意图变成逐帧查询。
    • LoRA、ControlNet 类适配与领域方法:PanoLora、MobileVD、Attention Surgery、CMD 等做参数高效或计算高效适配;LCT、Mission Balance、VideoREPA、RoboScape、PYoCo、CREPA、TIC-FT、SimDA 等针对长上下文、医疗数据稀缺、物理常识、灾难性遗忘和跨领域复用。
    • 多条件控制与个性化:VideoComposer、MotionBooth 等把相机、轨迹、姿态等结构化信号并入条件;MagicMirror、Lynx 等做身份与风格适配。Figure 3 还列出数据构建工作,如 VC4VG、Phantom、TASTE-Rob。

    自训练、蒸馏与显式对齐

    • 自训练与测试时训练:Zo3T、CustomTTT、Reangle-A-Video、SVI、One-Minute Video、BAgger 用模型自身或测试时信号做隐式对齐。
    • 知识蒸馏:Rolling Forcing、CausVid、SwiftVideo、rCM、Causal Forcing 等用教师监督改进稳定性或推理效率,作者将其归为不显式评估正确性的隐式对齐。
    • 偏好、奖励与推理时:偏好优化包括 InstructVideo、VideoDPO、DenseDPO、Diffusion-NPO、BranchGRPO 等;强化学习包括 Seedance 1.0、PhysMaster、Identity-GRPO、IPRO。奖励模型包括 VideoReward、PhysicsRM。推理时包括 AICL、WMReward 等引导,以及 DragVideo、MotionAgent 等迭代修正。自回归模型(VideoPoet、VideoMAR)被作者用来对照:离散 token 上可直接用 PPO、DPO,但作者称当前开源与后训练进展主要在扩散架构。

    基线方法与基准/数据集

    • 基线方法:本文是综述,不设立统一实验基线。文中作为代表性方法被反复用作参照的包括 Tune-A-Video、LoRA、ControlNet、DPO、PPO、Rectified Flow / Flow Matching。
    • 基准/数据集:Figure 3 与 Section 8 结构列出后训练数据(如 OpenS2V-5M、HOIGen-1M、WISA-32K、SafeSora)、基准(VBench、VEG-Bench、VideoGen-RewardBench、T2V-CompBench、ChronoMagic-Bench 等)和评测协议(EvalCrafter、VideoScore、VideoScore2、Q-Save、AIGVE-MACS、K-Sort Arena 等)。

    作者把本文定位为按监督微调、自训练与蒸馏、偏好与奖励优化、推理时方法来组织对齐信号,而不是按架构或条件信号分类。

  3. 论文如何解决这个问题?

    用隐式/显式对齐把后训练收成四类,并给出视频生成的条件分布与多目标定义。

    作者不提出新的生成算法,而是用 post-training / alignment 框架把已有方法按对齐信号的来源和作用组织起来。

    问题设定与对齐维度

    • 三种生成设定:视频生成写成学习条件分布 p(v|c)。T2V 为 v ~ p_θ(v | c_text),从噪声采样并去噪;I2V 还条件于参考图像,并要求 v0 ≈ I_ref;V2V 在编辑指令和源视频上采样,并要求结构特征 S(v_tgt) ≈ S(v_src)。Figure 4 概括这三类。
    • 底座:作者称现代后训练主要面向 Latent DiT(3D VAE 压缩、时空 token、RoPE、交叉注意力或 AdaLN、Flow Matching / Rectified Flow)以及自回归 token 模型。Figure 5 把 DiT 管线分成压缩、潜空间扩散和译码。式 (4) 把自回归生成写成对离散时空 token 的下一 token 预测。
    • 四个对齐目标(Section 2.3):指令遵循与细粒度可控;时间一致性与身份保持;运动质量与物理合理性;美学保真与安全(减少有害、偏见或 NSFW,并拒答不安全请求)。作者认为预训练优化的是数据似然,容易再现模糊、静止或未筛选的“平均”网络视频。

    监督微调:隐式对齐

    • 统一目标:Section 3.1 把多数监督方法写成 L_sup = E[ℓ_θ(x, v)],ℓ_θ 随生成器取去噪、噪声预测、潜空间重建或速度场匹配;参数高效方法只更新 adapter 或 LoRA。特化时常加正则:L = L_sup + λ L_reg。
    • 指令跟随:直接指令监督(Tune-A-Video 的一次性适配与 DDIM inversion;ShowMe 的两阶段任务适配器)、图像引导(AID、ATI、Populate-A-Scene)、指令编辑(VEGGIE、OmniV2V、FlowV2V),以及参数高效路线(PanoLora、MobileVD、Attention Surgery、CMD)。
    • 领域、多条件、个性化与数据:领域适配处理长叙事(LCT)、医疗长尾(Mission Balance)、物理常识(VideoREPA、RoboScape)和遗忘(PYoCo、CREPA、TIC-FT、SimDA)。多条件控制把相机、轨迹、姿态等并入 x。个性化维持身份与风格。数据构建与筛选被单列为监督来源。作者认为该族适合“有结构化监督就能改进行为”的目标,而不直接优化偏好或奖励。

    自训练、蒸馏与显式对齐

    • 自训练与蒸馏(Section 4):用模型生成数据、测试时训练或教师–学生蒸馏改进稳健性、稳定性或效率,不显式评估输出是否正确。Figure 3 中的例子包括 Zo3T、CausVid、Rolling Forcing、Causal Forcing。
    • 偏好与奖励(Section 5):用偏好反馈、奖励函数或可核验标准直接优化正确性,覆盖人类意图、物理合理性或安全。途径包括强化学习、偏好优化(如 DPO 变体)和视频奖励模型。作者将其标为 explicit alignment。
    • 推理时方法(Section 6):部署时不再更新参数。引导式控制可施加显式评价;迭代修正与自编辑则支持隐式对齐。作者称这类方法是 hybrid。

    跨族比较、数据与评测组织

    • Section 7:比较各后训练家族,讨论骨干架构如何决定后训练接口,以及现代系统中的多阶段组合。
    • Section 8:按对齐目标和时间特性汇总后训练数据集、基准和评测协议,而不是只按视觉质量打分。
    • 成功含义:本文不定义单一 ASR 式成功标准。对齐被写成多目标:指令遵循、时间与身份一致、运动与物理合理性、感知质量,以及安全约束。
  4. 论文做了哪些实验?

    本文是综述,不报告作者自己的生成实验;证据是分类、趋势图和方法汇集。

    实验设置

    • 论文类型:综述,不训练或攻击一个统一的目标模型,也没有作者自己的对照实验。
    • 被讨论的底座:Latent DiT 例子包括 Wan、HunyuanVideo、OpenSora;早期包括 GAN 与 3D U-Net;自回归例子为 VideoPoet、VideoMAR;指令方法中提到 Stable Video Diffusion。Figure 3 另列大量方法名,不等同于被统一测试的模型清单。
    • 任务:T2V、I2V、V2V/编辑。
    • 数据与基准:按 Figure 3 与章节结构汇总,而不是在同一协议下重测。数据集例子包括 PNData、VideoUFO、OpenS2V-5M、HOIGen-1M、WISA-32K、SafeSora;基准例子包括 VBench、VEG-Bench、VideoGen-RewardBench、T2V-CompBench、ChronoMagic-Bench;协议例子包括 EvalCrafter、VideoScore、VideoScore2。
    • 指标:作者用对齐维度描述评测,而不是给出统一公式:指令遵循、时间连贯、身份一致、运动真实感、感知质量、物理合理性、安全。论文未在所附正文中给出作者自己计算的 ASR、人工一致率或评审模型阈值。
    • 趋势统计:Figure 2 统计 2022 年至 2026 年 2 月后训练对齐研究的累计数量,并在时间轴上标注代表性方法名。纵轴为 Cumulative Count,刻度从 0 到 400。

    主结果

    表格较宽,可左右滑动

    内容论文中的组织方式作者给出的角色出处
    监督微调指令、领域、多条件、个性化、数据构建隐式对齐Figure 3;Section 3
    自训练与蒸馏自训练/测试时训练、知识蒸馏隐式对齐Figure 3;Section 4
    偏好与奖励强化学习、偏好优化、视频奖励模型显式对齐Figure 3;Section 5
    推理时方法基于引导的对齐;迭代修正与自编辑混合:可显式可隐式Figure 3;Section 6
    资源后训练数据集、基准、评测协议按目标与时间特性汇总Figure 3;Section 8
    • 作者称预训练优化宽泛、嘈杂的网络数据似然,细粒度物理约束和稳定的人类审美很少被数据捕获,后训练用更高质量、更结构化的监督改行为而不是重学视觉概念。
    • 作者称视频上的小帧级误差会随时间累积并相互作用,运动真实感、时间连贯、身份一致和物理合理性可能互相冲突,形成稳定性与表现力之间的权衡。
    • 作者称时序属性的可靠监督稀缺且昂贵,因此常依赖代理指标或学习得到的评价器,而这些评价器可能引入偏差。

    趋势与范围

    • Figure 2:作者称自 2022 年以来后训练对齐研究增长很快,监督范式和部署策略更分散。图中可见累计计数轴与按时间排列的方法名;具体每篇论文的计数值在所附文本里无法可靠读出,故不转写单个柱高。
    • Figure 1 与 Figure 3:Figure 1 被作者用作版图概览;Figure 3 把方法按对齐类型分组,底部节点为代表性数据集、基准和评测协议。
    • 安全相关评测对象:作者把减少有害、偏见或 NSFW、拒答不安全请求写入对齐维度,并把 SafeSora 列入后训练数据集。所附正文没有给出 SafeSora 上的数值结果。

    其他消融与分析

    • 无作者自己的消融表。文中作为设计要点提到的变量包括:LoRA 等低秩更新、MobileVD 的降分辨率与通道/时间剪枝及单步对抗压缩、CMD 的内容–运动解耦、PYoCo 的视频噪声先验、CREPA 的跨帧特征对齐、TIC-FT 的带缓冲帧的时间轴拼接。
    • 正则形式写成 L = L_sup + λ L_reg;论文未在所附正文给出统一的 λ 数值。
    • 采样起点写为潜空间 z_T ~ N(0, I),再由 3D U-Net 或 DiT 迭代去噪;未给出统一步数。
  5. 有什么可以进一步探索的点?

    作者把可扩展奖励、长时程一致性、稳定性–表现力权衡和安全生成列为开放问题。

    作者指出的局限与后续方向

    • 可扩展的奖励设计:摘要与 Section 9(Challenges and Future Directions)把 scalable reward design 列为开放挑战。(摘要;Section 9)
    • 长时程时间一致性:同一处列出 long-horizon temporal consistency。引言认为帧级误差会累积,短片段上不一定能看见。(摘要;Section 9;引言)
    • 稳定性与表现力的权衡:摘要写 stability-expressiveness trade-offs。Section 2.3 称过于保守的生成会变成静止、缺少动作的视频,而预训练模型常偏好小运动以降低可见错误。(摘要;Section 9;Section 2.3)
    • 安全感知生成:摘要列出 safety-aware generation。Section 2.3 将减少有害、偏见或 NSFW 内容,以及拒答不安全请求、抑制不良概念,列为对齐维度而不是已解决的结果。(摘要;Section 9;Section 2.3)
    • 监督稀缺与评价偏差:作者称时序属性的可靠监督稀缺且昂贵,代理指标或学习评价器可能引入偏差。这被写成视频对齐相对图像/文本的挑战,并 motivating 专门的后训练策略。(引言)
    • 多目标冲突:运动真实感、时间连贯、身份一致和物理合理性可能相互冲突。作者认为对齐是谱系,方法在影响对齐行为的直接程度、强度和可靠性上不同,而不是严格的“已对齐/未对齐”。(引言;Section 1 的定义段)

    实验覆盖范围

    • 全文组织为 Section 2 的问题形式化与对齐维度、Section 3–6 的四类方法、Section 7 的跨族比较与多阶段流程、Section 8 的数据/基准/协议、Section 9 的挑战。(Survey Structure)
    • 生成设定覆盖 T2V、I2V、V2V,底座讨论 Latent DiT(含 Flow Matching)和自回归 token 模型;作者称多数对齐方法讨论的是连续扩散轨迹而不是离散 token。(Section 2)
    • 趋势图的时间范围是 2022 年至 2026 年 2 月(Figure 2)。分类图按隐式、显式和混合对齐列出方法、数据集、基准和协议名称(Figure 3)。
    • 论文未报告作者自己在统一模型、统一基准上的数值对照、重复次数或评审–人工一致性。
    • 安全内容出现在对齐定义、SafeSora 等数据名,以及“安全感知生成”这一开放问题中;所附正文没有单独的安全攻击或防御实验表。
  6. 总结一下论文的主要内容

    综述把视频后训练分成四类对齐信号,并指出奖励、长视频、权衡和安全仍开放。

    这是一篇视频生成 后训练与对齐 综述:预训练模型已有强先验,但作者认为仍不能可靠遵循意图、维持时间连贯或满足物理与安全约束。

    • 问题:视频对齐不同于图像和文本。帧级误差会累积;运动与外观耦合;指令、时间、身份、物理和美学目标可能冲突;时序监督稀缺,代理评价器可能有偏。后训练被定义为预训练之后不从头重训的行为调整。
    • 框架:按信号是否直接评估正确性,区分隐式对齐与显式对齐。四类为监督微调、自训练与蒸馏(隐式),偏好与奖励(显式),以及推理时的引导或迭代修正(混合)。底座以 Latent DiT 为主,也讨论自回归 token 模型。
    • 监督微调:统一为条件监督损失,可加正则;覆盖指令跟随、领域特化、多条件控制、个性化,以及结构化数据构建。参数高效接口常落在注意力或调制块上的 LoRA、adapter。
    • 其余三类与资源:自训练/蒸馏强调生成数据、测试时训练和教师监督;偏好与奖励用强化学习、DPO 类目标和视频奖励模型;推理时复用信号而不一定更新参数。Section 8 按对齐目标和时间特性汇总数据集、基准和协议,例如 VBench、VideoScore、SafeSora。
    • 作者的结论:作者称该分类给出统一视角,说明对齐信号如何在训练和部署中塑造行为,并为可控、可靠的视频生成提供概念基础和实践指引。开放问题包括可扩展奖励、长时程一致性、稳定性–表现力权衡和安全感知生成。Figure 2 被用来说明该方向自 2022 年到 2026 年 2 月的研究增长。
阅读原文huggingface.co