显示标签为“自回归视频扩散”的博文。显示所有博文
显示标签为“自回归视频扩散”的博文。显示所有博文

2026年6月4日星期四

Video-Mirai 训练借鉴未来推理因果 不增开销提升30秒视频连贯性

Video-Mirai是一种纯训练范式,在不增加在线推理开销下提升自回归视频扩散模型的30秒生成连贯性。它通过余弦相似度损失将因果生成器的中间特征对齐到冻结双向编码器的未来感知表示。在VBench评估中,5秒生成总分从83.8提升至84.6;30秒长视频主体一致性从84.9提升至88.5。适用于需要长时因果视频生成的研究与开发。

Tags:

点击下方卡片,关注“AI生成未来

👇扫码免费加入AI知识星球,如您有工作需要分享,欢迎联系:aigc_to_future

图片

作者:Yonghao Yu

解读:AI生成未来
图片

文章链接: https://arxiv.org/pdf/2606.03971  
项目链接: https://y0uroy.github.io/Video-Mirai  

亮点直击

  • 将预见性预测形式化为因果视频生成的表示层级目标,在训练时使用未来感知目标,同时保持严格的因果推理。
  • Video-Mirai 在帧级和块级设置下均改进了自回归视频生成,其收益还能扩展到训练时域之外的30秒生成。
  • 确定了有效的预见性来源、预测层、预测器设计和前瞻窗口,并通过探针验证了未来内容能从冻结特征中更易解码。

效果速览

总结速览

解决的问题: 在流式自回归视频扩散模型中,每个生成的片段成为未来片段必须保持的承诺。但标准训练仅要求每个因果状态解释当前片段,导致了一个表示层级的“规划鸿沟”——适合当前片段的状态可能丢弃了未来一致性所需的身份、布局和运动信息。

提出的方案: 引入 Video-Mirai,一种纯训练方法,在不改变因果推理的情况下弥合这一鸿沟:生成器因果地展开生成,一个冻结的预见编码器非因果地读取完整展开结果,一个轻量级预测器将得到的停梯度目标蒸馏到因果状态中。

应用的技术: 余弦相似度对齐损失、双向预训练视频模型作为预见编码器、轻量级 DiT 预测器、非对称分布匹配蒸馏 (DMD) 的训练流程。

达到的效果: 在5秒 VBench 上将强基线 Causal-Forcing 的总分从83.8提升至84.6。在训练时域之外的30秒生成中,主体一致性从84.9提升至88.5,背景一致性从90.2提升至91.9。

架构方法

预备知识

本文考虑自回归视频扩散,将预训练的双向扩散模型蒸馏为少步因果生成器 。视频定义为时间片段的序列 ,其中片段可以是单个潜在帧(帧级)或连续潜在帧的块(块级)。因果约束要求:

因此片段  仅从 $\mathbf{X}_{i}$。标准蒸馏流程(如 Causal-Forcing)通过三个阶段实现这一目标:自回归教师微调、因果常微分方程蒸馏、以及非对称 DMD。本文采用该流程作为基线。

式1的因子化只约束每个  在给定 $\mathbf{X}_{<i}$ 的情况下是合理的。它并未说明用于生成="" $\mathbf{x}_{i}$="" 的隐藏状态="" $\mathbf{h}_{i}^{l}$="" 是否保留了连贯生成未来片段所需的信息。具体来说,现有训练目标归结为当前片段损失:<="" p="">

其中  是应用于模型输出分布的任何逐片段监督(DMD 分数、流匹配等)。所有此类损失共有一个特性:它们仅对生成器为片段  发出的内容评分,从不关注产生它的隐藏状态 。许多不同的隐藏状态  可以将相同的  驱动至最优:有些保留了未来片段所需的身份、布局和运动线索;另一些则丢弃了它们。损失函数对这两者没有偏好。本文将此缺失的约束称为“表示层级规划鸿沟”:当前片段损失从不询问  是否是一个适合继续生成的状态。近期的自回归视频扩散进展解决了相邻但不同的鸿沟,包括暴露偏差、常微分方程蒸馏注入性和长时程误差累积。然而,它们都没有修改式2对  的要求。它们重塑了历史分布、蒸馏初始化或展开协议,而非应用于因果状态本身的监督。规划鸿沟因此与这三者正交。弥合它需要使用预见信号监督 :一个源自模型自身未来展开的目标。

Video-Mirai

图3展示了 Video-Mirai 的概述:在对当前片段进行去噪时,因果 DiT 生成器的中间深度特征被馈送到预测器 ,以预测同一展开中未来片段上的预见编码器特征,通过余弦相似度损失实现:

设  表示生成  时因果生成器在层  的隐藏状态, 表示预见编码器在因果生成器的展开片段  上的隐藏状态(在匹配的中间深度层  处),当编码器处理完整展开  时计算得到。两个设计问题随之而来:(i) 预见是否有用,对齐应该前瞻多远,以及 (ii) 是否应通过融合目标或平均损失来组合多个偏移量。本文在组装完整目标之前回答这两个问题。

预见窗口。本文比较了四种偏移配置:仅当前({0})、仅前一个片段({1})、当前加前一片段({0,1})以及当前加前两个片段({0,1,2})。在块级设置中,=1 对应3个潜在帧的前瞻。如下表1所示,当前加前一片段({0,1})产生最佳的质量和总分。关键的是,即使仅当前对齐也携带着预见信息,因为此处的预见编码器是双向的,所以其在当前块上的隐藏状态已经以未来块为条件。因此,预见不仅来自显式的未来偏移对齐,还来自通过双向注意力隐式传递的未来信息。将窗口扩展到 {0,1,2} 进一步改善了语义但降低了质量,表明更长程的对齐以视觉保真度为代价换取了全局连贯性。

图片

目标融合 vs. 逐偏移损失。给定窗口 (默认 =1),可以计算每个偏移的一个损失并取平均,或者将编码器在  上的特征融合成单个目标并对齐一次。下表2比较了涵盖这两种机制的四种投影器设计:逐点 MLP 和 DiT 投影器,各自应用于融合目标或逐偏移变体。有两个发现。首先,融合目标始终优于平均损失。单头 MLP 胜过 Multi-MLP,单头 DiT 胜过 DiT-AddLN。跨偏移融合为因果生成器提供了一个平均的未来表示而非任何特定样本,稳定了优化,并与本文的发现(Video-Mirai 的特征编码的是未来的分布而非单一承诺的延续)相匹配。其次,在匹配深度下,DiT 优于逐点 MLP,表明对齐受益于令牌混合。本文还在 DiT 深度为 {2,3,4} 块之间变化,发现3个块给出最佳总分。因此,本文采用带有目标融合的3块 DiT 作为默认配置。通过这一选择,融合目标和逐片段损失为:

图片

训练。在每一步,因果生成器从噪声中逐片段展开一个视频 ,遵循 Causal-Forcing 的标准少步去噪循环并使用常规的 KV 缓存,同时缓存其中间深度状态 。冻结的预见编码器随后在零扩散时间步下对完整展开  进行单次前向传递,产生 。对于每个有近未来目标可用的片段(),通过式4将  拉向融合目标 ,与非对称 DMD 生成损失相结合:

默认使用 。DMD 项将同一展开的重噪声版本与冻结的 Wan-14B 真实分数教师和 Wan-1.3B 虚假分数评判器进行对比,遵循 Self-Forcing。其余设计,如预见编码器、注入深度  和损失形式,进行了消融研究。

实验

设置

实现细节。使用 Wan2.1-T2V-1.3B(简称 Wan-1.3B)作为因果生成器主干,生成分辨率为  的81帧视频。主要结果是在块级设置下基于三阶段 Causal-Forcing 流程报告的,其中每个片段是3个连续潜在帧的块。每个阶段的训练流程均遵循 Causal-Forcing。本文还将 Video-Mirai 作为即插即用模块应用于 Self-Forcing 以及帧级 Causal-Forcing 变体。除非另有说明,Video-Mirai 使用 Wan2.1-T2V-14B(简称 Wan-14B)作为预见编码器。所有蒸馏运行使用  H100 GPU,梯度累积为8。训练提示来自 Self-Forcing 发布的经过滤的 VidProM 扩展集。其他训练设置遵循基线的方案。

评估。在 VBench 上进行评估。对于5秒生成,每个分数是在完整 VBench 提示集上每个提示生成5个视频的平均值,遵循该基准的标准协议。对于30秒长时程评估,本文在200个随机选取的 MovieGen 提示上展开相同的训练检查点,遵循 Rolling-Forcing 协议,并报告在其与提示无关的协议下可计算的 VBench 维度子集。由于视频蒸馏成本高昂,本文遵循先前工作报告成对的提示级 bootstrap 显著性,而非多个训练种子的方差。

组件分析

注入深度。预见注入需要同时选择因果生成器层  和编码器层 。由于因果生成器(30块)和编码器(40块)深度不同,本文按匹配的相对深度配对层:。下表3显示中间深度(=0.5)是最优的。浅层尚未积累足以受益于预见的抽象规划特征,而深层接近像素级重建,自由度较小,不易被辅助目标重塑。本文在整个研究中使用 =0.5。

图片

预见编码器。本文比较了跨越两个轴(因果性和容量)的三个预见编码器:因果生成器自身的 EMA 副本、双向 Wan-1.3B 和 Wan-14B 模型。下表4的结果显示,Wan-14B 在质量和总分上占优,而 Wan-1.3B 达到了最高的语义分数。在较小的编码器中,Wan-1.3B 的双向注意力提供了比因果 EMA 更大的提升。选择 Wan-14B 作为默认编码器,因为它已经是基线 DMD 流程中的真实分数模型,且在部署时不增加任何参数。

图片

预见损失。下图4比较了带有或不带有信号正则化项的余弦相似度和均方误差损失。单独的余弦相似度效果最佳。本文将此归因于两个效应。首先,均方误差强制生成器的特征匹配编码器的方向、尺度和完整坐标分布,将其拉离其原生特征几何,导致语义分数下降。其次,添加信号正则化项在两种损失下都持续降低总分,表明显式塑造投影特征分布朝向各向同性高斯性与对齐目标相冲突。本文采用不带信号正则化项的余弦相似度作为默认配置。

图片

预见可视化

到目前为止的所有证据都是行为层面的:经过预见训练后 VBench 分数有所提高。一个更尖锐的问题是:预见是否实际被内化到因果生成器的表示中。本文设计了一个表示探针实验来直接回答这一问题。

探针设置。本文采用两个冻结的因果生成器,架构相同:Causal-Forcing 基线和 Video-Mirai。对于每个模型,本文训练一个小型 MLP 解码器,从模型在当前块上的第15层隐藏状态重建干净的 RGB 未来帧( 个块之后)。探针时不使用预见预测器;解码器纯粹是一个读取头。两个模型的解码器在相同预算内分别训练。如果 Video-Mirai 内化了未来信息,其特征应支持更忠实的未来重建。

定性和定量读取。下图1展示了三个探针样本。可以看出,Video-Mirai 忠实地重建了未来帧,而基线则停留在当前帧上,这符合缺乏预见特征的预期。本文随后在三个特征提取层  和三个预测时域  帧(对应块 )上规模化地量化读取保真度,报告均方误差、峰值信噪比和 LPIPS。对于每层,本文在因果生成器的隐藏状态上训练一个独立的 MLP 解码器,并在保留的提示上进行评估。为简洁起见,本文在下图5中绘制了峰值信噪比曲线。均方误差和 LPIPS 曲线(呈现相同趋势)在附录 F 中提供。Video-Mirai 在每个层和每个时域上始终优于基线。差距在近时域最大(预见监督最直接适用),并在 =9 帧(远超训练时的预见窗口)时仍然存在,表明预见内化是泛化的而非记忆性的。

图片
图片

未来的分布。上述探针表明 Video-Mirai 的特征支持未来读取,但给定当前的未来并非确定性。从相同的当前状态使用不同噪声种子运行因果生成器会产生有效未来的分布。那么特征编码的是某一个特定的未来,还是未来的分布?下图6对此进行了可视化。本文从相同的当前状态在不同噪声种子下采样了四个独立的展开,确认未来确实是随机的。例如,紫貂的尾巴在不同展开中最终位于不同位置。从 Video-Mirai 的当前片段读取的结果与这四个展开的平均值非常匹配。该读取头已经能够在任何这些未来帧实际生成之前捕捉未来的身份、布局和运动统计信息。Video-Mirai 的中间深度特征编码了一个关于即将发生什么的概率性总结,而非单一的采样延续。

图片

系统级比较

下表5将 Video-Mirai 置于更广泛的视频扩散模型格局中,在 VBench 上与双向、自回归和蒸馏自回归视频扩散模型进行比较。本文将 Video-Mirai 作为即插即用模块应用于三个蒸馏自回归基线:Self-Forcing(块级)和 Causal-Forcing(帧级和块级变体)。结果表明,Video-Mirai 在每个基线上都提高了质量、语义和总分,证实了预见内化在不同主干以及帧级和块级生成上的可迁移性。下图2和图7展示了有代表性的定性比较。

图片
图片

这种改进扩展到30秒的长时程生成,并且恰恰体现在与因果短视相关的维度上:与无预见基线相比,如主体一致性、背景一致性和总体一致性如表6所示均有显著提升。在块级设置中,30秒的收益在全部三个一致性维度上都远超5秒的收益,证实了规划鸿沟随展开长度扩大,而这正是预见发挥作用的场景。这一性能以相同的推理成本实现,因为预见编码器和预测器在训练后被丢弃。

总结

Video-Mirai,一个纯训练范式,它弥合了因果自回归视频扩散中的表示层级规划鸿沟:一个简单的余弦对齐损失将因果生成器的中间深度特征拉向一个冻结的双向编码器对其自身展开的视图。在推理时,编码器和预测器被丢弃,留下不变的架构、每步浮点运算量和 KV 缓存行为。作为自回归视频模型的即插即用模块,Video-Mirai 在5秒时将 Causal-Forcing 的 VBench 分数提升,并在30秒生成时扩大了差距。表示探针证实了未来信息被内化到因果权重中,将预期转化为因果前向传递的一个属性。本文结果论证了因果性是对推理的约束,而非对训练能教模型预测什么的限制。

参考文献

[1] Video-Mirai: Autoregressive Video Diffusion Models Need Foresight

技术交流社区免费开放

这是一个高质量AIGC技术社群。

涉及 内容成/理解(图像、视频、语音、文本、3D/4D等)、大模型、具身智能、自动驾驶、深度学习及传统视觉等多个不同方向。这个社群更加适合记录和积累,方便回溯和复盘。愿景是联结数十万AIGC开发者、研究者和爱好者,解决从理论到实战中遇到的具体问题。倡导深度讨论,确保每个提问都能得到认真对待。

图片
欢迎扫码加入
图片



技术交流

加入「AI生成未来社区」群聊,一起交流讨论,涉及 图像生成、视频生成、3D生成、具身智能等多个不同方向,备注不同方向邀请入群!可添加小助手备注方向加群!

图片

免费AI视频生成工具seedance2。0mini无水印全能参考附微表情提示词

介绍一款可免费生成一次的视频AI工具,支持seedance2.0mini、wan2.7、imga2等模型,注册简单,生成视频无水印且支持全能参考。文中提供人物微表情提示词及真人Skill组合用法,适合AI创作者快速测试角色表情效果。 Tags: AI视频生成 免费试用 ...