26年1月来自复旦大学、上海创新研究院、香港大学和腾讯PCG的论文“VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control”。

视频世界模型旨在模拟动态的真实世界环境,但现有方法难以对摄像机和多物体的运动进行统一且精确的控制,因为视频的动态特性本质上是在投影的二维图像平面上体现的。为了弥补这一不足,引入 VerseCrafter,一种具有 4D 觉察视频世界模型,它能够在统一的 4D 几何世界状态下,对摄像机和物体的动态特性进行显式且一致的控制。方法的核心是一种4D 几何控制表示,它通过静态背景点云和每个物体的 3D 高斯轨迹来编码世界状态。这种表示不仅捕捉物体的路径,还捕捉其随时间变化的概率性 3D 空间占用情况,从而提供一种灵活且与类别无关的替代方案,以取代刚性边框或参数化模型。这些 4D 控制被渲染成预训练视频扩散模型的条件信号,从而能够生成高保真度、视角一致的视频,并精确地遵循指定的动态特性。遗憾的是,另一个主要挑战在于缺乏带有明确 4D 标注的大规模训练数据。为了解决这个问题,开发一个自动数据引擎,它可以从真实场景视频中提取所需的 4D 控制信息,从而能够在大规模且多样化的数据集上训练模型。


4D几何控制

将视频世界模型的状态表示为4D几何世界状态,称之为4D几何控制。它是一个显式的、可编辑的状态,由静态背景点云Pbg和每个对象的3D高斯轨迹{Gt_o}组成,所有这些都定义在共享的世界坐标系中。

背景点云。如图所示,从输入图像开始,使用MoGe-2 [93]估计单目深度,并使用Grounded SAM2 [75]获得实例掩码{M_o},用户可以通过文本提示或点击选择一个或多个要控制的对象。利用相机内参K和外参(R_1, t_1),每个深度为D_1(u)的像素u = (u, v, 1)被反投影为p(u)。
请添加图片描述

用实例掩码将重建的点云分割成每个对象的点云 p(u) 和一个静态背景点云 pbg。在生成过程中,帧 t 的背景是通过使用相机姿态渲染 P^bg 获得的,这样视角变化就表现为固定三维世界中的刚体相机运动,而不是在每一帧都生成一个新的背景。

三维高斯轨迹。世界坐标系中的单个三维高斯函数 G_o(x) = N(x | μ_o, Σ_o) 紧凑地编码物体的位置(通过 μ_o)、近似形状和大小(通过 Σ_o 的特征值)以及方向(通过其特征向量)。物体 o 的三维高斯轨迹被定义为一系列高斯函数,其均值 {μt_o} 描绘物体在三维空间中的运动路径,而协方差 {Σt_o} 则捕捉物体空间范围和方向随时间的变化。这种概率公式以一种柔和、连续的方式描述物体的三维空间占用情况,并生成一个紧凑的控制空间,该空间比刚性三维边框更灵活,也比参数化物体模型更具类别无关性。

为了初始化每个可控物体 o 的轨迹,对上一步获得的点云 P_o 拟合一个全协方差高斯函数,从而得到初始高斯函数 G_o(x)。

低维参数 {μt_o , Σt_o } 自然地支持灵活的、用户驱动的编辑。在实际应用中,将每个 Gt_o 转换为椭球网格,以便在 Blender 等 3D 编辑器中进行可视化,并允许用户通过在世界空间中拖动和设置关键帧来指定或优化轨迹。编辑后的姿态和形状会映射回 {μt_o , Σt_o} 作为控制信号。椭球仅作为用户界面;模型使用的所有条件映射均直接从底层 3D 高斯函数渲染。

渲染 4D 控制映射。给定 4D 几何控制,在目标相机视图中渲染逐帧条件映射。对于每一帧 t,生成三种类型的映射:(i)背景 RGB/深度映射,RGBbg_t 和 Depthbg_t,通过将静态云 Pbg 投影到相机姿态 (R_t, t_t) 上来实现; (ii) 通过将每个对象的高斯分布 {Gt_o} 投影到软椭圆轮廓上,并从相应的椭球面获取深度信息,得到 3D 高斯轨迹 RGB/深度,分别记为 RGBtraj_t 和 Depthtraj_t;(iii) 通过反转有效背景可见性并将其与投影的 3D 高斯轮廓合并,然后进行高斯平滑,得到一个软控制掩码 M_t,用于指示扩散模型应合成或覆盖内容的区域。对于第一帧 t = 1,将 RGBbg_1 替换为输入图像,并将 M_1 设置为 0,从而保留第一帧,仅修改后续帧。背景和 3D 高斯贴图共享相同的世界状态,但通过解耦通道渲染,因此相机编辑只会影响背景分支,而对象编辑只会影响 3D 高斯轨迹分支,从而实现几何一致性控制。

VerseCrafter架构

骨干网。采用Wan2.1-14B [86] 作为冻结的潜视频扩散/流匹配骨干网,并结合3D VAE和基于DiT的降噪器。VerseCrafter将Wan2.1视为通用的视频先验:不改变其架构或权重,而是附加一个轻量级的几何适配器,该适配器根据4D控制图对骨干网进行约束。

GeoAdapter。对于每一帧t,取渲染后的背景图和3D高斯轨迹图RGBbg_t、Depthbg_t、RGBtraj_t和Depthtraj_t,以及软控制掩码M。这四个RGB/深度图与视频潜数据使用同一个3D VAE进行编码,而M_t则按照[41, 86]中的方法进行重塑和插值,使其分辨率与潜数据一致。沿时间维度堆叠得到时空几何张量,该张量按通道连接并与潜视频token对齐。GeoAdapter 是一个轻量级的 DiT 风格分支,它基于该几何张量进行操作。它与 Wan-DiT 模块具有相同的token维度,但使用的层数要少得多。将 GeoAdapter 模块与冻结的 Wan-DiT 交错排列:Wan2.1 中的每个第 k 个 DiT 模块都与一个 GeoAdapter 模块配对,该 GeoAdapter 模块的输出线性投影回主干网宽度,并作为残差调制添加到相应的 DiT 模块中。文本提示由 umT5 [17] 编码为文本嵌入,并通过相同的文本条件化接口注入到 Wan 的 DiT 模块和 GeoAdapter 中。这种基于适配器的条件化仅需少量额外参数即可将 4D 几何信息注入到 Wan2.1 中,同时保持所有主干网权重不变。

推理。在推理阶段,VerseCrafter 支持在单一统一框架内对相机或物体运动进行独立控制,以及对二者进行联合控制。对于仅相机控制,提供相机轨迹和背景控制贴图,并将所有与轨迹相关的通道(RGB/深度/掩码)设置为零。对于仅物体控制,保持相机姿态固定,并从 Pbg 渲染静态背景分支(RGB/深度及其掩码)。对于联合控制,两个分支均处于激活状态,并从同一 4D 世界状态渲染,从而使 VerseCrafter 能够以协调且几何一致的方式调整相机轨迹和多物体运动。

为了在具有明确 4D 控制的真实复杂场景上训练和评估 VerseCrafter,构建 VerseControl4D,这是一个包含自动生成的 4D 几何控制标注的真实世界视频数据集。如图所示,VerseControl4D 的构建分为四个阶段:数据采集、片段提取、质量过滤和数据标注。
请添加图片描述

数据采集。VerseControl4D 基于两个最新的世界探索数据集 Sekai-Real-HQ [54] 和 SpatialVID-HQ [91] 构建而成。这两个数据集提供包含各种户外和城市场景、相机姿态和字幕的长实景视频,但没有物体运动标签。将它们的高分辨率视频作为构建 4D 几何控制标注的原始素材。

片段提取。用 PySceneDetect 来检测视频中的镜头。对于每个超过 81 帧的镜头,均匀地采样一个 81 帧的子片段,并舍弃更短的镜头,以匹配 Wan2.1 主干网使用的默认时间长度。

质量过滤。应用以对象为中心的过滤流程来保留几何形状清晰且前景可控的片段。使用 Grounded-SAM2,并输入诸如“人.人类.汽车.动物”之类的提示,首先在第一帧上获取实例掩码,并仅保留可控对象数量在 [1, 6] 范围内的片段。然后,舍弃任何实例掩码覆盖超过图像面积 20% 的片段。对于人类实例,进一步移除掩码触及图像边界或宽高比超出 [2, 4] 范围的片段,因为这些通常对应于严重截断的行人。最后,应用视觉质量过滤(美学和亮度评分)来排除模糊或曝光过度/曝光不足的片段,从而得到一组视觉清晰、结构可靠的视频。

数据标注。然后,用 4D 几何控制对每个过滤后的片段进行标注。首先,用 Qwen2.5-VL-72B [5] 生成描述性字幕,该标题在训练过程中用作文本提示。对于几何信息,采用 MegaSAM 作为基础流程,并分别将其单目深度模块和度量深度模块替换为 MoGe-2 [93] 和 UniDepth V2 [70],以获得更精确且时间一致的深度信息。给定视频帧、深度信息和相机轨迹,为每一帧重建一个 3D 点云。将 Grounded-SAM2 实例掩码应用于每一帧的这些点云,即可得到每个对象的点云和一个静态背景点云 Pbg。对于每个对象,首先拟合逐帧的 3D 高斯函数,并将它们连接成 3D 高斯轨迹 {Gt_o}。最后,将 4D 几何控制渲染成可用于模型的信号。背景点云与相机轨迹一起渲染,以获得背景 RGB 值、深度信息和掩码。3D 高斯轨迹被渲染成轨迹 RGB 值、深度信息和掩码。将背景掩码反转,并将其与轨迹掩码合并,生成最终的合并掩码,该掩码标注视频扩散模型应合成内容的区域。

VerseControl4D 总共包含 35,000 个训练样本和 1,000 个验证样本。在训练集中,约26%的样本来自Sekai-Real-HQ,74%来自SpatialVID-HQ,另有20%的样本描绘静态场景,这促使VerseCrafter学习仅使用摄像机进行世界探索以及摄像机与物体耦合的动态控制。验证集还包含250个静态场景样本,专门用于评估仅使用摄像机的控制能力。


实现细节。基于 Wan2.1 T2V-14B 模型构建 VerseCrafter。Wan 骨干网保持不变,仅更新 GeoAdapter。每个 GeoAdapter 模块都使用 Wan2.1 中与其配对的 DiT 模块的权重进行初始化,以稳定训练。设置 k = 5,使得 Wan2.1 中每 5 个 DiT 模块就与一个 GeoAdapter 模块配对。用 Adam 优化器,学习率为 2e-5,预热步数为 100,并采用恒定预热学习率策略。所有实验均在 16 个 96GB GPU 上进行,全局批大小为 16。训练分两个阶段进行:首先在 480P 视频片段上进行 2500 次迭代训练,然后在 720P 视频片段上对同一模型进行 2500 次迭代微调。总训练时间约为 380 小时。在训练过程中采用无分类器引导,以 0.1 的概率随机丢弃文本条件。在推理阶段,用 50 个去噪步骤,并将无分类器引导的尺度设为 5.0。在 8 个 96GB GPU 上生成一个 81 帧的 720P 视频片段大约需要 1152 秒,峰值内存使用量约为 90 GB。
评估指标。用 VBench-I2V 评估视频的整体质量。对于相机控制,遵循先前的相机控制工作 [32],并报告旋转误差 (RotErr) 和平移误差 (TransErr)。对于物体运动控制,采用 MotionCtrl [96] 中提出的 ObjMC。给定一个生成的视频,运行与 VerseControl4D 中相同的几何标注流程来估计其相机轨迹和 3D 高斯轨迹,并将其与数据集中相应的真实轨迹进行比较。 ObjMC 的计算方法是:对所有受控对象和帧,计算估计的 3D 高斯均值与真实 3D 高斯均值之间的平均欧氏距离。

VerseCrafter 构建于 Wan2.1 [86] 之上,Wan2.1 是一个潜视频扩散/流匹配模型,包含一个 3D VAE(Wan 编码器和 Wan 解码器)以及一个基于 DiT 的去噪器(Wan-DiT)。保持 Wan2.1 主干网不变,并引入一条几何-觉察条件化路径以及一个轻量级 GeoAdapter,该 GeoAdapter 将 4D 几何控制信号注入到选定的 Wan-DiT 模块中。在 Wan2.1 T2V-14B 主干网之上实例化 VerseCrafter,从而得到一个 14B 参数可控的视频世界模型。如图展示几何觉察条件化路径以及 GeoAdapter 与 Wan-DiT 主干网的集成,而下表总结 VerseCrafter 的输入分辨率、Wan-DiT 层数、隐藏维度、GeoAdapter 注入模式和微调配置。

请添加图片描述
请添加图片描述

GeoAdapter 是一个轻量级的 DiT-风格分支,它对几何token g 进行操作。它与 Wan-DiT 共享相同的token维度和位置编码,但包含的图层要少得多。

Logo

立足具身智能前沿赛道,致力于搭建全球化、开源化、全栈式技术交流与实践共创平台。

更多推荐