一、导读

三维与四维世界建模是人工智能与机器人领域中的核心问题,旨在构建能够理解、表示并预测动态环境的智能体。尽管生成模型在二维图像与视频生成方面取得了显著进展,但现有研究多集中于二维数据,忽略了基于原生三维与四维表示(如RGB-D图像、占据栅格、LiDAR点云)的大规模场景建模方法。此外,“世界模型”这一术语在文献中缺乏统一定义与分类体系,导致研究碎片化。

本综述首次系统性地梳理了基于视频、占据栅格和LiDAR的三维与四维世界建模方法,提出了清晰的定义与分类法,总结了专用数据集与评估指标,并指出了未来研究方向。

本文的创新性在于将研究焦点从二维生成转向几何驱动的三维/四维建模,填补了该领域系统性综述的空白,为构建可控制、物理一致的世界模型提供了理论基础与方法指南。

二、论文基本信息

  • 论文标题:3D and 4D World Modeling: A Survey

  • 作者:Lingdong Kong, Wesley Yang, Jianbiao Mei, Youquan Liu, Ao Liang, Dekai Zhu, Dongyue Lu, Wei Yin, Xiaotao Hu, Mingkai Jia, Junyuan Deng, Kaiwen Zhang, Yang Wu, Tianyi Yan, Shenyuan Gao, Song Wang, Linfeng Li, Liang Pan, Yong Liu, Jianke Zhu, Wei Tsang Ooi, Steven C. H. Hoi, Ziwei Liu

  • 单位:新加坡国立大学、浙江大学、香港科技大学、清华大学、南洋理工大学等

  • 来源:arXiv预印本,版本号 2509.07996v2

  • 链接:https://arxiv.org/abs/2509.07996v2

三、摘要精炼

本文系统综述了基于原生三维与四维表示的世界建模方法,旨在解决现有研究在术语统一、方法分类与评估标准上的缺失。论文提出了以视频生成、占据栅格生成和LiDAR生成为核心的三类方法体系,并进一步将其划分为四种功能类型:数据引擎、动作解释器、神经模拟器与场景重建器。

通过系统梳理各类生成模型(如VAE、GAN、扩散模型、自回归模型)及其在三维/四维数据上的应用,本文总结了包括nuScenes、Waymo Open、KITTI等在内的多个数据集与评估指标(如FID、FVD、IoU等)。实验表明,显式建模几何一致性与时序动态性是提升生成质量与下游任务性能的关键,未来需在长时序生成、物理合理性、跨模态一致性等方面进一步突破。

四、研究背景与相关工作

世界建模旨在构建能够模拟动态环境的生成或预测模型,早期研究多基于二维图像或视频生成,如VAE、GAN、扩散模型等在二维视觉任务中表现优异。然而,真实世界本质上是三维动态的,仅依赖二维表示难以保证几何一致性与物理合理性。近年来,基于RGB-D、占据栅格、LiDAR点云等原生三维/四维表示的方法逐渐兴起,如NeRF、Gaussian Splatting等在动态场景重建中展现出优势。

然而,现有研究缺乏对“世界模型”的统一定义,方法分类混乱,评估标准不一,导致难以系统比较与推进。本文在此基础上,首次将三维/四维世界建模方法系统归类为VideoGen、OccGen、LiDARGen三大类,并引入条件信号(几何条件、动作条件、语义条件)以统一生成与预测任务的形式化表述。

五、主要贡献与创新

  1. 明确定义与分类体系:首次给出“3D/4D世界模型”的数学定义,提出基于表示模态(VideoGen/OccGen/LiDARGen)与功能类型(数据引擎/动作解释器/神经模拟器/场景重建器)的双层分类法。

  2. 系统梳理生成模型基础:总结了VAE、GAN、扩散模型、自回归模型在三维/四维生成中的数学形式与优劣,如VAE的变分下界:

  1. 构建评估体系:系统归纳了生成质量、预测精度、规划感知、重建质量与下游任务五类评估指标,如FID、FVD、IoU、Chamfer距离等,并提供了多个数据集的统计对比。

  2. 指出未来挑战:明确提出标准化评估、长时序生成、物理合理性、计算效率与跨模态一致性五大挑战,为后续研究指明方向。

六、研究方法与原理

本文未提出单一模型,而是构建了一个方法论框架,将世界建模任务形式化为两类:

  • 生成式世界模型:

  • 预测式世界模型:

其中为输入表示(可为空、视频、占据栅格或LiDAR),与分别为生成与预测的场景表示。方法上,本文系统分析了各类生成模型在三维/四维数据上的适配性,如扩散模型的反向过程:

以及自回归模型的序列建模方式 $p(\mathbf{x}) = \prod_{i=1}^{n} p(x_i \mid x_{<i})$。此外,本文强调了多视角一致性、时序连贯性、几何约束等在三维 四维生成中的关键作用。<="" p="">

七、实验设计与结果分析

实验设置

  • 数据集:nuScenes、Waymo Open、KITTI、SemanticKITTI、Argoverse 2、CARLA等。

  • 评估指标:FID、FVD、IoU、mAP、NDS、Chamfer距离等。

  • 基线方法:包括MagicDrive、DreamForge、DriveDreamer、UniScene、OccWorld等。

关键结果

  • VideoGen:在nuScenes上,MaskGWM达到FID=4.0,FVD=59.4;DiST-4D在多视角生成中FVD最低(22.67),显示其时空一致性优势。

  • OccGen:X-Scene在占据重建中取得92.4% mIoU;World在4D预测中mIoU达47.62%(1s)。

  • LiDARGen:WeatherGen在SemanticKITTI上FRD=184.11,JSD=0.0209,表现最佳。

  • 下游任务:生成数据能提升检测与分割性能,如DriveArena在闭环规划中PDMS达0.81,但仍显著低于真实数据(NDS差距约15点)。

局限性

  • 生成数据与真实数据在下游任务性能上仍有差距。

  • 长时序生成中误差累积问题突出。

  • 物理不合理现象(如物体穿透)尚未根本解决。

八、论文结论与启示

本文系统总结了三维与四维世界建模的研究现状,指出几何驱动的表示方法在提升生成质量、控制能力与物理一致性方面的优势。通过统一术语、分类与评估标准,为后续研究提供了可比较的基础。实验表明,结合显式几何先验与时序建模是提升生成模型实用性的关键。未来应在以下方向深入探索:长时序生成稳定性、物理引擎嵌入、多模态对齐、以及面向自动驾驶、机器人、数字孪生等实际场景的专用模型优化。

九、整体评价与讨论

优点

  • 系统性:首次全面梳理三维/四维世界建模方法,涵盖视频、占据栅格、LiDAR三大模态。

  • 结构清晰:定义明确、分类合理、评估体系完整。

  • 前瞻性:指出未来挑战并提出具体研究方向。

不足与建议

  • 缺乏深入理论分析:虽总结各类生成模型,但未对其在三维/四维数据上的理论性质(如收敛性、泛化界)进行深入探讨。

  • 实验部分偏综述性:虽列出多个模型结果,但缺乏统一复现与对比分析,部分结果依赖原论文报告,存在偏差风险。

  • 未来方向可更具体:如能提出具体的技术路径(如如何嵌入物理约束、如何设计长时序记忆机制)将更具指导意义。

批判性讨论

本文在方法论梳理上具有重要价值,但在理论深度与实验可复现性方面仍有提升空间。建议后续研究可在本文分类基础上,进一步构建统一基准平台,促进公平比较与模型演进。

Logo

立足具身智能前沿赛道,致力于搭建全球化、开源化、全栈式技术交流与实践共创平台。

更多推荐