世界模型是否需要显式的 3D?UT Austin 新作 PE-Field 给出答案

-
论文标题:Positional Encoding Field
-
Project Page: https://yunpeng1998.github.io/PE-Field-HomePage/
-
Paper: https://arxiv.org/pdf/2510.20385
-
Code: https://github.com/MTLab/PE-Field
-
作者:Yunpeng Bai,Haoxiang Li, Qixing Huang
-
研究机构:UT Austin
先说结论:如果你在用 Transformer,在 DiT 的位置编码里引入 3D,是一个非常自然的选择。
通过这样一个看似简单的改动,研究者们不仅让 DiT 获得了 3D 感知与控制能力,还在新视角合成(NVS)与空间感知编辑(spatial-aware editing)等任务中展现出强大潜力。
从 DiT 说起:Transformer 如何生成图像?
自从Scalable Diffusion Models with Transformers 这篇论文以来,DiT 的思想被广泛应用于生成建模:图像被切成多个小 patch,每个 patch 对应一个 token 输入到 Transformer。
问题是:不同 token 在生成过程中是如何交互的?
实验一:Patch-level 的独立性
研究团队发现,DiT 在图像生成时,不同 token 之间呈现出高度独立性(图1)。
他们将位置编码(PE)打乱后应用到 latent 与 noise 上,再进行 decode:
-
在 tokens 分支,prompt 设定为“让图像不动”,结果依然生成了 patch 边界清晰的图像。
-
在 noise 分支,直接在 noise 上应用打乱的 PE,同样可以生成合理图像。
👉 结论:在 DiT 中,每个 patch 都像一个独立单元,清晰分工,互不干扰。
实验二:Depth + PE 的魔力
如果把输入图像预测出的 depth 用来 warp source view 的位置编码,会发生什么?
结果令人震惊:
只要把 source view 图像 + novel view 的 PE 输入 Transformer,就能得到 90% 相似度的新视角结果!(图2)
这表明 DiT 在架构层面,已经天然具备几何建模潜力。
但要真正实现高质量 NVS,还需解决两个关键问题:
-
投影重合问题:3D 投影到 2D 时,不同 token 会重叠,2D Transformer 无法区分前后关系。
-
Patch-level 粒度不足:当前每个 patch 对应一个 token,难以匹配 dense reconstruction,限制了模型对空间细节的捕捉。
我们的解决方案:PE-Field
为了解决以上问题,研究者提出了 Positional Encoding Field(PE-Field)。
核心思路:
👉 在DiT的位置编码(PE)中额外引入一个 z 轴,区分 token 的前后远近。
这样一来,Transformer 不需要完全 3D 化,只要在 PE 上动手,就能显式融入 3D 信息,实现对空间层次的建模。
第二点:层次化 PE
除了 z 轴,研究者还提出了层次化位置编码(Hierarchical PE):
-
在多头注意力(MHA)结构中,传统做法是每个 token 只用 patch-level 的 PE。
-
他们进一步在 patch 内部引入细粒度位置编码,让不同 head 捕获不同层次的空间信息。
以 Flux 图像生成模型的 24 个 head 为例:
研究者将其中 16 个 head 扩展到 patch-level 以下 1/16 的细节表示,虽然未到 pixel-level,但显著提升了空间精度,同时保持了与原有架构的兼容性。
新视角合成模型:NVS-DiT
基于这些改进,研究者设计了一个新的 NVS-DiT 模型:
-
Noise tokens:放置在规则的 2D 网格上,初始深度为 0。
-
Source-view image tokens:通过单目重建与视角变换,投影到目标相机视角中,并分配三维位置编码 。
-
超出网格范围的 tokens 被丢弃,空缺位置由 noise token 填充,Transformer 逐步 refine,生成几何一致的结果。
这种设计让模型能在生成过程中同时融合 已观测图像和 生成补全能力,实现高质量的新视角合成。
回到标题:世界模型是否需要 3D?
研究团队的回答是:Why not?
目前所有的 video/world generation 模型都还做不到像传统图形学一样的 可控性。
但只要在 位置编码上多加一维,就能在不改变 2D 模型结构的前提下,赋予模型 3D 感知与空间控制能力。
更进一步,这种方式不仅可以扩展到空间层面,还可能推广到 跨模态控制。
👉 结论:如果你正在使用 DiT 进行生成建模,想要 3D 的 controllability,把它加到 PE 上,就是一件非常自然的事情!
更多推荐



所有评论(0)