• 论文标题:Positional Encoding Field

  • Project Page: https://yunpeng1998.github.io/PE-Field-HomePage/

  • Paper: https://arxiv.org/pdf/2510.20385

  • Code: https://github.com/MTLab/PE-Field

  • 作者:Yunpeng Bai,Haoxiang Li, Qixing Huang

  • 研究机构:UT Austin

先说结论:如果你在用 Transformer,在 DiT 的位置编码里引入 3D,是一个非常自然的选择。

通过这样一个看似简单的改动,研究者们不仅让 DiT 获得了 3D 感知与控制能力,还在新视角合成(NVS)与空间感知编辑(spatial-aware editing)等任务中展现出强大潜力。

从 DiT 说起:Transformer 如何生成图像?

自从Scalable Diffusion Models with Transformers 这篇论文以来,DiT 的思想被广泛应用于生成建模:图像被切成多个小 patch,每个 patch 对应一个 token 输入到 Transformer。

问题是:不同 token 在生成过程中是如何交互的?

实验一:Patch-level 的独立性

研究团队发现,DiT 在图像生成时,不同 token 之间呈现出高度独立性(图1)。

他们将位置编码(PE)打乱后应用到 latent 与 noise 上,再进行 decode:

  • 在 tokens 分支,prompt 设定为“让图像不动”,结果依然生成了 patch 边界清晰的图像。

  • 在 noise 分支,直接在 noise 上应用打乱的 PE,同样可以生成合理图像。

👉 结论:在 DiT 中,每个 patch 都像一个独立单元,清晰分工,互不干扰。

图1: DiT patch级独立性的说明。

实验二:Depth + PE 的魔力

如果把输入图像预测出的 depth 用来 warp source view 的位置编码,会发生什么?

结果令人震惊:

只要把 source view 图像 + novel view 的 PE 输入 Transformer,就能得到 90% 相似度的新视角结果!(图2)

这表明 DiT 在架构层面,已经天然具备几何建模潜力。

图2: 直接新视角合成(NVS)结果说明。

但要真正实现高质量 NVS,还需解决两个关键问题:

  1. 投影重合问题:3D 投影到 2D 时,不同 token 会重叠,2D Transformer 无法区分前后关系。

  2. Patch-level 粒度不足:当前每个 patch 对应一个 token,难以匹配 dense reconstruction,限制了模型对空间细节的捕捉。

我们的解决方案:PE-Field

为了解决以上问题,研究者提出了 Positional Encoding Field(PE-Field)。

核心思路:

👉 在DiT的位置编码(PE)中额外引入一个 z 轴,区分 token 的前后远近。

这样一来,Transformer 不需要完全 3D 化,只要在 PE 上动手,就能显式融入 3D 信息,实现对空间层次的建模。

第二点:层次化 PE

除了 z 轴,研究者还提出了层次化位置编码(Hierarchical PE):

  • 在多头注意力(MHA)结构中,传统做法是每个 token 只用 patch-level 的 PE。

  • 他们进一步在 patch 内部引入细粒度位置编码,让不同 head 捕获不同层次的空间信息。

以 Flux 图像生成模型的 24 个 head 为例:

研究者将其中 16 个 head 扩展到 patch-level 以下 1/16 的细节表示,虽然未到 pixel-level,但显著提升了空间精度,同时保持了与原有架构的兼容性。

图3:Flux中不同head的pe的分配情况。

新视角合成模型:NVS-DiT

基于这些改进,研究者设计了一个新的 NVS-DiT 模型:

  • Noise tokens:放置在规则的 2D 网格上,初始深度为 0。

  • Source-view image tokens:通过单目重建与视角变换,投影到目标相机视角中,并分配三维位置编码 

  • 超出网格范围的 tokens 被丢弃,空缺位置由 noise token 填充,Transformer 逐步 refine,生成几何一致的结果。

这种设计让模型能在生成过程中同时融合 已观测图像和 生成补全能力,实现高质量的新视角合成。

图4:NVS-DiT的模型结构。
图4:实验结果。
图4:不同的应用。

回到标题:世界模型是否需要 3D?

研究团队的回答是:Why not?

目前所有的 video/world generation 模型都还做不到像传统图形学一样的 可控性。

但只要在 位置编码上多加一维,就能在不改变 2D 模型结构的前提下,赋予模型 3D 感知与空间控制能力。

更进一步,这种方式不仅可以扩展到空间层面,还可能推广到 跨模态控制。

👉 结论:如果你正在使用 DiT 进行生成建模,想要 3D 的 controllability,把它加到 PE 上,就是一件非常自然的事情!

Logo

立足具身智能前沿赛道,致力于搭建全球化、开源化、全栈式技术交流与实践共创平台。

更多推荐