最近,韩国互联网巨头 Naver 发布了一项非常值得关注的研究成果:

Seoul World Model(首尔世界模型,SWM)

简单说,它不是像传统视频生成模型那样“凭空幻想一个城市”,而是第一次让 AI 真正基于现实世界中的城市地图和街景数据,去生成一个真实存在的城市空间视频模型。

这件事的意义非常大。

因为它试图解决生成式 AI 一个长期存在的问题:

幻觉(Hallucination)

尤其是在空间和城市场景里,这个问题一直非常严重。

过去的世界模型:看起来很真,其实全是“脑补”
过去很多视频世界模型都很强。

比如输入一张街景图,AI 可以继续往前生成:

街道延伸
楼宇分布
路口转弯
远处建筑

视觉上看起来很逼真。

但有一个根本问题:

后面的城市根本不存在。

模型只是根据概率去“猜”:

前面可能还有一条路
左边可能是一栋楼
远处可能有高架桥

也就是说,除了起始画面是真实的,后面很多内容都是 AI 自己想象出来的。

这就是为什么文章标题里说:

stop AI from hallucinating entire cities

非常形象。

过去 AI 不是在生成城市,而是在“编城市”。

Naver这次做法非常直给:直接喂真实街景
不要让模型瞎猜,直接给它真实世界数据。

他们调用了自家地图服务 Naver Map 的海量街景资源。

总量达到:

120万张街景全景图

这些图像全部来自首尔真实街道。

用户输入三个信息:

地理坐标
相机移动方向
文本描述
比如:

首尔江南某条街道
镜头向前移动200米
夜景 + 雨天效果

系统就会从数据库里实时检索附近真实街景图,作为生成锚点。

本质上它有点像:

RAG + 视频世界模型

可以理解为:

不是靠模型记忆生成
而是边查真实地图边生成视频

最核心突破:它学会了分辨“什么是真实结构”
现实街景数据有个很大的难题。

比如某一天街景拍摄时,路边停了一辆黄色卡车。

如果模型直接学习这张图,它可能会误以为:

这辆车是城市结构的一部分

下一次生成时,这辆车可能永远停在那里。

这显然不合理。

因为车、人、广告牌这些东西都是动态变化的。

Naver 为此设计了一个很关键的机制:

Cross-temporal pairing(跨时间配对)

简单说,就是让模型学习同一个地点不同时间拍摄的数据。

这样 AI 就能逐渐学会区分:

永久结构:

建筑 路面 红绿灯 路口

临时元素:

汽车 行人 外卖车 路边广告

这一步非常关键。

因为它决定 AI 学到的是“城市骨架”,而不是某一时刻的随机画面。

还能提前“看前方”,避免越生成越跑偏

另一个很厉害的技术点叫:

Virtual Lookahead Sink

可以理解成:

AI 在往前走的时候,会不断看前方路标

也就是系统会持续检索前方街景图像,给模型一个“未来锚点”。

这非常像人类开车:

一边看当前道路
一边提前看前面路口

这样就能避免长距离生成时越来越偏。

否则传统模型经常会出现:

开着开着楼没了
路突然歪了
城市结构崩掉了

SWM 在这方面提升非常明显。

它可以稳定生成:

数百米甚至公里级连续城市视频

而且仍然保持空间一致性。

这可能是“数字孪生城市AI”的重要起点
这项技术的意义,不只是视频生成。

它有潜力进入三个超级大的场景。

1)自动驾驶仿真
真实城市环境模拟,一直是自动驾驶训练的核心。

过去大量依赖 CARLA 这种模拟器。

但模拟器和真实世界总有差距。

而这种基于真实街景构建的世界模型,天然更适合:

自动驾驶路径测试
极端天气模拟
路况预测

2)城市数字孪生
本质上它已经很接近:

AI驱动的城市级数字孪生

未来完全可以用于:

智慧园区
智慧交通
城市规划推演
商圈热力模拟

3)具身智能 / Agent导航
未来机器人、无人机、智能体都需要理解真实空间。

这个模型很可能成为:

空间智能基础模型

类似“城市版世界大脑”。

说得大胆一点:

这不是一个视频模型
这是现实世界的AI操作系统雏形

Logo

立足具身智能前沿赛道,致力于搭建全球化、开源化、全栈式技术交流与实践共创平台。

更多推荐