AI不再“瞎编城市”了:韩国Naver用120万张街景图,做出了真实世界模型
最近,韩国互联网巨头 Naver 发布了一项非常值得关注的研究成果:
Seoul World Model(首尔世界模型,SWM)
简单说,它不是像传统视频生成模型那样“凭空幻想一个城市”,而是第一次让 AI 真正基于现实世界中的城市地图和街景数据,去生成一个真实存在的城市空间视频模型。
这件事的意义非常大。
因为它试图解决生成式 AI 一个长期存在的问题:
幻觉(Hallucination)
尤其是在空间和城市场景里,这个问题一直非常严重。
过去的世界模型:看起来很真,其实全是“脑补”
过去很多视频世界模型都很强。
比如输入一张街景图,AI 可以继续往前生成:
街道延伸
楼宇分布
路口转弯
远处建筑
视觉上看起来很逼真。
但有一个根本问题:
后面的城市根本不存在。
模型只是根据概率去“猜”:
前面可能还有一条路
左边可能是一栋楼
远处可能有高架桥
也就是说,除了起始画面是真实的,后面很多内容都是 AI 自己想象出来的。
这就是为什么文章标题里说:
stop AI from hallucinating entire cities
非常形象。
过去 AI 不是在生成城市,而是在“编城市”。
Naver这次做法非常直给:直接喂真实街景
不要让模型瞎猜,直接给它真实世界数据。
他们调用了自家地图服务 Naver Map 的海量街景资源。
总量达到:
120万张街景全景图
这些图像全部来自首尔真实街道。
用户输入三个信息:
地理坐标
相机移动方向
文本描述
比如:
首尔江南某条街道
镜头向前移动200米
夜景 + 雨天效果
系统就会从数据库里实时检索附近真实街景图,作为生成锚点。
本质上它有点像:
RAG + 视频世界模型
可以理解为:
不是靠模型记忆生成
而是边查真实地图边生成视频
最核心突破:它学会了分辨“什么是真实结构”
现实街景数据有个很大的难题。
比如某一天街景拍摄时,路边停了一辆黄色卡车。
如果模型直接学习这张图,它可能会误以为:
这辆车是城市结构的一部分
下一次生成时,这辆车可能永远停在那里。
这显然不合理。
因为车、人、广告牌这些东西都是动态变化的。
Naver 为此设计了一个很关键的机制:
Cross-temporal pairing(跨时间配对)
简单说,就是让模型学习同一个地点不同时间拍摄的数据。
这样 AI 就能逐渐学会区分:
永久结构:
建筑 路面 红绿灯 路口
临时元素:
汽车 行人 外卖车 路边广告
这一步非常关键。
因为它决定 AI 学到的是“城市骨架”,而不是某一时刻的随机画面。
还能提前“看前方”,避免越生成越跑偏
另一个很厉害的技术点叫:
Virtual Lookahead Sink
可以理解成:
AI 在往前走的时候,会不断看前方路标
也就是系统会持续检索前方街景图像,给模型一个“未来锚点”。
这非常像人类开车:
一边看当前道路
一边提前看前面路口
这样就能避免长距离生成时越来越偏。
否则传统模型经常会出现:
开着开着楼没了
路突然歪了
城市结构崩掉了
SWM 在这方面提升非常明显。
它可以稳定生成:
数百米甚至公里级连续城市视频
而且仍然保持空间一致性。
这可能是“数字孪生城市AI”的重要起点
这项技术的意义,不只是视频生成。
它有潜力进入三个超级大的场景。
1)自动驾驶仿真
真实城市环境模拟,一直是自动驾驶训练的核心。
过去大量依赖 CARLA 这种模拟器。
但模拟器和真实世界总有差距。
而这种基于真实街景构建的世界模型,天然更适合:
自动驾驶路径测试
极端天气模拟
路况预测
2)城市数字孪生
本质上它已经很接近:
AI驱动的城市级数字孪生
未来完全可以用于:
智慧园区
智慧交通
城市规划推演
商圈热力模拟
3)具身智能 / Agent导航
未来机器人、无人机、智能体都需要理解真实空间。
这个模型很可能成为:
空间智能基础模型
类似“城市版世界大脑”。
说得大胆一点:
这不是一个视频模型
这是现实世界的AI操作系统雏形
更多推荐
所有评论(0)