北京智源研究院提出Emu3.5:原生多模态世界模型,推理加速20倍媲美Gemini 2.5
最近,AI领域的热点已经从纯粹的语言大模型,悄悄转向了能够同时理解和生成多种信息(比如文字、图片、视频)的多模态模型。毕竟,真实的世界是“视听混合”的,只懂文字的AI终究还是“纸上谈兵”。
今天,CV君想和大家聊一篇非常重磅的新工作,来自北京智源人工智能研究院(BAAI)的Emu3.5。它不仅仅是一个简单的多模态模型,更是一个“世界模型”,致力于像人一样,通过观察和互动来学习世界如何运转。
先来看看这篇论文的基本信息:
-
论文标题: Emu3.5: Native Multimodal Models are World Learners
-
作者: Yufeng Cui, Honghao Chen, Haoge Deng, Xu Huang, Xinghang Li, Jirong Liu, Yang Liu, Zhuoyan Luo, Jinsheng Wang, Wenxuan Wang, Yueze Wang, Chengyuan Wang, Fan Zhang, Yingli Zhao, Ting Pan, Xianduo Li, Zecheng Hao, Wenxuan Ma, Zhuo Chen, Yulong Ao, Tiejun Huang, Zhongyuan Wang, Xinlong Wang
-
机构: BAAI
-
论文地址: https://arxiv.org/abs/2510.26583
-
项目主页: https://emu.world
-
代码仓库: https://github.com/baaivision/Emu3.5
Emu3.5是什么?
简单来说,Emu3.5是一个原生的多模态世界模型。这里的“原生”是关键,意味着它从设计之初就能同时处理和生成视觉(图片/视频)和语言(文字)信息,而不是像很多现有模型那样,通过“胶水”把独立的视觉模型和语言模型粘在一起。它的目标是预测“下一个状态”,无论这个状态是文字还是图像。
上图展示了Emu3.5强大的原生多模态能力,无论是根据指令编辑图片、生成3D模型、还是进行多步的机器人操作规划,它都能轻松应对。
核心技术:统一预测与高效推理
Emu3.5的实现可以归结为几个核心技术点:
统一的“下一个Token”预测
这是整个模型的基础。传统上,语言模型通过预测下一个词来学习,而Emu3.5将这个思想扩展到了多模态领域。它把图片和视频也“打碎”成一个个离散的“视觉Token”。
如上图所示,在训练时,模型接收一段图文并茂的序列,然后预测下一个Token,这个Token可能是一个词,也可能是一块图像。通过这种方式,模型在一个统一的框架下端到端地学习语言、视觉以及它们之间的关联。
全面的训练流程
为了让Emu3.5成为一个强大的世界模型,研究团队设计了一个非常全面的训练流程,大致分为三个阶段:预训练、监督微调(SFT)和强化学习(RL)。
-
预训练:这是最耗费“粮食”的阶段。Emu3.5在超过 10万亿(10 Trillion) 个Token的图文交错数据上进行训练,这些数据主要来自互联网视频的连续帧和对应的文字记录。海量、长时序的视频数据让模型能够学习到世界的动态变化和因果关系。
-
监督微调 (SFT) :在预训练之后,模型会在包含1500亿Token的高质量指令数据上进行微调,学会遵循人类的指令完成各种具体任务。
-
强化学习 (RL) :最后,通过多任务强化学习,进一步提升模型在多模态推理和生成上的表现,使其生成的内容更符合人类的偏好。
强化学习阶段,模型的平均奖励分从4.5稳步提升至7.1以上,证明了其能力的持续增强。
DiDA:让生成速度起飞
自回归模型(逐个Token生成)虽然效果好,但生成图片时速度非常慢,因为一张高分辨率图片可能包含数千个视觉Token。为了解决这个痛点,Emu3.5团队提出了 离散扩散自适应(Discrete Diffusion Adaptation, DiDA) 技术。
DiDA的核心思想很巧妙:在推理时,它不再一个一个地生成视觉Token,而是将图片生成过程转换成一个并行的“去噪”过程。它首先生成一个充满噪声的“草稿”,然后在几个步骤内并行地将所有视觉Token恢复成清晰的图像。这种方法将每张图片的推理速度提升了约20倍,同时几乎不损失性能。
惊艳的效果与结论
Emu3.5的能力非常全面,不仅在传统的文生图、图像编辑任务上表现出色,更展现了作为“世界模型”的潜力。
SOTA级别的图像生成与编辑
在多个图像生成和编辑的基准测试中,Emu3.5的性能都达到了业界顶尖水平,在某些任务上甚至超越了像Gemini 2.5 Flash Image这样的强劲对手。
在图像生成和编辑基准上与SOTA模型的对比,以及在交错生成任务上对Gemini 2.5 Flash Image的胜率。
DiDA技术在几乎不影响生成质量(GenEval得分)的情况下,将生成一张1024x1024图像的时间从之前的AR(自回归)方法的120秒(FlagScale优化后)大幅缩短到了10秒。
特别值得一提的是它强大的“任意到图像”(Any-to-Image, X2I)生成能力,可以根据复杂的图文指令进行精准编辑。
Emu3.5的X2I能力展示,可以进行视角切换、物体姿态调整等复杂操作。
迈向“世界模型”:探索与操控
Emu3.5最令人兴奋的是它展现出的“世界学习者”的能力。
-
世界探索:模型可以根据指令,在一个虚拟场景中进行探索,生成时空一致的连续画面,仿佛在玩一个第一人称探索游戏。
-
具身操控:模型还能理解并规划真实世界中的机器人操作。给定一个任务(如“折叠衣服”),它可以生成一系列连贯的指令和对应的关键帧图像,指导机器人完成任务。
总结
CV君认为,Emu3.5的发布是多模态大模型领域的一个重要里程碑。它不仅在生成质量和效率上取得了突破,更重要的是,它通过统一的框架和对长时序视频的学习,为构建真正理解物理世界、具备因果推理能力的通用AI代理(Embodied Agent)铺平了道路。作者团队还非常慷慨地开源了模型和完整的开发流程,这无疑将极大地推动社区在这一方向上的研究。
你觉得这种“世界模型”的思路是通往AGI的正确道路吗?欢迎在评论区分享你的看法!
更多推荐



所有评论(0)