机器人不再笨手笨脚!Meta推出新一代视觉世界模型V-JEPA 2
近日,科技巨头 Meta(Facebook母公司) 宣布开源其最新的研究成果:基于视频训练的世界模型 V-JEPA 2 。这一模型不仅具备对物理世界的视觉理解与预测能力,还能在零样本情况下进行机器人任务规划,标志着人工智能在“理解现实世界”道路上迈出关键一步。

什么是 V-JEPA 2?
V-JEPA 2 是 Meta 推出的一种自监督学习模型 ,通过观看大量互联网视频来学习现实世界的运行规律。它拥有 12亿参数 ,主要由两个核心部分组成:
-
编码器(Encoder) :将视频中的图像信息转化为计算机可处理的潜在表示。
-
预测器(Predictor) :基于这些表示,预测接下来可能发生的事情。
换句话说,V-JEPA 2 能像人类一样“观察”世界,并从中推断物体如何运动、行为如何发生、事件如何发展。
不止是“看懂”,还要“会动手”
除了强大的视频理解和预测能力,V-JEPA 2 还衍生出了一个子模型——V-JEPA 2-AC (Action-Conditioned),这是一个潜在动作条件化世界模型 。它利用少量的机器人交互数据进行后训练,便可以在没有特定环境数据或任务训练的情况下,直接部署到机器人操作任务中。
这意味着,只要给它一个目标图像,比如“把红色积木放到蓝色盒子上”,它就能指导机械臂完成这个任务,即使这是它第一次见到这个场景!
应用场景广泛
V-JEPA 2 的应用潜力非常广泛,包括但不限于:
-
动作识别与预测 :分析视频中人物或物体的动作趋势
-
视频问答系统 :理解视频内容并回答相关问题
-
机器人控制 :无需大量训练数据即可执行抓取、放置等基础操作
-
自监督预训练 :为后续任务提供高质量的视觉表征基础
Meta 在研究中展示了该模型在多个下游任务上的卓越表现,特别是在物理世界理解和人类行为预测 方面达到了当前最先进水平。
技术亮点一览

目前,Meta 已经开源了 V-JEPA 2 的代码和模型权重,鼓励研究人员和开发者共同探索其在 AI + 机器人领域的更多可能。这项技术的出现,或许意味着我们离真正“智能”的机器人又近了一步。
未来,随着类似 V-JEPA 2 的模型不断发展,可以期待 AI 在家庭服务、智能制造、医疗护理等多个领域实现更广泛的应用。
github:https://github.com/facebookresearch/vjepa2
更多推荐
所有评论(0)