登录社区云,与社区用户共同成长
邀请您加入社区
26年5月来自上海创新研究院和智元机器人的论文“τ0-WM: A Unified Video-Action World Model for Robotic Manipulation”。机器人操纵任务要求模型不仅能生成可执行的动作,还能在实际物理执行之前,预先推演并评估这些动作的未来后果。为此,本文提出一种名为 τ0-World Model (τ0-WM) 的统一视频-动作世界模型;该模型将策略学习
ros2 launch turtle_tf2_py turtle_tf2_demo.launch.py #打开两个小海龟的launch,其中一个小海龟会追着另一个小海龟走。$ ros2 run learning_service service_object_server#视觉识别节点,订阅图像数据,并且集成一个服务器端,随时提供目标的位置。ros2 launch learning_gazebo l
华为Could API人工智能系列——文本合成MP3音频
SLAM3R 系统示意图。过去的三十年间,研究者们建立了较为完善的多视角几何理论和计算框架,通常依赖多种算法的集成,包括运动恢复结构(Structure-from-Motion,简称 SfM)、同时定位和地图构建(Simultaneous Localization and Mapping,简称 SLAM)以及多视角立体视觉(Multi-View Stereo,简称 MVS)等。更为重要的是,SLA
Yocto 项目不是一个操作系统,而是一套构建 Linux 分发版本的工具和基础元数据,包括 BitBake 构建引擎,元数据 Layer 和参考分发版 Poky。
26年1月来自NV和斯坦福大学的论文“Cosmos Policy: Fine-tuning Video Models For Visuomotor Control And Planning”。近期视频生成模型展现出卓越的能力,能够捕捉复杂的物理交互和场景随时间演变的过程。为了利用其时空先验信息,机器人领域的研究已将视频模型应用于策略学习,但这也引入复杂性,需要多阶段的后训练以及用于动作生成的新架构
为了解决上述问题,中科第五纪联合中科院自动化所团队推出 BridgeV2W,它通过一个极为优雅的设计,具身掩码(Embodiment Mask),一种由机器人动作渲染出的“动作剪影”,将坐标空间的动作无缝映射到像素空间,从而真正打通预训练视频生成模型与世界模型之间的桥梁,让机器人学会可靠地“预演未来”。技术上,BridgeV2W 采用 ControlNet 式的旁路注入,将掩码作为条件信号融入预训
去年12月,爱诗科技推出了V5.5版本的自研多模态大模型,旗下产品PixVerse(拍我AI)不仅能能实现专业运镜,还将具备“导演思路”的分镜+音频同步生成的能力封装进模型和产品,为用户和创作者提供全新视频生成体验。遵循版权保护与内容合规的前提下,爱诗科技将获得中国儒意旗下优质版权内容授权,激发用户参与共创的活力,释放IP的多元创作潜能。通过爱诗科技自研大模型,推动南瓜电影在内容创作、包装、发行和
补充图中的定性结果显示,与仅依赖因果注意力甚至是没有帧局部注意力的Mamba2模型相比,该模型能够在更长的时期内生成更连贯和准确的序列。通过将长序列分解为可管理的块,模型可以维持一个压缩的“状态”,该状态携带跨块的信息,从而有效扩展模型的记忆范围。通过将帧分组为块(例如,每块5帧,帧窗口大小为10),块内的帧保持双向性,同时也能关注前一个块中的帧。这允许有效的感受野,同时优化计算负载。这意味着在超
1. Sora的训练受到了大语言模型(Large Language Model)的启发。这些模型通过在互联网规模的数据上进行训练,从而获得了广泛的能力。Sora是一种扩散模型,它能够通过从一开始看似静态噪声的视频出发,经过多步骤的噪声去除过程,逐渐生成视频。Sora不仅能够一次性生成完整的视频,还能延长已生成的视频。通过让模型能够预见多帧内容,团队成功克服了确保视频中的主体即便暂时消失也能保持一致
24年11月来自微软的论文“AVID: Adapting Video Diffusion Models To World Models”。大规模生成模型在许多领域取得了显著的成功。然而,对于机器人等顺序决策问题,动作标记数据通常很少,因此扩大决策基础模型仍然是一个挑战。一个潜在的解决方案,是利用广泛可用的未标记视频来训练模拟动作后果的世界模型。如果世界模型准确,则可以用它来优化下游任务中的决策。图
允中 发自 凹非寺量子位 | 公众号 QbitAI建立会做视频的世界模型,也能通过Transformer来实现了!来自清华和极佳科技的研究人员联手,推出了全新的视频生成通用世界模型——WorldDreamer。它可以完成自然场景和自动驾驶场景多种视频生成任务,例如文生视频、图生视频、视频编辑、动作序列生视频等。据团队介绍,通过预测Token的方式来建立通用场景世界模型,WorldDreamer是业
定性结果(如补充图S1、S2、S3所示)表明,与仅依赖因果注意力甚至没有帧局部注意力的Mamba2相比,长上下文状态空间视频世界模型能够在更长的时间跨度内生成更连贯、更准确的序列。例如,在迷宫数据集的推理任务中,他们的模型在长时间范围内保持了更好的一致性和准确性。近期,特别是视频扩散模型的进步,在生成逼真的未来序列方面展现出了惊人的能力。由于使用传统的注意力层处理长序列会产生高昂的计算成本,当前模
在本文中,研究者提出了 Context-as-Memory,一种能够实现静态场景记忆的交互式长视频生成模型。Context-as-Memory 的核心创新在于,提出了一种无需显式 3D 建模,仅通过对历史上下文学习,即可使视频生成模型具备 3D 一致性的理解与生成能力。此外,Memory Retrieval 模块的提出进一步减少了需要学习的上下文数量,大大提高了模型在训练和测试阶段的效率。团队近期
定性结果,如补充图表所示,说明了与仅依赖因果注意力甚至是不带帧局部注意力的Mamba2模型相比,长上下文状态空间视频世界模型能在更长时间跨度内生成更连贯、更准确的序列。然而,一个显著的瓶颈依然存在:维持长期记忆。这意味着在特定数量的帧之后,模型会有效地“忘记”较早的事件,从而阻碍其在需要长程一致性或长时间跨度推理的任务上的表现。研究人员在具有挑战性的数据集上评估了他们的长上下文状态空间视频世界模型
最新消息,!——带队Sora研究的两位负责人之一,也是DALL-E 3作者之一,刚刚发布了一条热情四溢的推特,广纳天下英才:DeepMind有雄心勃勃的计划,要。向着这个使命,我开始招募一个新团队。快来加入我们吧!Brooks是AI圈子里十分耀眼的新秀,2023年刚刚从UC伯克利博士毕业。2023年1月起,Brooks开始带队研究Sora;2024年2月,Sora初亮相。但在去年10月,Brook
我们欢迎更多的小伙伴参与。
24年12月香港科技大学和地平线的论文“DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT”。自回归 (AR) 生成模型(例如自然语言处理中的 GPT 系列)的最新成功,促使人们努力在视觉任务中复制这种成功。一些研究试图通过构建基于视频的世界模型将这种方法扩展到自动驾驶,该模型能够生成逼真的未来视频
实验结果表明,Context-as-Memory方法在记忆能力和生成质量上都显著优于基线和SOTA方法,这表明它能够有效利用历史上下文,避免冗余和历史信息丢失,从而保持长视频生成的一致性。值得注意的是,正如我们在开头的demo中所见,摄像机的运动仅表现为左右摇镜。具体来说,模型从一个无限长度的历史上下文中开始,利用一个“记忆检索”模块从中筛选出那些真正有用的、与当前生成最相关的上下文帧。通过计算过
26年1月来自复旦大学、上海创新研究院、香港大学和腾讯PCG的论文“VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control”。视频世界模型旨在模拟动态的真实世界环境,但现有方法难以对摄像机和多物体的运动进行统一且精确的控制,因为视频的动态特性本质上是在投影的二维图像平面上体现的。为了弥补这一不足,引入
港大与快手团队提出ContextasMemory方法,通过将历史视频帧作为记忆条件,实现了长视频生成的场景一致性。该技术创新性地采用基于相机轨迹视场的记忆检索机制,显著提升了计算效率。实验显示其效果接近DeepMind未开源的Genie3,
它的词表大小为32,768。Emu3为多模态AI指出了一条富有想象力的方向,有机会将AI基础设施收敛到单一技术路线上,为大规模的多模态训练和推理提供基础。在视觉和语言的固有token中新增了五个特殊token来合并文本和视觉数据,以为训练过程创建类似文档的输入。由于 Emu3 中的视觉信号已完全转换为离散token,因此只需使用标准的交叉熵损失进行下一个token预测任务的训练。“对于研究人员来说
新兴世界模型根据动作(如相机移动和文本提示等控制信号)自回归地生成视频帧。 由于时间上下文窗口大小有限,这些模型在重访期间往往难以保持场景的一致性,从而导致对先前生成的环境的严重遗忘。 受人类记忆机制的启发,我们引入了一个新的框架,通过基于几何学的长期空间记忆来增强视频世界模型的长期一致性。 我们的框架包括从长期空间记忆中存储和检索信息的机制,我们策划了自定义数据集,以训练和评估具有显式存储的3D
北京智源研究院发布并开源了基于原生多模态训练的世界学习者(World Learners)。Emu3.5的核心突破,在于它用同一种方式预测下一个词和下一帧图像。人工智能的发展正从单一感官的专才,走向多重感官融合的通才。语言模型在文本世界里所向披靡,但文字终究只是对现实世界的有限描述。视觉,作为人类感知环境最主要的信息渠道,与语言的深度结合,才能真正开始捕捉这个世界的无穷复杂性。由北京智源人工智能研究
25年10月来自哈工大和华为诺亚实验室的论文“PhysWorld: From Real Videos to World Models of Deformable Objects via Physics-Aware Demonstration Synthesis”。模拟物体动力学的交互式世界模型对于机器人、虚拟现实(VR)和增强现实(AR)至关重要。然而,从有限的真实世界视频数据中学习符合物理规律的
我们使用 Whisper-large-v2 对每条视频做自动语音识别,获取逐词时间戳的文本,并通过 spaCy 进行停顿切分与句法整理,使视频语言更自然、结构化。长视频蕴含的是更深层次的世界规律,是时空延展的多模态经验(long-horizon multimodal experiences)。这些挑战,本质上也是未来方向:更大规模数据、更先进模型结构、更系统评估方法、更高效 tokenizer,将
世界模型的核心目标,是通过学习环境状态与观测的演化规律,构建一个能够进行未来预测、内部仿真、规划搜索和行动决策的模型框架。与很多只聚焦单一场景或单一方法路线的文章不同,这篇综述从整体视角系统回顾了 AI 中世界模型的发展,并将现有方法归纳为四大分支:观测层生成式世界模型、潜空间世界模型、强化学习驱动的世界模型,以及对象中心世界模型。在此基础上,论文进一步梳理了世界模型在机器人、自动驾驶、科学发现、
Odyssey的两位创始人Oliver Cameron和Jeff Hawke都出身自动驾驶圈,一个是Wayve自动驾驶技术的AI研究元老,一个是Voyage自动驾驶公司的CEO。简单来说:AI每预测一帧,就往前走一步,但只要某一帧稍微出错,后面的内容可能就会彻底“走形”。这就像大语言模型预测下一个单词一样,不过现在预测的是图像,是动态的、沉浸式的、交互式的世界。如今,这种由AI驱动的、可实时交互的
11月13日,李飞飞创办的创业公司World Labs正式发布多模态世界模型Marble。
25年10月来自Meta 和 NYU的论文“World Models Can Leverage Human Videos for Dexterous Manipulation”。灵巧操作极具挑战性,因为它需要理解细微的手部动作如何通过与物体的接触来影响环境。提出一种名为 DexWM 的灵巧操作世界模型,该模型能够根据过去的状态和灵巧操作预测环境的下一个潜状态。为了克服灵巧操作数据集稀缺的问题,De
统一世界模型(Unified World Models, UWM)是一个突破性的机器人学习框架。它用一个扩散式生成模型,同时学习世界动力学和动作策略,并通过独立控制两个扩散时间步,在推理时灵活切换策略采样、前向推演、逆向推理和视频预测四种模式。最关键的创新是能够自然地融合有动作标签的机器人轨迹和海量无标签视频,使得小数据学习和跨环境泛化都得到显著提升。目前代码已经在Github开源了。
HY-World 1.5:实时交互式世界建模系统框架 腾讯推出的HY-World 1.5突破了传统3D世界建模的局限性,通过创新的WorldPlay流式视频扩散模型,实现了24FPS的实时交互式世界生成。该系统具备四大核心技术: 1)双动作表征融合离散与连续控制信号; 2)重构上下文记忆机制保持长期几何一致性; 3)WorldCompass强化学习框架提升动作跟随能力; 4)上下文强制蒸馏技术平衡