METAL LAB

World Labs推出Atlas 数张照片生成复原3D世界

Fei-Fei Li的World Labs发布Atlas 用单一模型整合生成、复原与机器人仿真功能

摘要

  • Fei-Fei Li的World Labs发布世界模型Atlas 用单一模型同时处理生成、复原与仿真任务
  • 只需数张照片即可复原3D空间 支持直接输入摄像机位置 生成最长1分钟、1440p的视频
  • 可在仿真环境中批量生成机器人训练数据 目前仅面向部分合作伙伴提供早期试用
原文视频

用几张照片就能造出一整个3D世界

World Labs官方网站

此前3D生成、复原与机器人仿真分别由不同模型负责,而World Labs的Atlas将这三种功能整合进了一个模型。目前Atlas正以早期试用形式向部分合作伙伴开放,用于生成机器人训练数据。此前3D生成、复原与机器人仿真分别由不同模型负责,而World Labs的Atlas将这三种功能整合进了一个模型。目前Atlas正以早期试用形式向部分合作伙伴开放,用于生成机器人训练数据。

打造ImageNet的AI研究者Fei-Fei Li联合创立的World Labs,发布了世界模型Atlas。只要有几张照片,Atlas就能生成全新的3D场景、复原真实空间,并对该空间进行仿真——这三项工作全部由一个模型完成。此前,生成、复原、仿真这三种任务分别交由不同的专用模型处理,而World Labs宣称,Atlas在这三方面都超越了各自领域的专用模型。

具体来说,World Labs此前是靠能将3D空间转成视频的产品"Marble"打开知名度的公司,而这次的Atlas则扮演着驱动Marble等具体产品的更大引擎角色。2026年2月,该公司从Autodesk、NVIDIA等机构获得10亿美元投资时,彭博社曾报道称公司估值谈判定在50亿美元左右。

World Labs将Atlas描述为一个从零开始用文本、图像、视频、3D数据训练出来的"全能模型"。它不是把输入信息按平面顺序排列,而是把所有信息固定在3D空间中的特定位置上,公司将这种方式称为"空间上下文(spatial context)"。Fei-Fei Li在2025年11月的一篇文章中指出,现有的多模态语言模型和视频扩散模型都是把数据拆分成一维或二维序列处理,导致连简单的空间任务都很吃力;而Atlas给出的答案是用3D、4D结构来解决这个问题。

이미지: The Decoder

像直接操控摄像机一样生成画面

在摄像机控制生成功能中,只需输入一张以上的图像,就能从指定的摄像机位置和角度生成新场景。与其他视频模型需要用文本提示描述摄像机运动不同,Atlas直接把摄像机运动本身作为几何输入值接收。输出结果最长可达1分钟、1440p分辨率的视频。World Labs将这种方式形容为:用户不再是每次拉动老虎机拉杆式地随机出图,而是能真正掌控每一个场景。

两三张照片也能还原真实空间

空间复原功能只需一张到数十张照片,无需任何专业拍摄设备,就能重建真实场景。输入图像越多,模型需要自行填补的部分就越少;而据World Labs介绍,即使只用两三张照片,效果也能超过专业3D模型。在一次演示中,团队用斯坦福大学主校区广场的地面照片,从2张逐步增加到25张进行重建,最终甚至生成了从校园上空俯视的画面。相比之下,VGGT、InfiniteVGGT等现有模型在OpenWorldLib框架的对比测试中,一旦摄像机移动幅度稍大,就会出现几何结构错位、纹理模糊等问题。

由于Atlas同时处理RGB信息和深度信息,它不仅能输出图像或视频,还能直接产出真正的3D数据。支持格式包括点云和3D高斯溅射(Gaussian Splat),即用大量微小的空间数据点构成场景,让用户能从任意角度流畅观看——这与World Labs现有产品Marble所采用的表现方式一致。

World Labs Atlas生成的3D场景
이미지: The Decoder

在仿真环境中批量生成机器人训练数据

在机器人领域,Atlas被用作把真实空间搬进仿真环境的"real-to-sim"工具。只要复原出一个房间,就能同时生成仿真中机器人传感器沿移动路径所看到的图像和深度数据。仅凭几张照片,就能通过改变物体、位置、光照、背景来仿真出多种抓取、移动任务的变体,目标是无需逐一实拍现实中的每种情况,就能生成机器人学习所需的多样化数据。

这一思路此前已通过World Labs在去年8月单独推出的"real-to-sim-to-real"引擎率先亮相。该引擎能把现实中的一项任务扩展成数千种变体,完全在仿真环境中训练控制模型;据公司介绍,该模型已在5种机器人平台上分别实现1小时无人工干预的自主运行。这项技术源自World Labs去年7月收购的初创公司SceniX。

이미지: The Decoder

公司自评称领先竞品模型

World Labs表示,没有任何单一基准测试能完整衡量Atlas的能力,但仍公布了两项评测结果。在人工评估者对比摄像机控制生成结果的项目中,Atlas相较MiniMax H3获得75%的偏好率,相较Google Gemini Omni Flash获得81%,相较Happy Horse 1.1获得86%,相较字节跳动的Seedance 2.5获得94%。原文中93%这一项的对比对象名称缺失,无法核实。

对比对象Atlas偏好率
MiniMax H375%
Gemini Omni Flash81%
Happy Horse 1.186%
(模型名称未确认)93%
Seedance 2.594%

在少量照片的3D复原评测中,公司表示Atlas的中位误差为25.3,超过了Pi3X和VGGT-Ω 1B。

이미지: The Decoder

从Marble起步 到融资10亿美元

World Labs由Fei-Fei Li于2024年创立。Fei-Fei Li是打造ImageNet的研究者,2017年至2018年间还领导过Google Cloud的AI部门。公司创立之初便获得Andreessen Horowitz、AMD、Intel、NVIDIA的投资。2024年末推出的首个系统,用户在虚拟空间中移动几米就会撞上看不见的边界;2025年11月推出的Marble则接续了这一系统。

2026年2月,公司从Autodesk、Andreessen Horowitz、NVIDIA、AMD获得了10亿美元规模的投资,而在此之前,彭博社曾报道称公司估值谈判定在50亿美元左右。Atlas未来将作为核心模型,驱动即将推出的多个Marble版本及其他产品,目前仅通过面向部分合作伙伴的早期试用计划提供,普通用户还无法直接上手体验。

이미지: The Decoder

围绕"世界模型"定义的争论

"世界模型"到底指什么,研究者之间意见并不一致。由北京大学牵头的国际研究团队在2026年4月通过OpenWorldLib提出了一套统一定义,将纯文本转视频模型排除在外,理由是这类模型缺少与现实世界的反馈闭环。在这一框架下,3D复原以及像Atlas这样的仿真器,因能提供可验证物理规律的环境,而被视为核心构成要素。

官方原始视频

MiniMax H3 system overview

编辑视角

Atlas真正有意思的地方不在于性能数字,而在于它的思路。此前,3D生成、复原和机器人仿真分别属于不同模型、甚至不同公司的地盘。NVIDIA靠Cosmos推机器人基础模型,腾讯推出了用文本提示生成开放世界的工作流,Runway则拿出了实时绘制画面本身的交互式世界模型。World Labs等于是说要把这三条路线都塞进一个模型里——如果这个判断是对的,那现在各自独立使用的多个3D流水线工具,可能正开始走向合并成单一模型的路径。

对比几代产品能更直观感受到变化。2024年末的初代系统,用户在虚拟空间里移动几米就会撞墙;不到一年后推出的Marble已能生成真正可用的3D场景;而这次的Atlas更进一步,承担起驱动Marble本身的引擎角色。每一代产品的角色都在快速演变——从"能演示"到"能用的工具",再到"驱动其他工具的底层基础",这个迭代速度值得关注。

从实际操作层面看,现在还处于观察阶段。由于只开放早期试用,普通开发者或工作室还无法直接接入使用;而且目前给出的基准测试也只有公司自行发布的人工评估结果和自测的复原误差数据。不过机器人训练这一块值得留意——用仿真批量生成现实中难以拍摄的抓取、移动任务变体,对于处理机器人基础模型的团队来说,不失为一个降低数据获取成本的参考思路。

未来几个月里,Atlas到底能在Marble中落地多少,以及面向合作伙伴的早期试用何时向公众开放,将是检验这次发布含金量的真正标准。在NVIDIA、腾讯、Runway各自以不同方式加入3D与世界模型竞争的当下,Atlas能多快展示出超越基准数字的实际应用场景,将决定这次发布的分量究竟有多重。

评论