产品简介
Atlas 是李飞飞联合创办的空间智能公司 World Labs 于 2026 年 9 月 1 日发布的全球首个多模态世界模型。该模型从零预训练,原生处理文本、图像、视频、相机位姿与 3D 深度信息,通过空间上下文机制将各类输入统一锚定在三维空间坐标中,实现基于空间推理的生成。Atlas 的发布被视为空间智能赛道的重要里程碑,被媒体称为空间智能的 GPT 时刻。目前该工具仅向合作伙伴开放早期访问,尚未公开定价与注册。
核心功能
- 相机控制生成:将相机位姿参数作为原生输入,给定 1-6 张普通照片与运镜轨迹,可生成最长 1 分钟、1440p 分辨率的视频,实现像素级精确运镜。
- 空间重建:从 2-25 张游客视角平拍照重建真实场景,输出点云与 3D 高斯泼溅等显式 3D 表示,在 DTU、ETH3D、ScanNet 等公开集上稀疏视角重建误差 AbsRel 为 25.3。
- 时空模拟:支持子弹时间效果,可从 3-5 个机位任意角度重生成画面;支持视频重构图,并能将真实视频转换为机器人可训练的仿真环境,生成机身视角 RGB 与深度数据。
- 图像生成:支持文本生成图像与 360 度全景图,能够处理复杂提示词并渲染图中文字。
- 多模态统一架构:采用多模态自回归扩散 Transformer,空间上下文机制将每张输入图像锚定在三维空间具体坐标,模型在 3D 空间推理而非像素序列,可拼接两张无关参考图并设定位置生成过渡世界。
适合谁用
以下类型的用户会特别受益于 World Labs Atlas:
- 视觉特效制作:从几张现场照片快速还原空间场景,用于影视后期与虚拟制片。
- 游戏设计:生成可控视角的 3D 环境与动态场景,辅助关卡设计与概念验证。
- 机器人训练:将真实操作视频转换为仿真环境数据,生成机身视角 RGB 与深度信息,降低数据采集成本。
- 空间内容创作:通过文本或稀疏照片生成 360 度全景图与多视角视频,用于沉浸式体验制作。
优点亮点
- 原生支持相机位姿输入,视频生成运镜控制精度达到像素级。
- 稀疏视角重建能力突出,仅需少量平拍照即可输出显式 3D 结构。
- 多模态统一架构设计,文本、图像、视频、3D 深度信息共享同一空间推理框架。
- 支持机器人 Real-to-Sim 转换,为仿真训练提供高效数据通路。
- 可拼接多张参考图并指定三维位置生成过渡世界,创作灵活性高。
- 由李飞飞团队领衔,公司获得 NVIDIA、AMD 等机构投资,技术积累与资源支持扎实。
价格与方案
目前仅向合作伙伴提供早期访问,未公开定价与注册渠道,具体商业条款以官网发布为准。
总结与建议
Atlas 作为全球首个多模态世界模型,将文本、图像、视频、相机位姿与 3D 深度统一在空间上下文中进行推理,在相机控制生成、稀疏重建与时空模拟方面展现出完整能力。其应用覆盖视觉特效、游戏设计与机器人训练数据基建,当前处于合作伙伴早期访问阶段,未来将驱动 World Labs 旗下 Marble 等产品发展。
版本演进
- World Labs Atlas 正式发布 (2026-09-02):World Labs 发布 Atlas,自称全球首个多模态世界模型:以空间上下文机制把文本、图像、视频、相机位姿与 3D 深度统一锚定在三维空间中,支持像素级相机控制的视频生成(1-6 张照片+运镜轨迹即可生成最长 1 分钟 1440p 视频)、稀疏照片重建显式 3D(点云/3D 高斯泼溅)、时空模拟与机器人 Real-to-Sim 训练。目前仅向合作伙伴早期访问开放,未公开定价,未来将驱动 Marble 等产品。