2026-09-05AI 观察Tao

李飞飞与 World Labs:Atlas 发布,世界模型走向“新视角预测”与空间智能

World Labs 联合创始人李飞飞、Justin Johnson、Ben Mildenhall 对话 a16z 马丁·卡萨多(Martin Casado):深度拆解刚刚发布的基础世界模型 Atlas。团队从“新视角预测”切入,首次在单一原生多模态架构中统一 3D 重建与生成想象,探讨从 3 部 iPhone 的“子弹时间”到百倍采集成倍压缩的 Stanford Quad,并推演空间智能在具身机器人仿真、Sim-to-Real 数据飞轮与 4D 动态交互上的技术跃迁。

目录共 7 节
  1. 统一生成与重建:五十年视觉研究的合流
  2. 新视角预测:空间智能在物理世界的“Next Token”
  3. 从三脚架上的 iPhone 到斯坦福四合院:百倍压缩数据采集成本
  4. 架构演进:解耦高斯泼溅与空间上下文窗口
  5. 空间智能的 Scaling Law:算力曲线才刚刚开始
  6. 具身智能与 Real-to-Sim:把世界模型做成机器人的神经模拟器
  7. 婴儿期的动态、4D 交互与创作者工作流的范式转移

原始视频Why World Models Could Change Robotics, 3D, and Creativity

a16z · 2026-09-04 · 43 分 43 秒

主持:Martin Casado,a16z 普通合伙人 · 嘉宾:李飞飞、Justin Johnson、Ben Mildenhall,World Labs 联合创始人

字幕说明:视频由 a16z 官方发布并提供英文字幕,文中人名、技术术语(如 NeRF、Gaussian Splats、Real-to-Sim)已按业界规范与一手论文校对。

补充一手资料World Labs 官网与 Atlas 介绍 · a16z 播客主页 · NeRF 原始论文与全景展示

2026 年 9 月 4 日,由李飞飞、Justin Johnson、Ben Mildenhall 与 Christoph Lassner 共同创立的 World Labs 正式推出了其新一代基础世界模型 Atlas。

伴随发布而来的演示视频在技术社区引发了持续震动:仅凭三部普通 iPhone 在三脚架上录制的日常片段,模型就能在无需绿幕、无需摄影棚、无需高精度几何标定的前提下,复刻出《黑客帝国》标志性的“子弹时间”全视角飞越;而站在地面手持拍摄的数十张斯坦福四合院照片,被模型直接外推为俯瞰全景的无人机航拍视轨。

在 a16z 随后录制的对谈中,World Labs 创始团队与 a16z 普通合伙人 Martin Casado 展开了深度的技术复盘。整场讨论的核心并没有停留在视觉效果的惊艳上,而是直指一个更底层的范式断代:生成式 AI 正在从“生成好看但虚浮的 2D 像素”,跨越到“生成真正受空间几何约束与物理锚定的空间智能”。

大语言模型的基础原语是 Next Token Prediction,视频生成模型的基础原语是 Next Frame Prediction,而 Atlas 的核心原语,是新视角预测(New View Prediction)。

统一生成与重建:五十年视觉研究的合流

在计算机视觉长达半个多世纪的发展史中,三维重建与图像生成始终处于相互割裂的平行轨道。

学术会议的版块划分最能说明这种分工。一边是追求物理与数学严密性的几何重建学派,从传统的运动恢复结构(SfM)、多视角立体视觉(MVS)一路演进到神经辐射场(NeRF)和 3D 高斯泼溅(3DGS);另一边则是追求视觉表现力的生成模型学派,从早期的 GAN 到近年来统治屏幕的大规模视频扩散模型。

这两条传统路线各自带着难以调和的工程硬伤。

传统的密集三维重建更像严谨的科学或医学成像。为了让空间中的每一立方厘米被精确重建,算法要求目标表面必须在至少三到四个不同视角的光束中被交叉观测(Triangulation)。这要求极度繁琐的现场采集:扫描一个多房间环境,新手往往要手持相机步行一到两个小时,捕捉数百甚至数千张高重叠度照片;即便由世界级专家掌镜,椅子下沿、桌板反面或叶片缝隙的轻微遮挡,依然会在点云中留下难看的空洞。

纯视频生成模型走向了另一个极端。通过在大规模无标注视频上进行潜空间扩散,它们学会了极具欺骗性的视觉联想,但本质上如同“视觉老虎机”。用户输入提示词后,模型一次次随机掷骰子;镜头一旦移动或回环,物体的透视与拓扑结构就会悄然形变,无法维持哪怕几秒钟的客观空间常态。

Atlas 的突破在于第一次将像素生成与三维几何重建统一进同一种架构中。

面对真实物理场景,Atlas 不再把未观测到的遮挡当作死角,也不把连续视角当作脱离三维约束的自由幻觉。它以真实的相机位姿为锚点,在保留已知视野严密几何精度的同时,利用生成模型的先验概率,自动、合乎物理逻辑地补全那些永远无法被全部拍到的死角盲区。

新视角预测:空间智能在物理世界的“Next Token”

这种架构大一统的背后,是一个全新的基础抽象:新视角预测(New View Prediction)。

在与 Martin Casado 的拆解中,Justin Johnson 用大模型的发展轨迹作对比。自然语言处理之所以在过去数年实现通用智能的爆发,是因为整个领域确立了统一的数学原语——自回归语言建模(Next Token Prediction)。无论机器需要翻译法文、编写 Python 脚本还是推导数学逻辑,所有能力最终都被统一抽象为在给定上下文后预测下一个 Token。

视频模型试图将这一逻辑套用到时间轴上,定义出“下一帧预测(Next Frame Prediction)”。但纯时间维度的帧推演无法理解三维空间。当摄像机视角变动时,下一帧预测很容易丢失空间一致性,因为模型在潜意识里缺乏“世界在第三个维度到底由什么构成”的坐标系。

Atlas 的核心机制,是将输入的一组或多组观测图像及其对应的空间位姿编码为“空间上下文(Spatial Context)”。在这个隐式的世界表征建立之后,用户可以向模型传入任意虚拟摄像机的三维位姿坐标。Atlas 的任务不是在时间线上赌下一帧,而是在空间几何中精确推断:当观察者站在此处并望向该方向时,这个世界理应呈现何种光影与形体。

李飞飞从演化生物学的视角给出了更深刻的论述。大自然赋予了几乎所有移动动物一双眼睛,却没有赋予大树眼睛,其本质原因在于“移动带来视角的变化”。智能在物理世界中得以诞生的先决条件,正是生命体在移动过程中持续预测并验证新视角下的环境反馈。

从这个意义上讲,新视角预测在三维物理世界中具备了与 Next Token Prediction 完全同等的“AI 完备性(AI Completeness)”。如果一个模型能够在任意空间轨迹、任意视点下准确生成符合现实规律的图像与深度,它就已经在内部建立了关于物质、光线、阻挡与空间关系的完备心智模型。

从三脚架上的 iPhone 到斯坦福四合院:百倍压缩数据采集成本

这种技术原语的跃迁,直接打破了传统视觉生产的高昂壁垒。

在好莱坞历史上,《黑客帝国》第一部中基努·里维斯后仰躲避子弹的镜头被公认为视效里程碑。为了实现时间冻结而视角围绕演员 360 度旋转的画面,制作团队在全封闭绿幕摄影棚中搭建了一整圈由上百台物理相机组成的庞大阵列,并进行了极其严苛的快门同步与空间标定。

在 Atlas 的评测中,同样的动态冻结与漫游合成被降维到了不可思议的平民化门槛:只需要三部最普通的 iPhone 手机,架设在普通三脚架上,对着抛入空中的篮球或溅起奶花的草莓进行录制。没有昂贵的动作捕捉系统,没有绿幕,没有复杂的相机外参校准,Atlas 仅凭这三个稀疏视角就完美生成了在时间悬停中任意穿梭的连续平滑镜头。

更具说服力的是在斯坦福大学纪念四合院(Stanford Quad)进行的实测。Ben Mildenhall 仅在地面以步行视角拍摄了 3 到 25 张普通快照。然而在 Atlas 的生成演示中,摄像机直接升空至高空数十米,生成了一段视野辽阔的无人机航拍俯瞰视频。

这段航拍视轨没有一张对应的高空输入照片。所有高处建筑的房顶排布、回廊透视与庭院纵深,都是 Atlas 在理解了地面观测图像的空间几何之后,依据真实的物理投影与建筑结构先验纯粹生成出来的。

这意味着真实世界资产数字化的物理采集成本被压缩了 50 到 100 倍。以往需要数千张无人机倾斜摄影与激光雷达测绘的场景,现在可以通过少量稀疏视角在极短时间内完成重建与高质量延展。

架构演进:解耦高斯泼溅与空间上下文窗口

在 Atlas 诞生之前,World Labs 曾于去年推出过初代产品 Marble。理解从 Marble 到 Atlas 的架构更迭,是看清世界模型工程演进的关键线索。

Marble 的设计核心是将场景直接表征为高斯泼溅(3D Gaussian Splats)。3DGS 的优势显而易见:渲染速度极快,能够在移动设备、头显以及现代游戏引擎中实时运行。然而团队很快在工程实践中触碰到了天花板——把 3DGS 作为模型的原生端到端输出格式,实际上在模型表征能力与规模化之间筑起了一道严重的瓶颈。高斯椭球体的参数分布对极其复杂的场景难以灵活泛化,更难容纳原生多模态的大规模联合训练。

在 Atlas 中,World Labs 彻底推翻了这一紧耦合设计,确立了三项决定性的架构原则。

首先是全周期的原生多模态对齐。Atlas 从预训练的第一阶段开始,就不仅输入文本、RGB 图像与视频,更将三维摄像机位姿(Camera Poses)与深度图(Depth Maps)作为一等公民的底层模态一同纳入。深度图锚定了三维空间的骨架,RGB 填充了材质与光影,而相机位姿则成为了连接观测与推理的通用坐标系。

其次是引入了“空间上下文窗口(Spatial Context Window)”。这直接借鉴了大语言模型上下文长度的演进经验。大模型通过扩充上下文长度,解决了在海量文档中检索细节的难题;而在 Atlas 中,三维重建被优雅地等价为“长空间上下文的视角生成”。无论是输入 3 张照片还是 64 张漫游照片,模型都能像处理上下文片段一样优雅吸收,使得在整座大型多房间建筑内部的连续穿行成为可能。

最后是输出表征的解耦。Atlas 本质上是一个自回归的新视角生成引擎。它既能直接输出高质量的连续视角视频与深度流,也能在工业管线需要时,下游无损烘焙为高精度的 3DGS、点云或三维网格。这种解耦释放了模型参数规模的扩展潜力,使得世界模型不再受限于某种特定的图形学几何数据结构。

空间智能的 Scaling Law:算力曲线才刚刚开始

在基础大模型领域,“扩展律(Scaling Law)是否存在”往往决定了一项技术是短期技巧还是长期基础设施。

对于空间智能与三维世界模型是否存在 Scaling Law,Justin Johnson 给出了毫不犹豫的肯定答案。在 Atlas 的研发周期中,团队训练了一整套从小尺寸到大尺寸的模型阶梯。随着网络参数量的翻倍、训练时长的拉长以及计算集群规模的扩张,模型在新视角外推的几何严密性与细节还原度上表现出了完全可预测的、显著的单调收益。

一个在团队内部广为流传的转折点发生在一个初夏的早晨。当时正在训练的还只是一个早期的轻量实验模型。Ben Mildenhall 将经典的 NeRF 花园木桌数据喂入系统后,模型生成的虚拟摄像机竟然在没有被赋予任何手工规则的情况下,自主、平滑地穿行到了木桌的正下方,将整片处于阴影中的桌底结构连同地面上的足球完整渲染了出来。看到这一幕的创始人团队在五秒钟内达成了共同信念:空间智能的 Scaling 假设完全成立。

更重要的是,World Labs 明确指出,目前制约世界模型向前演进的单一最大瓶颈,既不是三维数据的不足,也不是网络结构的缺陷,而是训练算力(Training Compute)。

当前发布的 Atlas 甚至不是架构所能承载的理论极限,而仅仅是团队在既定公开发布日期之前、在受限算力预算下所能收敛的最佳检查点。换言之,空间智能的算力爬坡曲线才刚刚立在起点。

具身智能与 Real-to-Sim:把世界模型做成机器人的神经模拟器

在内容创作与视效行业之外,World Labs 战略布局的另一个重镇是具身机器人(Embodied Robotics)。此前团队低调收购了工业机器人仿真团队 Synnex,而 Atlas 恰恰是填补机器人技术死结的关键拼图。

当前具身智能发展的最核心短板并非算法,而是物理世界的数据匮乏。代码与文本模型可以低成本抓取全球互联网数十年沉淀的现成资产,但机器人要学会洗碗、插拔线缆或操作机械臂,必须在充满物理摩擦、弹性形变与接触不确定性的真实环境中反复试错。在物理世界中部署真机采集边缘用例,不仅速度极其缓慢,而且成本极为昂贵。

传统的解决路径是 Real-to-Sim:用激光与相机扫描真实工业台架,导入物理引擎做几何重建,再进行强化学习训练。然而过去这一步骤饱受密集扫描之苦,光是给一个工业线缆操作台建模就要耗去几天时间,极大地拖慢了研发迭代速度。

Atlas 为 Real-to-Sim 提供了跨越式的解决方案。工程人员只需手持手机拍摄几张工作台照片,Atlas 就能瞬间生成带有深度与空间几何的高保真三维模拟环境。

更为关键的是领域随机化(Domain Randomization)。在 Atlas 生成的虚拟环境中,算法可以低成本随机化线缆的弯曲程度、材质反光、零部件尺寸公差与外部光照分布,让机器人策略(Policy)在数万种虚拟衍生场景中承受极限测试,从而平滑跨越从虚拟仿真回到物理实体(Sim-to-Real)的泛化鸿沟。

从更长远的蓝图来看,World Labs 正在将世界模型推向“交互式神经模拟器(Neural Simulator)”。当一个世界模型通过海量观测深刻掌握了“外界环境如何对机器人的操作施加物理反作用”时,模拟器本身就能反向充当动作规划器(Planner)——因为预知了动作产生的物理后果,智能体自然就能推导出通向目标状态的最佳行动路径。

婴儿期的动态、4D 交互与创作者工作流的范式转移

针对首发版本中部分外界关于“静态漫游居多、缺乏激烈物理动态”的讨论,团队在访谈中揭示了其底层的技术阶段考量。

事实上,Atlas 的基础底座从预训练起就吸纳了大量的动态视频数据,当前的模型权重中已经蕴含着“婴儿动态(Baby Dynamics)”。在官方展示的某些大场景中,水面微风拂过的波浪褶皱、远景公路上的车辆行驶,都已展现出时间维度的运动萌芽。

这里隐藏着一个深刻的技术辩证法:要想在未来把动态做好,第一步反而在静态几何的剥离上。真实世界的视频数据普遍处于运动中,如果模型无法将光影瞬变与空间几何有效解耦,就无法奠定稳固的 3D 基础。团队在本次发布中刻意通过后训练强化了相机空间轨迹的自由控制,正是为了先牢牢守住几何的一致性。

下一步的演进目标极为明确:推向真正的 4D 世界模型。不仅摄像机可以自由位移,场景内的物体也将在时间轴上产生物理变形、碰撞与交互。

在与 a16z 的交流尾声,三位创始人描绘了空间智能对创意与设计产业的长期重塑。当前建筑设计、展会搭建、影视前期与三维动画流程中,95% 的摩擦成本耗费在“将口头创意、手绘草图与修改意见翻译进复杂的工业级三维软件(如 Maya、Blender、CAD)”的琐碎折磨中。一个微小的方案调整,往往伴随着数天的返工。

当拥有高保真物理先验的世界模型能够听懂自然意图、精确响应多模态控制,并且支持具备时空连续性的交互编辑时,人机交互的门槛将真正回归到如同搭积木或捏泥塑般的直觉。

Atlas 证明了一件事:在语言模型的 Token 序列之外,物理世界正以三维几何与新视角预测为通用语言,被加速编织进同一张智能之网中。

发布自
atlasnote-editorial
发布日期
2026-09-05
标签
AIworld-modelsspatial-intelligence3droboticsfei-fei-liinterview