李飞飞World Labs发布Atlas:几张照片即可重建可导航3D世界

World Labs发布了Atlas模型。它能接收几张普通照片,就输出从任意角度观看的连续视频;输入一段手机视频,则能重建出可供机器人模拟导航的完整3D场景。该模型从零预训练,核心架构采用multimodal autoregressive diffusion transformer。

这一发布立刻引发关注。因为它直接把3D重建门槛拉低到消费级设备能提供的输入上,不再依赖专业扫描仪或密集多视角拍摄。过去几年,NeRF和3D高斯溅射技术已经让照片级真实感重建成为可能,但它们大多仍需数十到上百张图像,且计算开销大。Atlas试图在数据效率和生成连续性上做出突破。

NeRF时代:从静态神经辐射场到动态场景重建

NeRF在2020年提出后迅速成为3D重建基准。它用神经网络表示场景的辐射场和密度,通过体积渲染从任意视角合成图像。早期NeRF需要对同一场景拍摄数百张照片,训练一次要几小时到几天。后续改进如Instant-NGP把训练时间压缩到几分钟,依靠哈希网格加速查找。

尽管如此,NeRF本质仍是静态的。想处理动态物体或视频输入,需要扩展到NeRF的时序版本,比如D-NeRF或Neural Radiance Flow。这些模型能捕捉简单运动,但对复杂真实世界场景仍显吃力。输入要求高、泛化能力弱,成为NeRF系列的共同限制。

Atlas没有直接沿用NeRF渲染管线,而是把扩散模型和自回归生成结合。这意味着它不是先拟合一个隐式场再渲染,而是直接学习从输入图像到新视角图像的映射关系。这种思路在数据极少时可能更稳健,因为扩散过程天然适合处理不确定性。

3D高斯溅射的爆发与局限

2023年3D高斯溅射(3D Gaussian Splatting)出现后,重建速度和质量都获得跃升。它把场景表示为大量带协方差的高斯核,通过可微分光栅化快速渲染。相比NeRF的体积采样,高斯溅射训练更快、渲染帧率更高,已被用于实时应用。

开源社区很快跟进,出现了大量基于高斯溅射的变体和工具链。像Gaussian Splatting的官方实现、后续的4D-GS动态版本,以及结合SLAM的实时重建方案,都让普通开发者也能在消费级GPU上跑通 pipeline。

但高斯溅射仍高度依赖输入图像密度。如果照片太少或视角覆盖不足,重建出的高斯点云会出现明显空洞和伪影。它擅长已见视角的逼真重现,却难以可靠地外推到完全未见过的大范围视角。Atlas的卖点之一正是从极少图像生成连贯新视角视频,这暗示其内部表示可能比显式高斯点云更具泛化性。

目前还不清楚Atlas是否在训练时使用了高斯溅射作为中间监督。但从公布信息看,它强调“从零预训练”的多模态自回归扩散Transformer,这与主流高斯溅射工作流差异明显。

Atlas架构拆解:多模态自回归扩散Transformer

Atlas的核心被描述为multimodal autoregressive diffusion transformer。Autoregressive部分意味着模型按顺序生成内容,可能先预测相机位姿,再逐步生成对应图像。Diffusion则负责处理生成过程中的噪声,让输出更真实自然。

Transformer结构天然适合融合图像、文本、3D坐标等多模态输入。World Labs称Atlas是空间智能大模型,这暗示它不只做重建,还试图理解场景的几何、语义和物理属性。输入几张照片就能输出任意视角连续视频,说明模型学会了某种隐式的场景一致性约束。

与现有开源方案相比,Atlas的最大差异在于端到端生成能力。多数开源NeRF或高斯溅射工具需要用户先做SfM(结构从运动)获得相机位姿,再训练模型,最后渲染。Atlas似乎把这些步骤统一到一个大模型里,减少了中间人工干预。

不过Atlas目前细节披露有限。论文或代码尚未公开,性能指标如PSNR、LPIPS或在标准数据集上的对比都没有给出。因此它与SOTA开源方案的精确差距仍待验证。

与开源社区方案的实际差异

开源领域已经积累了丰富工具。Nerfstudio提供了统一界面支持多种NeRF变体,3D-GS官方仓库让新手几行命令就能重建,Luma AI、Polycam等App则把高斯溅射做到手机端。它们覆盖了从数据采集到最终AR体验的全链路。

Atlas的创新可能在于“世界模型”式的思考。它不只重建静态几何,还试图让机器人在重建场景中模拟导航。这要求模型理解可通行区域、障碍物关系,而非仅仅视觉一致。这一点与近期一些开源的Gaussian Splatting + RL导航工作有相似目标,但Atlas把重建和理解融合进同一个预训练模型。

另一个差异是数据效率。开源高斯溅射通常建议至少30-50张图像才能获得较好结果,Atlas宣称几张照片即可工作。如果实际效果达到宣传水平,将大幅降低采集成本,尤其适合快速扫描真实环境的应用。

当然,开源方案胜在透明、可复现和社区迭代快。Atlas作为商业实验室产品,短期内可能不会完全开源。这也意味着开发者暂时无法直接在其基础上微调或部署到自家硬件。

AR与VR场景下的潜在价值

AR/VR对3D内容的需求极大。当前多数AR体验仍依赖预置模型或简单平面检测,真实世界快速数字化仍是瓶颈。Atlas如果能用手机随便拍几张就把房间变成可漫游的3D资产,将极大加速内容生产。

想象一下,设计师拍几张办公室照片,Atlas立刻生成可从任意角度观看的沉浸式模型,VR头显用户能直接走进去讨论布局。这比目前耗时耗力的3D建模流程快几个数量级。

在VR社交或游戏中,Atlas重建的场景还能保持视觉连续性,避免传统NeRF在新视角下出现的模糊。连续视频输出特性特别适合头显的6DoF追踪,用户转头时画面能自然跟随。

不过真实部署仍面临挑战。模型推理速度是否能达到实时?重建精度在复杂光照、反射表面下表现如何?这些问题目前都没有答案。但方向已经清晰:把真实世界快速变成数字孪生,是AR/VR下一阶段的关键。

自动驾驶与机器人导航的落地前景

自动驾驶和具身智能对3D场景理解要求更高。传统方法依赖激光雷达构建高精地图,成本高且更新慢。如果Atlas能从车载摄像头或机器人摄像头视频直接重建可导航3D世界,并理解其中语义,将显著降低对昂贵传感器的依赖。

模型提到“让机器人在里面模拟导航”,这暗示Atlas输出的不止是视觉模型,还包含可用于规划的几何和可行性信息。这与近期一些把NeRF用于仿真训练的工作思路一致,但Atlas把重建、理解、生成统一起来,可能带来更紧凑的系统。

在自动驾驶仿真领域,Atlas生成的连续视频可用于测试边缘场景:罕见天气、施工路段、行人突然横穿等。相比传统基于游戏引擎的仿真,它直接来自真实数据,分布更接近现实。

机器人领域同样受益。家用机器人或仓库机器人可以用Atlas快速建图,然后在重建场景中规划路径,而无需每次都重新感知。数据效率高的特点特别适合那些无法携带大量传感器的轻量机器人。

空间智能大模型的更广意义

World Labs由李飞飞创立,目标是打造空间智能。Atlas是该实验室首个公开产品,体现了从视觉到世界模型的转变。过去AI更多理解2D图像或语言,现在开始系统性地理解3D空间和物理规则。

这一转变对整个AI生态意义重大。具身智能需要好的世界模型,而好的世界模型又依赖高效的3D重建。Atlas试图把这两者结合,提供一个从像素直接到可交互3D世界的桥梁。

当然,目前Atlas仍处于早期阶段。实际效果、泛化能力、计算需求都需要更多公开信息来判断。它能否在复杂真实场景中保持稳定,也要等更多测试数据。

但方向已经明确。3D重建技术从NeRF到高斯溅射,再到Atlas这类多模态大模型,正从学术玩具走向实用工具。未来几年,我们很可能看到更多从少量日常拍摄数据生成高质量可交互3D世界的方案。

这不仅会改变内容创作方式,也会重塑机器人、自动驾驶、AR/VR等行业的工具链。Atlas只是开始,却指向了一个用AI快速理解并数字化物理世界的方向。

参考来源