由李飞飞联合创立的空间智能公司World Labs近日宣布,其研发的新一代多模态世界模型Atlas正式发布。这款被业界称为“全球首个多模态世界模型”的产品,突破了传统视频生成与3D重建的技术边界,通过统一的基础架构实现了视频生成、三维重建和时空模拟三大核心功能。公司透露,该模型已向特定合作伙伴开放早期测试,未来将成为其3D生成平台Marble的底层技术支撑。
与传统视频生成工具不同,Atlas从零开始构建训练体系,将文本、图像、视频和3D数据在初始阶段即纳入统一模型。通过创新性的空间上下文机制,模型能将每张输入图像与对应的相机位置精确绑定,形成三维空间认知。这种设计使得系统不仅能识别图像内容,更能理解拍摄视角的空间关系。当用户改变虚拟相机位置时,模型可生成符合物理规律的新画面,并对未观测区域进行合理补全。例如,仅提供机器人正面照片的情况下,系统能准确渲染其背面及周围环境。
在视频生成领域,Atlas展现出卓越的运镜控制能力。测试中,研究人员仅使用7张参考图像和人工设计的相机轨迹,便生成了长达1分钟、分辨率达1440p的连续视频。镜头在复杂场景中实现前进、旋转、转向等复杂动作,突破了传统模型依赖文字提示的局限。对比实验显示,在指定运镜任务中,94%的评审认为Atlas生成效果优于Seedance 2.5,81%认为其表现超过Gemini Omni Flash。不过需指出的是,其他模型因技术架构限制,需将相机轨迹转换为文字提示进行输入。
三维重建方面,Atlas通过渐进式学习机制显著提升重建精度。单张照片输入时,系统可构建基础空间模型,但周边环境依赖常识推断;随着多角度照片的补充,重建结果逐步逼近真实场景。实验表明,输入2-3张照片即可获得较高精度,系统最多支持超100张图片的空间上下文分析。更关键的是,模型能同步预测画面深度信息,生成点云数据并转换为3D高斯泼溅场景,这种格式可直接应用于游戏开发、影视特效等现有3D工作流程。
该模型在机器人仿真领域的应用尤为引人注目。研究人员利用3-5部普通手机拍摄的真实环境视频,通过Atlas重建虚拟空间后,可让不同形态的机器人在其中自由移动。系统不仅能生成机器人视角的RGB图像,还能提供精确的深度数据,实现真实到虚拟的完整映射。进一步测试显示,通过少量真实录像,Atlas能构建包含物体运动和交互的动态场景,支持改变光照、背景等参数生成多样化训练环境,大幅降低机器人仿真系统的构建成本。
技术架构层面,Atlas采用多模态自回归扩散Transformer设计,将文本、图像、相机位姿和深度图等信息统一编码为序列数据。生成过程中结合自回归预测与扩散模型去噪技术,既保证上下文连贯性,又提升视觉信息处理质量。这种架构设计使其能同时处理生成、重建和模拟任务,为建立统一的世界模型奠定基础。
尽管Atlas在技术突破上引发关注,但其商业化应用仍面临挑战。目前公布的机器人测试主要验证空间重建和基础交互能力,尚未披露碰撞检测、材料特性等复杂物理属性的模拟效果,也未提供真实世界策略迁移的成功率数据。模型参数规模、训练数据量等关键信息尚未公开,当前性能数据均来自研发方内部测试,需等待独立第三方验证。
行业观察指出,Atlas标志着世界模型技术从画面生成向空间建模的重要转型。传统生成模型聚焦像素级预测,而新系统开始探索“相机移动后所见”和“物体运动后结果”等空间推理问题。这种转变虽未完全解决物理模拟的真实性难题,但为建立更接近现实世界的数字模型指明了技术路径。随着早期测试的推进,该模型在影视制作、游戏开发和机器人训练等领域的潜力将持续释放。