世界模型领域正经历一场从学术探索向产业落地的关键转型。国际科技巨头与新兴企业纷纷加码布局:World Labs完成对机器人仿真公司SceniX的收购,英伟达推出绑定算力的Cosmos仿真平台,谷歌持续迭代Genie系列模型;国内Manifold AI自研的WorldScape模型登顶多项技术榜单,摩尔线程开源的MT Lambda仿真平台通过真机验证。在这场技术竞赛中,各参与方的技术路线差异逐渐显现,核心争议聚焦于模型究竟应聚焦于视觉效果生成,还是构建可交互的数字空间。
World Labs九月发布的多模态世界模型Atlas,为理解行业技术路径提供了典型案例。该模型与OpenAI的Sora虽同属生成式架构,但设计逻辑截然不同:Sora通过文字生成视频,追求像素连贯性与视觉真实感;而Atlas接收多角度照片后,直接输出点云、3D高斯泼溅等计算机可解析的几何数据,构建出机器人可直接操作的数字空间。这种差异体现在交付成果上——前者生成视频文件,后者提供包含精确空间坐标的3D场景,为机器人仿真训练奠定基础。
Atlas的技术突破首先体现在空间上下文理解机制。传统视觉模型处理二维像素阵列时,缺乏深度、尺度与遮挡关系信息;而Atlas为每张输入照片标注三维坐标,使模型能够识别拍摄视角与空间关联。例如,当输入同一房间的五张不同角度照片时,传统模型仅能识别独立平面图,Atlas则可还原完整三维结构。这种空间推理能力推动世界模型底层架构升级:视觉模块从像素压缩转向3D点云输出,记忆模块在三维空间中模拟时空变化,使机器人感知逻辑从"看到什么"转变为"从何处观察、与周围如何关联"。
在3D场景构建方面,Atlas显著降低了技术门槛。传统方法需专业设备拍摄数百张照片并耗时建模,而Atlas仅需2至25张普通照片即可生成完整场景。实验显示,输入三张不同角度的办公桌照片后,模型逐步完善场景细节:首张照片生成包含准确办公桌但错误椅子的全景图,第二张修正椅子位置但遗漏显示器,第三张最终完成全场景对齐。斯坦福大学主方庭的重建案例进一步证明,仅凭地面拍摄的手机照片,Atlas就能生成校园高空俯瞰的连续飞行画面。
时空模拟能力是Atlas的另一技术亮点。其相机可控生成功能允许用户设计运动轨迹,模型沿坐标渲染最高1440p分辨率、时长1分钟的视频。第三方盲测中,Atlas在复杂运镜场景下的胜率显著高于文本提示控制的对比模型。更关键的是,该模型支持时间冻结与多视角回看:通过同步录制的多段手机视频,Atlas可实现单帧多角度观察,传统方法需数十台同步摄像机才能达到同等效果。这种能力使机器人训练数据采集从物理世界转向数字空间——真实场景拍摄一次后,模型可生成上千种变体,通过调整路线、障碍物与光照条件,无需重复搭建场地。
尽管Atlas在几何重建领域取得突破,但其物理属性模拟仍存在局限。当前模型输出的传感器数据仅包含RGB图像与深度图,缺乏碰撞检测、刚体动力学参数等物理信息,需依赖MuJoCo等外部引擎完成物理演算。这种架构限制源于其损失函数设计——优化目标为画面保真度而非物理准确性,导致模型擅长视觉"填空"却无法推算物体受力响应。例如,模型可推断未拍摄区域的几何结构,但无法计算物体受推力后的运动轨迹。
为突破物理仿真瓶颈,World Labs通过收购SceniX推进技术整合。SceniX的核心技术在于为数字资产注入物理属性,其团队正将机器人学习经验与World Labs的空间建模能力结合,构建Real-to-Sim-to-Real闭环工作流。演示案例中,RB-Y1机械臂与YAM机械臂在仿真环境中完成线缆操作与可变形物体操控任务,策略直接迁移至真实机器人后实现自主运行一小时无干预。这套流程验证了从几何重建到物理模拟的技术可行性,但完整管道的打通仍需解决关键挑战:线缆阻尼、布料编织方式等物理参数,最终需通过真实交互标定完成。