工业机器人领域正迎来一场策略革新——一种被称为“反骨”的新型世界模型,正在打破传统训练与部署的固有模式。与传统模型全程参与机器人决策不同,这种名为Phi-WM 1.0 ActEffect的技术选择在训练阶段介入,却在执行阶段悄然退场,却意外提升了机器人的实际作业能力。
传统世界模型如同机器人的“思维沙盘”,通过预测未来场景指导动作规划。但这种模式存在天然缺陷:推理链路越长,时延与算力消耗越高,尤其在工业场景中,每增加一步模型推理都可能转化为真金白银的成本。ActEffect的突破性在于,它将世界模型的功能压缩在训练阶段,通过让机器人“预演”不同动作的后果,将经验转化为策略优化的养分,最终实现执行阶段的轻量化部署。
该技术的核心创新体现在三个层面。首先,策略网络会生成三版动作提案:基于直觉的前馈反应、粗略规划的中间提案,以及经过精修的最终动作。这种设计突破了传统扩散模型依赖中间噪声状态的局限,确保每个提案都是完整可执行的独立方案。其次,受控世界模型扮演“裁判”角色,它不接收语言指令,仅根据当前视觉状态与动作提案预测场景变化,将物理规律作为唯一评判标准。这种“去语义化”设计使模型更专注于动作引发的实质影响,而非任务描述的表面含义。最后,通过梯度截断的排序损失函数,模型强制要求精修动作比中间提案更接近真实结果,中间提案又优于初始反应,形成闭环优化链条。
在仿真测试中,这种训练范式展现出显著优势。面对标准桌面操作基准LIBERO,ActEffect以98.8%的成功率微弱领先传统方法,但其真正价值体现在复杂场景中:在加入七类干扰因素的LIBERO-PLUS测试中,其成功率达到80.3%,较对比方法提升近30个百分点;面对29维动作空间的人形机器人任务时,67.5%的成功率超出次优方案10个百分点以上。消融实验进一步证实,去除后果反馈机制或替换视觉特征空间,都会导致性能明显下降,验证了技术路径的有效性。
这种设计哲学与工业部署需求深度契合。在汽车制造场景中,机器人需要应对焊接上下料、曲面质检等高精度任务,传统自动化设备往往因工位固定而缺乏灵活性。具身智能的引入旨在解决这种适应性难题,但模型推理带来的额外成本始终是规模化应用的障碍。ActEffect通过将世界模型“留在训练场”,成功消除了执行阶段的在线计算开销。以某头部车企的焊接产线为例,搭载该技术的Phi-Bot X1机器人实现连续21.5小时零故障运行,验证了技术落地的可行性。
背后的研发团队具有鲜明的跨界特征。由清华大学车辆与运载学院、人工智能学院联合孵化的光象科技,其核心成员既包含长期从事自动驾驶研究的学术专家,也有具备汽车量产经验的产业人士。这种组合使团队在开发算法的同时,同步构建机器人本体、数据平台与部署工具链。创始人张涛指出,工业场景对系统可靠性的要求远超学术测试,硬件的持续运行能力、故障的快速响应机制,以及跨工位的策略迁移效率,都是决定技术能否落地的关键因素。
当前,具身智能领域正从技术演示向工程落地转型。客户关注的焦点已从单次任务成功率,扩展到长期运行的稳定性、跨场景的迁移能力,以及整体解决方案的经济性。ActEffect通过创新世界模型的应用方式,在保证作业质量的同时降低了部署成本,为工业机器人规模化应用提供了新思路。不过,这项技术仍需在更多真实产线中接受考验,其能否在复杂多变的工业环境中持续保持优势,将决定这种“反骨”设计能否真正改写行业规则。