在近期举办的世界人工智能大会上,国产GPU企业摩尔线程公布了多项重大技术突破与合作成果。其自主研发的2360亿参数MoE模型已完成全流程训练,该模型基于25TB以上语料库,在国产万卡级GPU集群上实现了从零预训练到长窗口训练的完整流程,有效训练时长占比超过90%。这一成果标志着国产算力在超大规模模型训练领域取得关键进展。
公司高级副总裁董龙飞重点强调了"高精度迁移能力"的技术优势。通过对比实验显示,在DeepSeek类MoE模型训练中,其平台与国际主流GPU的前3万步训练平均相对误差控制在万分之六以内。在5000亿至5万亿参数规模的测试中,相同配置下训练所得模型在下游任务评测中得分与参考平台持平,部分指标甚至更优。这种跨平台结果对齐能力,有效解决了模型迁移训练中的精度损失难题。
在具身智能领域,摩尔线程与北京大学EvoPhys团队联合研发的5D世界模型EvoPhys-World取得突破性进展。该模型基于MTT S5000 GPU完成全栈原生训练,在WorldScore评测的"世界生成"维度连续37天位居榜首。这项成果实现了三个首次:国内科学家首次在中国算力设备上完成原创世界模型训练、首次构建全栈国产技术链、首次在5D空间维度实现物理世界模拟,为具身智能发展奠定重要基础。
北京智源研究院的RoboBrain 2.5具身大脑模型训练项目同样引人注目。依托摩尔线程千卡级智算集群和FlagOS-Robo框架,双方成功完成全流程训练验证。实验数据显示,国产算力集群在机器人大脑模型训练中展现出高效稳定性,首次从实践层面证明国产硬件完全具备支撑具身智能大模型训练的能力。
公司创始人张建中提出AI产业"三工厂"理论,将产业生态划分为模型训练、词元生产和智能体生产三大核心环节。区别于专用芯片路线,摩尔线程采用全功能GPU架构实现三大环节的统一支撑。在词元生产领域,其创新的PD分离异构推理方案将预填充计算与生成计算分离部署,通过MTT S5000与国际主流GPU的协同工作,使整体吞吐量提升近2倍,算力效率达到"3台S5000+2台国际主流GPU≈9台国际主流GPU"的突破性水平。
技术团队透露,异构方案的性能提升主要源于KV Cache调度优化。在OpenClaw等需要频繁调用系统工具的场景中,缓存命中率高达90%,相当于节省90%的重复计算资源。这种技术突破为大模型推理阶段的大规模部署提供了新的解决方案。
在生态建设方面,国产大模型与硬件的适配周期已发生根本性改变。过去需要数月完成的适配工作,现已实现"发布即适配"的零延迟对接。部分领先模型厂商更是在规划阶段就与摩尔线程展开联合研发,这种深度协作模式显著提升了技术落地的效率与质量。
面向具身智能的未来发展,张建中指出模型参数规模正呈现指数级增长趋势。早期VLA/VLM模型参数集中在50亿至140亿区间,主要部署于终端设备。当前世界模型路线直接处理物理世界数据,参数跨度大幅扩展,端侧需要10亿级参数模型实现实时控制,云端则需千亿级以上模型提供认知支持。摩尔线程正在自有万卡集群上开展万亿参数模型训练验证,但未披露具体时间表。
针对算力供应问题,董龙飞认为当前供需矛盾属于基础设施建设初期的正常现象。他以交通基建类比指出,中国GPU产业仍处于发展上升期,远未达到产能过剩阶段。随着技术迭代和生态完善,国产算力将在未来十年内形成完整的技术体系与产业竞争力。

