在AI算力领域,一个名为“超节点”的技术概念正引发广泛关注。这项技术通过将多颗GPU服务器整合为超级计算机,正在重新定义算力系统的底层架构。从分布式计算到集中式融合,超节点的发展轨迹印证了计算领域“分久必合”的规律,尤其在AI大模型从训练转向推理阶段后,其战略价值愈发凸显。
当前用户对算力供应商的考核标准已发生根本性转变。过去以GPU卡数为核心的采购逻辑,正被“每秒稳定输出有效Token数量”及“单位成本”等指标取代。这一变化源于大模型参数规模的指数级增长——DeepSeek R1模型参数达6710亿,Kimi K2.5更突破万亿级别,导致单次推理需要触发数十次跨卡通信。传统服务器集群的通信延迟和带宽限制,已无法满足MoE架构下专家路由、Token分发等高频交互需求。
行业专家指出,算力评估体系正经历代际变革。中科曙光高级副总裁李斌强调,系统持续输出有效算力的能力已成为核心指标。这种转变背后存在双重驱动:模型侧要求超大显存承载键值缓存,通信时延需控制在微秒级;应用侧随着智能体(Agent)兴起,单次请求可能触发百倍于传统模型的数据生成,对跨卡通信带宽形成巨大压力。技术供给端的突破为超节点落地创造条件,高速互连技术将通信域从8卡扩展至数十卡,使卡间通信延迟接近内存访问水平。
英伟达NVL72架构的实测数据印证了这种效率跃升。在DeepSeek R1推理测试中,72卡全互连架构使单卡吞吐量达到HGX B200的4.4倍,峰值性能差异源于后者8卡互连域的限制。当专家并行度超过8时,B200不得不依赖低带宽以太网通信,导致性能断崖式下跌。这种对比揭示超节点的核心价值:通过系统架构优化压缩通信开销,而非单纯追求单卡性能提升。
尽管方向明确,超节点发展仍面临四大技术壁垒。通信墙突破需要实现64卡以上低延迟互连;存储墙要求分布式存储系统支持大规模并发访问;复杂度墙考验系统规模扩大后的故障隔离能力;功耗墙则推动液冷技术成为标配。中科曙光通过分层架构设计,在通信、存储、散热领域实现协同优化,其ParaStor存储系统多次登顶全球性能榜单。联想的“海神液冷”方案支持45℃温水直接冷却,将PUE值降至1.04,但为此需对生产线进行承重加固和十兆瓦级供电改造。
在系统规模设计上,行业存在显著分歧。NVIDIA研究显示,互连域规模超过特定阈值后,训练性能提升与复杂度增加呈现非线性关系。联想选择40卡单节点方案,认为该规模在通信效率与可靠性间取得平衡,可通过标准网络灵活扩展。曙光则采取双轨策略,既提供十万卡级超集群,也推出40卡箱式方案。专家警告,部分厂商将互连规模作为营销噱头,实则Token成本优化才是核心竞争力。
工程化落地成为超节点竞赛的关键战场。供应链管理首当其冲,高速线缆、MLCC电容等元器件供应紧张,需整机厂商牵头产业链协同扩产。国产AI芯片的产能约束同样影响超节点放量节奏,IDC数据显示2025年本土加速卡出货量约165万张,预计2027年才能突破600万张。
标准化缺失构成另一重挑战。各厂商互连协议和软件栈互不兼容,导致客户在模型迁移和运维中面临高额改造成本。浪潮信息通过OAM架构完成30余款加速芯片兼容适配,曙光推出分层解耦的AI计算开放架构,联想则在通用方案坚持开放路线、定制方案采用深度协同模式。这些探索旨在构建跨厂商生态,但真正的突破仍有待时日。
客户结构差异带来隐形门槛。头部互联网企业具备系统工程能力,可自主部署超节点;中小企业和科研机构则需要“开箱即用”的解决方案。联想SuperPod40和曙光scaleX40等产品的出现,标志着市场开始分层满足不同客户需求。在这场系统级竞争中,硬件参数已非决定性因素,开放生态的构建能力正在成为新的分水岭。