在世界人工智能大会的展台上,一组组黑色机柜吸引了众多参观者的目光,这些机柜上标注着“超节点”字样,成为大会上备受瞩目的焦点。观众们纷纷围绕在机柜旁拍照打卡,并向工作人员咨询相关技术参数。超节点这一概念,正随着人工智能行业的快速发展,逐渐从幕后走向台前。
传统上,人工智能领域的算力竞争主要聚焦于单颗芯片的性能提升。然而,随着AI大模型对计算需求的急剧增长,单张芯片已难以满足实际需求。行业开始转向通过堆叠多张芯片来提升整体算力,但这种方式也带来了新的问题——计算单元与通信单元之间的效率失衡。数据显示,在超高参数级别的大模型训练中,计算单元约40%的时间处于“空等”通信的状态,这严重制约了算力的有效利用。
超节点的出现,为解决这一问题提供了新的思路。它通过放大Scale-up(纵向堆叠)的范围,将更多芯片以高带宽、低时延的方式连接起来,形成一台协同高效的“超级计算机”。这种方式不仅提升了算力密度,还显著减少了通信延迟,使计算资源得到更充分的利用。例如,华为昇腾950超节点单柜可容纳64张AI芯片卡,整个系统支持1024张芯片卡高速互联,其极限配置甚至可达8192张卡,展现了超节点在算力规模上的巨大潜力。
超节点的兴起,标志着AI算力竞争正从“拼芯片”转向“拼系统”。除了芯片本身的性能,有效算力、散热、运维等系统级因素也成为厂商竞争的关键。以线缆为例,传统机柜通过铜缆、光纤等实现互联,但这些线缆可能带来性能损耗、运维复杂度高等问题。中兴通讯推出的Matrix超节点,通过正交无背板设计实现了零线缆互联,不仅降低了成本,还显著提升了运维效率。
在系统方案的突破上,算力集群也取得了新进展。中科曙光推出的十万卡AI超集群曙光8000,首次公开亮相便引发关注。该系统贯通了芯片、计算、存储、网络、散热等关键环节,以全链路协同满足大规模计算需求。特别是在散热方面,曙光8000采用浸没式液冷技术,将核心元部件浸没在不导电的特殊液体中,使能源利用率大幅提升。据工作人员介绍,该系统的PUE值可低至1.04,意味着计算过程中仅需极少量电力用于散热。
尽管超节点和超集群为算力提升提供了新方案,但它们仍无法彻底解决算力紧缺问题。香港城市大学计算机学院教授林静指出,当前AI尚未完全融入人类生活生产,若未来大规模应用,所需算力将极为庞大,地球资源能否支撑成为待解难题。她认为,解决算力紧缺可能需从三个方向探索:提升人工智能效能、发展新计算范式(如量子计算)、探索太空算力以减少对地球资源的依赖。
在太空算力领域,已有组织和企业开始布局。上海“星枢计划”太空算力星座正式发布,该项目由复旦大学联合上海星枢天算航天科技牵头研制运营,总规划1000颗天基算力卫星,旨在通过太空资源满足未来算力需求。与此同时,中国算力网也在稳步发展。鹏城实验室主任高文透露,中国算力网已完成第一阶段任务的70%,全国70%的算力资源已纳入统一数据库,为后续协同运算和面向社会开放奠定了基础。
从超节点到算力网,再到太空算力,不同领域的探索者正为解决算力紧缺问题贡献智慧。随着技术的不断进步,算力或许将不再是制约AI发展的瓶颈,而是成为推动行业创新的核心动力。