在AI算力领域,传统叙事往往聚焦于巨头公司动辄数十亿美元的数据中心投入,但后摩智能正以另一种路径改写行业规则。这家成立六年的芯片企业,通过存算一体技术将千亿参数大模型装进巴掌大小的终端设备,让AI算力从云端向边缘端迁移成为可能。
2026年深圳华强北电子市场出现的铝合金盒子,成为这场技术革命的具象化产物。这个仅10瓦功耗的设备搭载后摩智能自研芯片,可运行千亿参数大模型,直接催生出联想AI主机P7、长城N90Pro AI PC等全新硬件品类。这些被统称为Agent Computer的设备,标志着AI硬件进入专为神经网络设计的时代。
传统芯片架构的局限性在大模型时代愈发凸显。英伟达GPU通过拓宽数据通道提升算力,但数据搬运产生的能耗仍占整体70%以上。后摩智能CEO吴强用"仓库与赛道"的比喻解释技术差异:存算一体将计算单元嵌入存储阵列,使数据原地完成运算,彻底消除数据搬运环节。这种架构在运行神经网络时,能效比达到传统GPU的3-5倍。
2020年创业时,中国半导体产业正经历国产替代热潮。尽管朋友建议吴强选择更容易获得融资的GPU赛道,但他判断存算一体技术更接近商业化落地。当时全球仅有两家初创企业探索大算力存算一体,国内市场几乎空白。这种技术路线选择,使后摩智能避开了与巨头的正面竞争,却在2023年大模型爆发时迎来转机。
2023年下半年,后摩智能完成首代产品与智谱GLM-6B模型的适配,验证了存算一体架构在大模型推理中的优势。次年启动的M50芯片项目,在2026年初实现量产。这款10瓦功耗、160TOPS算力的芯片,使终端设备运行千亿参数模型成为现实,直接推动客户订单超预期增长。
技术突破带来市场格局重塑。后摩智能的客户已从PC厂商扩展至运营商、机器人公司和新兴硬件企业。在陪伴机器人领域,本地化部署方案解决了云端方案的隐私顾虑和成本问题。吴强透露,某高端机器人品牌通过内置存算一体芯片,实现了表情识别等实时交互功能,这类应用在云端方案下难以实现商业化。
存算一体与GPU/NPU的竞争本质是效率之争。吴强强调,两种技术路线并非替代关系,而是形成互补生态:GPU擅长通用计算和训练任务,存算一体则在端侧推理场景展现优势。特别是在需要持续运行的AI应用中,端侧方案将推理成本从按量付费转变为一次性硬件投入,这种模式正在改变AI商业逻辑。
国际市场成为新的增长极。吴强观察到,海外客户对本地化AI解决方案的需求日益强烈,特别是在网络基础设施薄弱的地区。中国开源模型与存算一体芯片的组合,通过性价比优势开辟出"Token出口"新路径。某海外客户评价,这种不依赖网络的智能设备,在隐私保护和实时性方面具有独特价值。
技术迭代压力始终存在。后摩智能正研发支持多模态大模型的下一代芯片,算力目标直指当前旗舰产品的5倍。吴强坦言,半导体行业的头部效应意味着竞争窗口期有限,未来五年需要持续突破能效比极限。他特别警惕来自初创企业的颠覆性技术,认为真正的威胁往往来自被忽视的创新路径。
这场算力革命的终极目标,是让每个家庭都拥有AI超节点。当终端设备成本降至临界点,配合杀手级应用出现,分布式AI网络将彻底改变人机交互方式。吴强描绘的场景中,家用超节点将成为智能设备的中心枢纽,这种愿景正在推动存算一体技术向更广阔的消费市场渗透。
