随着智能体(Agent)技术进入爆发期,全球科技产业正面临一场关于AI计算体系的深度变革。从海外SaaS巨头Salesforce推出的“即用型”长周期智能体,到国内办公、生活场景中智能体的广泛应用,用户享受着“一句话完成复杂任务”的便利,但产业界却不得不直面一个现实问题:支撑数亿级智能体运行的底层计算体系,正遭遇前所未有的挑战。
国际数据公司(IDC)最新发布的《日活智能体数(DAA)研究报告》显示,全球活跃智能体数量将从2025年的2860万个激增至2030年的22.16亿个。这种指数级增长背后,是芯片、存算、互连、系统、框架等环节构成的复杂计算网络。以全球最大开源模型Kimi K3为例,其发布48小时内因算力逼近极限被迫暂停新用户注册,暴露出当前计算体系在支撑智能体持续运行时的脆弱性。
计算体系的痛点正随着智能体能力进化而加剧。Gartner报告指出,单个智能体工作流每任务消耗的Token量是传统聊天机器人的5至30倍,高盛更预测到2030年全球Token消耗量将增长24倍。更严峻的是,万亿参数模型对计算体系提出多维挑战:Kimi K3模型总参数量达2.8T,需64张GPU卡才能承载其权重文件,单次前向计算产生的HBM带宽需求高达1.5TB,896个专家模型分布多卡时,每次前向传播触发超过120次卡间通信。这种数据搬运需求导致大量算力浪费在等待传输上,传统AI算力系统遭遇性能瓶颈。
芯片架构的局限性在智能体长周期运行场景中愈发明显。传统冯·诺依曼架构下存储与计算分离的设计,导致数据搬运消耗的功耗和时间占比高达90%。当智能体需要处理跨天、跨周的持续任务时,这种架构的“存储墙”“功耗墙”问题成为制约因素。清华大学副校长吴华强将在即将召开的人工智能计算大会上探讨存算一体技术,这种让计算在存储单元内完成的新架构,可能成为突破现有瓶颈的关键路径。
硬件路线的多元化加剧了系统整合难度。Chiplet、3D集成等新兴技术虽能扩展芯片能力边界,但不同技术路线导致的软件栈分裂问题日益突出。北京智源人工智能研究院推出的FlagOS项目,通过构建面向异构AI芯片的开源统一系统软件栈,已实现对18家厂商32款芯片的兼容支持。这种“一次开发,多芯运行”的模式,为解决硬件碎片化问题提供了新思路。
企业级应用对计算体系提出更高要求。网易有道LobsterAI的调研显示,办公智能体单次任务规模在5个月内增长3.1倍,用户开始将复杂长周期工作托付给智能体。但当前算力评价体系仍停留在算力规模和单点性能层面,缺乏对系统能力、计算效率和应用价值的综合评估。即将发布的《中国人工智能计算力发展评估报告》和AI测评体系,将首次建立覆盖“芯片—框架—模型—应用”的全链条评价标准。
这场计算体系变革正在催生新的产业生态。在即将召开的人工智能计算大会上,60场专题报告将聚焦智能体从单次调用向持续任务链演进过程中的技术突破。浪潮信息将展示如何通过系统架构创新提升算力利用率,百度智能云等企业将讨论国产AI底座标准建设,GPUStack等团队则聚焦推理供给的商业闭环构建。这些讨论指向一个共同目标:构建开放、多元、可验证的产业生态,支撑智能体技术的规模化落地。