ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

国产GPU新突破:摩尔线程MTT S5000智算卡完成2.8万亿参数Kimi K3模型适配

时间:2026-07-29 15:41:30来源:互联网编辑:快讯

月之暗面近日宣布,正式开源其拥有2.8万亿参数的大规模语言模型Kimi K3,并同步发布模型权重与技术报告。作为全球首个开源的3万亿级别模型,Kimi K3在架构设计上突破传统Transformer框架,采用KDA混合线性注意力机制与注意力残差技术,结合Gated MLA与Stable Latent MoE等创新架构,实现了原生视觉理解能力与100万token的超长上下文窗口支持。

该模型的核心架构由69层KDA注意力模块与24层Gated MLA模块构成混合主干,通过Stable Latent MoE机制部署896个专家网络,每个token动态激活16个专家,显著提升模型容量与计算效率。这种设计在保持高性能的同时,对底层硬件的算力调度与内存管理提出了全新挑战。

摩尔线程在模型开源当日即宣布完成对Kimi K3的Day-0支持,其基于第四代“平湖”架构的AI训推一体智算卡MTT S5000发挥了关键作用。该卡单卡稠密算力达1000TFLOPS,配备80GB显存与1.6TB/s带宽,卡间互联带宽784GB/s,支持从FP8到FP64的全精度计算,为模型运行提供了硬件基础。

针对KDA注意力机制的创新特性,摩尔线程研发团队重构了计算链路:在Prefill阶段优化矩阵乘法顺序,在Decode阶段实现状态缓存的动态管理,并通过Triton MUSA框架确保计算正确性。其SGLang-MUSA中间件专门适配了Hybrid State Pool技术,有效处理递归状态与卷积状态的联合管理,覆盖Prefix Cache、分块Prefill等复杂场景。

面对Stable Latent MoE的896专家规模,摩尔线程通过DeepEP引擎实现了token分发、结果合并与跨卡通信的协同优化。MUSA软件栈整合MCCL通信库、DeepEP专家调度与MTSHMEM共享内存技术,构建起张量并行、专家并行与低延迟通信的三维并行体系。针对官方提供的MXFP4量化权重,团队开发了在线逐层量化方案,省去传统离线转换流程,将推理启动时间缩短60%以上。

技术报告显示,Kimi K3在长文本理解、多模态生成等任务中表现优异,其混合注意力架构在处理超长序列时,内存占用较传统模型降低42%,推理速度提升1.8倍。摩尔线程的适配工作不仅验证了MTT S5000的架构优势,也为国产AI芯片支持前沿模型提供了重要实践案例。

更多热门内容