ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

华为昇腾0天极速适配Kimi K3:国产算力赋能全球首款3万亿参数多模态大模型落地

时间:2026-07-28 10:26:02来源:互联网编辑:快讯

近日,科技领域迎来重要进展,日月之暗面公司正式开源其2.8万亿参数的Kimi K3大模型,华为昇腾随即宣布完成对该模型的0day极速全链路适配。这一合作标志着国产算力在万亿级稀疏MoE大模型领域实现关键突破,为行业提供了完整的落地解决方案。

Kimi K3作为全球首款开源的3万亿参数级多模态模型,采用Stable LatentMoE架构,内置896个专家模块,但单次推理仅激活16个,有效平衡了模型规模与计算效率。该模型搭载KDA混合线性注意力机制,支持100万token的超长上下文处理,KV Cache压缩率达75%,长文本解码速度提升6.3倍。其原生具备的视觉理解能力,使其在长周期编程、深度文献分析和复杂工程设计等任务中表现突出,扩展效率较前代提升2.5倍。

针对Kimi K3的落地挑战,昇腾团队开展了系统性优化。模型训练面临三大难题:KDA算子计算密度不足、海量专家导致的负载失衡,以及2.8万亿参数带来的显存压力。为此,昇腾在训练端依托MindSpeed MM套件,在Atlas 800 A3和Atlas 900 A3 SuperPoD硬件上完成全流程训练复现。通过FSDP+EP混合并行策略,拆分专家参数以解决多卡显存溢出问题;自研GEMM分组矩阵算子则批量处理海量专家计算,提升计算效率。

在训练优化方面,昇腾基于Triton Ascend编译框架加速线性注意力计算,采用ChunkLoss分块损失计算技术大幅降低显存峰值。同时,提供一键式环境部署脚本,显著降低超大模型训练的技术门槛,使更多开发者能够参与其中。

推理环节的优化同样关键。昇腾950超节点全系列精度原生支持Kimi K3 MXFP4量化权重,结合vLLM Ascend和SGLang两大开源引擎进行深度优化。针对KDA特性设计Prefill、Decode双融合算子,通过MC2流水线打通专家路由、跨卡通信和计算回收全流程。支持逐Token动态MXFP8量化和FlashComm1通信优化,进一步降低推理延迟。SGLang引擎新增DSpark投机推理功能,将单步生成时延压缩至50毫秒以内,同时保持原有调度与接口体系,确保业务代码无需修改即可平滑迁移。

此次合作完整覆盖了模型训练复现与线上推理部署的全链路,依托Atlas系列算力硬件、MindSpeed MM训练套件,以及vLLM Ascend与SGLang推理引擎,为万亿级稀疏MoE大模型构建了国产算力落地的标准化范式,推动人工智能技术在更多复杂场景中的应用。

更多热门内容
中巴航天合作迈新步!约90天后巴基斯坦航天员或乘神舟二十四号进天宫
早在 2026 年 2 月,巴基斯坦国家广播电台就援引该国太空与高层大气研究委员会的消息称,两名候选人将接受约 6个月的高级训练,其中一人计划在 2026 年 10 月或 11 月执行中国空间站飞行任务。…

2026-07-28