月之暗面Kimi近日在全球开源社区Hugging Face正式推出Kimi K3完整模型权重,同步公开的技术报告与三项核心基础设施技术引发行业关注。此次开源采用修改版MIT许可证,允许开发者自由下载、修改及本地部署,标志着开源大模型正式进入2.8万亿参数时代。
作为全球首个参数规模突破3万亿量级的开源模型,Kimi K3总参数达2.8万亿,激活参数1040亿,采用混合专家(MoE)架构设计。其创新性的自研Kimi Delta Attention(KDA)混合线性注意力机制与注意力残差技术,使模型原生支持视觉理解能力,上下文窗口扩展至100万Token。在896个路由专家中,每个Token仅激活16个专家,相比上一代Kimi K2整体扩展效率提升约2.5倍。
性能测试显示,Kimi K3在编程、智能体、推理与视觉等数十项基准测试中全面超越现有开源模型,甚至优于多数闭源模型。在Arena Intelligence的WebDev Arena榜单中,该模型以1679 Elo评分登顶,成为首个在该权威测试中夺冠的开源模型;在Artificial Analysis Intelligence Index v4.1评测中取得57.1分,位列全球第四,仅稍逊于Claude Fable 5和GPT-5.6 Sol等顶尖闭源模型。
技术报告特别强调了模型在算力优化领域的突破性进展。通过自主开发的MiniTriton紧凑型GPU编译器,Kimi K3实现了从Python前端到PTX代码生成的全链路自主优化,在NVIDIA L20芯片上的性能表现超越PyTorch eager、torch.compile及标准Triton实现。在GPU内核优化测试中,模型在24小时内独立完成四种代表性注意力内核的优化,其中AttnRes延迟降低59.6%,KDA运行时间缩减73.6%,MLA内核接近理论峰值算力,性能表现与Claude Fable 5持平。
值得关注的是,Kimi K3的部署能力已突破单一硬件生态限制。测试环境同时覆盖NVIDIA H200与其他供应商的GPGPU,显示其优化技术具备跨平台兼容性。在芯片设计领域,该模型通过48小时自主运行,基于开源EDA工具完成4平方毫米推理芯片原型设计,集成146万个标准单元和0.277MB SRAM,验证了AI从算法到硬件的全栈自主工程能力。
同步开源的三项基础设施技术构成完整技术生态:MoonEP高性能专家并行通信库实现超大规模MoE架构的完美负载均衡;FlashKDA算子在英伟达H20芯片上将预填充速度提升1.72至2.22倍;与KVCache.ai合作开发的AgentEnv智能体沙箱系统,通过支持快速快照与恢复功能,显著提升大规模Agent训练效率。月之暗面表示,此次开源将推动前沿智能技术的快速部署,为AGI研究提供关键基础设施支持。
