在近期举办的GTC2026技术峰会上,月之暗面公司CEO杨植麟以"How We Scaled Kimi K2.5"为主题发表演讲,系统阐述了开源大模型突破现有技术框架的创新路径。这家中国AI企业通过重构Transformer架构的三大核心组件,在优化器、注意力机制和残差连接领域提出全新解决方案,为行业应对数据瓶颈和算力挑战提供了新思路。
面对高质量训练数据日益稀缺的行业困境,研发团队推出基于Muon优化器的MuonClip训练框架。该技术通过参数更新时的信息解耦设计,使模型在相同数据量下获得接近翻倍的训练效果。实验数据显示,在处理50万亿Token时,该方案可将模型能力上限提升40%以上。为解决万亿参数模型训练中的数值失控问题,团队开发的QK-Clip机制通过动态调整注意力矩阵数值,成功实现15万亿Token训练零故障的突破,这项创新被杨植麟称为"数据效率的革命性提升"。
在长上下文处理领域,Kimi Linear架构通过混合注意力机制实现计算效率的质变。其核心的KDA(Kimi Delta Attention)技术将传统单一衰减系数拆分为多通道控制,使模型能够智能区分需要长期记忆的关键信息与可快速更新的临时数据。这种3:1比例混合全注意力与线性注意力的设计,在百万Token级上下文场景中展现出显著优势,相关测试表明其推理效率较传统架构提升3倍以上。目前该技术已支持单任务1500个执行步骤的复杂推理。
针对多智能体协作场景,Agent Swarm架构构建了类似企业组织的任务分配体系。主智能体负责目标拆解与资源调度,子智能体群组可并行执行搜索、分析、编码等专项任务。通过动态权重调整的奖励机制,该系统在文献综述撰写、多数据集分析等任务中实现百倍效率提升。最新发布的K2.6版本已支持300个智能体并行工作,较4月发布的K2.5版本扩容3倍。
在多模态融合领域,早期融合训练策略带来意外突破。通过将15万亿混合模态数据与文本基座联合训练,模型在视觉任务训练过程中自动提升了文本推理能力。更引人注目的是,基于纯文本监督微调的零视觉SFT方案,使模型在视觉问答等任务中达到行业领先水平。杨植麟解释称,这种双向能力迁移源于统一表征空间的形成,为跨模态任务如看图编程奠定了技术基础。
演讲最后披露的Attention Residue技术,对2015年提出的残差连接理论进行颠覆性改造。该技术通过引入注意力机制,使模型能够主动筛选历史计算层的关键信息,而非被动接收上层输出。分块设计的Block Attention Residual在控制计算成本的同时,在数学推理、代码生成等任务中带来24%的效率提升。这项发表于3月15日的研究成果,标志着深度网络信息传递机制进入全新阶段。
月之暗面此次开源的三项核心技术,分别针对数据利用、上下文处理和深度计算三大瓶颈。这种模块化创新策略不仅保持了技术体系的兼容性,更通过独立验证机制确保每个组件的有效性。行业分析师指出,在算力增长放缓的背景下,这种基础架构层面的突破可能引发新一轮技术竞赛,推动开源模型进入"精耕细作"的发展新阶段。