小米MiMo大模型团队近日宣布,其最新版本MiMo-V2.6已进入强化学习研发的关键阶段。自今年4月开源MiMo-v2.5以来,该团队持续投入资源探索强化学习技术的边界,目前已在模型能力扩展方面取得突破性进展。
据项目负责人罗福莉透露,MiMo-V2.6通过三项核心升级显著提升了系统性能:在计算架构层面,模型采用完全异步处理机制,每步可处理约20亿个Token,支持1,568个Prompt同步运行并生成16条Rollout;环境适配方面,开发团队构建了多任务智能体强化学习框架,实现单一运行周期内混合调度多个技术栈;评分系统创新性地引入Grader Compute模块,通过增加算力投入优化评分过程,配合Agentic In-group Credit Assignment机制,构建了包含测试案例与评分标准的动态奖励体系。
值得关注的是,该团队已公开模型训练的实时监控链接。直播页面数据显示,MiMo-V2.6的研发成本已突破125万美元(按当前汇率折合约840.3万元人民币),这从侧面印证了小米在人工智能领域的技术投入力度。项目负责人表示,相关技术细节将在未来数周内通过开源社区逐步释放,供全球开发者共同研究。
此次升级标志着小米在通用人工智能领域迈出重要一步。通过强化学习技术的深度应用,MiMo-V2.6有望在多任务处理、环境适应等复杂场景中展现更强性能。技术文档显示,新版本特别优化了异构计算资源的调度效率,其架构设计可支持从边缘设备到数据中心的多层级部署。
目前,MiMo-V2.6的训练进度已进入最终调试阶段。开发团队透露,除已公布的三项核心升级外,模型还在长序列推理、动态环境感知等维度进行了针对性优化。随着开源计划的推进,全球开发者将有机会深入解析小米在强化学习领域的技术积累与创新实践。