ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

蚂蚁开源Ming-Flash-Omni 2.0:全模态大模型多项能力领先,赋能多场景应用

时间:2026-02-12 05:52:16来源:快讯编辑:快讯

蚂蚁集团近日宣布开源其最新研发的全模态大模型 Ming-Flash-Omni 2.0,该模型在视觉语言理解、语音可控生成及图像编辑等多个领域展现出卓越性能,部分指标甚至超越了国际顶尖的 Gemini 2.5 Pro,为开源社区树立了新的性能标杆。

作为业界首个全场景音频统一生成模型,Ming-Flash-Omni 2.0 突破了传统模型的局限,能够在同一条音轨中同时生成语音、环境音效与音乐,实现了音频生成领域的重大创新。用户只需通过自然语言指令,即可对音色、语速、语调、音量、情绪及方言等参数进行精细调控,满足多样化的音频创作需求。该模型在推理阶段达到了 3.1Hz 的极低帧率,支持分钟级长音频的实时高保真生成,在推理效率与成本控制方面均处于行业领先地位。

多模态大模型的发展趋势是走向更统一的架构,以实现不同模态与任务之间的深层协同。然而,现有的“全模态”模型往往难以兼顾通用性与专精性,在特定单项能力上,开源模型通常不及专用模型。蚂蚁集团在全模态领域深耕多年,Ming-Omni 系列模型在此背景下持续迭代升级。早期版本构建了统一的多模态能力基础,中期版本验证了规模增长对能力提升的作用,而最新发布的 2.0 版本则通过更大规模的数据与系统性训练优化,将全模态理解与生成能力提升至开源领先水平,并在部分领域超越了顶级专用模型。

Ming-Flash-Omni 2.0 的开源,意味着其核心能力将以“可复用底座”的形式向外界开放,为端到端多模态应用开发提供统一的能力入口。这一举措将显著降低开发者在多模型串联方面的复杂度与成本,推动全模态技术的广泛应用。

该模型基于 Ling-2.0 架构(MoE,100B-A6B)进行训练,围绕“看得更准、听得更细、生成更稳”三大目标进行了全面优化。在视觉方面,通过融合亿级细粒度数据与难例训练策略,模型显著提升了对近缘动植物、工艺细节及稀有文物等复杂对象的识别能力;在音频方面,实现了语音、音效、音乐的同轨生成,支持自然语言对音色、语速、情绪等参数的精细控制,并具备零样本音色克隆与定制能力;在图像方面,增强了复杂编辑的稳定性,支持光影调整、场景替换、人物姿态优化及一键修图等功能,即使在动态场景中也能保持画面连贯与细节真实。

百灵模型负责人周俊指出,全模态技术的核心在于通过统一架构实现多模态能力的深度融合与高效调用。开源后,开发者可以基于同一套框架复用视觉、语音与生成能力,从而大幅降低开发成本与复杂度。目前,Ming-Flash-Omni 2.0 的模型权重与推理代码已在 Hugging Face 等开源社区发布,用户也可通过蚂蚁百灵官方平台 Ling Studio 在线体验与调用该模型。

更多热门内容
情感陪伴新选择!优必选全球首款全尺寸超仿生人形机器人开启预售
6月2日,“人形机器人第一股”优必选旗下品牌宣布全球首款全尺寸超仿生人形机器人启动预售。据官方介绍,优世界全尺寸超仿生人形机器人为情感陪伴而生,将于6月30日正式发布。 而就在十多天前,因在今年春晚上制作…

2026-06-05

RCAP亚太机器人世界杯北京中心揭牌 助力中国机器人产业链接全球
IT之家 6 月 4 日消息,据北京发布官方公众号今日分享,RCAP 亚太机器人世界杯北京中心在朝阳区中关村(朝阳)AI Space 产业园已于6 月 2 日正式揭牌。 据介绍,作为 RCAP 全球首个区域…

2026-06-05

2026企业级大模型API网关怎么选?适配场景与核心需求是关键决策点
4SAPI,聚焦生产级多模型调度与全链路调用治理,在协议原生兼容、审计粒度及故障自愈设计上表现扎实,是企业将大模型纳入核心业务总线的可靠基座,是企业级首选。 如果团队技术基因偏向开源自主,需要在自有服务器上部…

2026-06-05

华为数据存储发力医疗智能化:四大方案助力,3900余家机构升级转型
AI 数据湖解决方案 方案采用 OceanStor Pacific 全闪分布式存储,以业界领先的高容量密度,实现最优 TCO存储海量数据;通过 DME Omni-Dataverse 统一数据空间,实现跨院…

2026-06-05