ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

小米开源CocktailASR-1大模型:破解“鸡尾酒会难题” 引领语音识别新变革

时间:2026-09-11 18:46:44来源:互联网编辑:快讯

在语音识别领域,长期存在一个棘手难题——当多人同时讲话时,传统自动语音识别(ASR)模型难以精准区分并识别特定说话人的声音,这一“鸡尾酒会难题”一直困扰着行业发展。不过,小米近日开源的工业级目标说话人语音识别大模型CocktailASR-1,为解决该问题带来了新的突破。

CocktailASR-1采用了创新的基于参考声纹的目标说话人识别机制,与传统语音识别任务输入方式截然不同。用户只需提供一段参考音频,模型就能借助声纹嵌入技术,在多人混合音频中精准定位目标说话人,仅转录该特定人物的语音内容,同时自动过滤掉其他人的说话内容、混响以及背景噪声,将复杂的混合音频识别任务转化为高效的目标说话人识别任务。

从底层架构设计来看,CocktailASR-1运用了端到端的大语言模型架构,由D2V2音频编码器、Adapter以及大模型解码器串联组成,所有权重整合在同一个检查点中。在实际应用时,输入格式是将参考音频与目标单声道音频进行拼接,中间插入一秒静音作为分隔。这种设计赋予了模型极高的通用性,无论是单人场景还是复杂的多元场景,都无需切换模型就能轻松应对。

多项基准测试数据充分证明了CocktailASR-1的强大实力。在模拟多说话人测试中,该模型在LibriMix2mix和LibriSpeechMix2mix数据集上的字错率(WER)分别低至4.11%和2.90%。与之相比,同赛道的多款知名模型在混合场景下的表现差强人意,例如在LibriMix3mix测试中,部分竞品的字错率高达76%到121%,而CocktailASR-1的字错率仅为12.29%,优势十分显著。在更具挑战的真实会议录制场景,如AMISDM和AliMeetingFar中,该模型同样大幅领先现有的各类解决方案。在单人场景下,它在LibriSpeech、WenetSpeech以及CommonVoice-zh等数据集上也实现了全面超越。

除了具备突破性的识别精度,CocktailASR-1在工程落地和实用性方面还有两大亮点功能。其一是强大的负样本拒识能力。当参考音频对应的人未参与当前对话时,模型能够直接输出空文本,有效避免智能音箱、车载语音助手等智能设备被旁人声音误触发。测试显示,该模型在多个数据集上的负样本拒识率表现优异。其二是支持思维链推理功能,模型在输出最终答案前,会通过特定标签展示判断说话人的推理过程,虽然对精度影响极小,但大大提升了系统的可解释性和调试便利性。

目前,CocktailASR-1的相关代码已在GitHub按照Apache2.0协议正式开源,其依赖环境极为简单,仅需torch、torchaudio、transformers和soundfile等基础库,就能轻松从HuggingFace加载并部署使用。小米此次在语音技术底层逻辑上的创新变革,意味着语音识别正从传统的“捕获所有声音”模式,迈向聚焦于“锁定一个声音”的新发展阶段。

更多热门内容
讯飞AI眼镜牵手蚂蚁灵影AOS,开启智能穿戴从工具到生活入口新篇章
作为一款轻量化全场景智能穿戴终端,讯飞AI眼镜核心优势源于软硬件的深度融合——超轻机身确保全天候佩戴无感,全场景翻译与智能提词等实用功能精准回应商务人士在跨国沟通、公开演讲中的高频需求,而多模态理解能力与G…

2026-09-11

高德扫街榜全面AI化:以真实行为为基,坚守不卖排名做好“活地图”初心
李刚表示,除区分用户身份,算法对到店行为的分辨也做得更细。其次,继续推进“扫街榜inside”的生态思路,把整套门店评价体系向外输出,除已合作的车机、智能眼镜,拓展至更多智能硬件终端,让用户在不同设备上都可…

2026-09-11

高德扫街榜AI升级:空间智能开启觅食新时代,宝藏好店轻松寻
ABot-Earth 0.7采用了一种高效的滑窗推理机制,在重叠区域进行智能融合,极大地消除了拼接痕迹,能生成近乎无缝的地球级场景。 高德通过世界模型能力,从有限实景照片等多模态输入生成高质量可漫游的3DG…

2026-09-11

国内首个智能体可信身份工作组成立 50余家机构共筑身份治理新生态
PChome 9月11日消息,在2026 Inclusion·外滩大会上,IIFAA智能体可信身份工作组正式成立。作为国内首个聚焦智能体可信身份领域的产业协作组织,工作组首批已吸纳50余家各类机构参与,标志着…

2026-09-11