ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

Meta推出Muse Voice Transcribe模型:实时转写支持20余人分轨,70余种语言覆盖

时间:2026-09-02 09:56:31来源:互联网编辑:快讯

meta公司近日正式发布了其首个实时音频感知模型——Muse Voice Transcribe,为语音转写领域带来了突破性进展。该模型通过整合流式自动语音识别、说话人分离和端点检测技术,实现了用户说话时文字的同步输出,无需等待录音结束后再处理。

在功能设计上,Muse Voice Transcribe展现了强大的多场景适应能力。它能够从包含20余名说话者的录音中精准分离不同发言者,并通过端点检测技术自动识别说话结束的边界,为会议记录、访谈整理等场景提供了高效解决方案。模型支持超过1小时的长音频处理,并允许在句内或句间自然切换语言,目前已覆盖70余种语言,其中25种在发布时已完成验证。

技术层面,meta创新性地引入了自适应延迟机制。该系统不会对所有词语采用统一的识别速度,而是根据语音清晰度动态调整决策策略:对于简单词汇快速输出结果,对发音模糊、专业术语或复杂语境的词汇则调用更多前后文信息进行分析。这种设计在保持实时响应的同时,显著提升了复杂场景下的识别准确率。

开发者可通过meta Model API调用这项服务,定价为每1000分钟音频3美元(约合人民币20.2元),折合每小时0.18美元(约合人民币1.2元)。在第三方评测中,该模型已登顶Artificial Analysis流式语音转文本排行榜首位,其性能表现获得行业认可。

针对特定使用场景,开发者还可通过语言偏好、关键词优化和上下文提示等功能,进一步提升模型在专业术语或特定场景下的识别效果。这一特性使其在医疗、法律、科研等对术语准确性要求较高的领域具有广泛应用潜力。

更多热门内容
李彦宏十年磨一剑:从芯片到全栈AI,百度增长飞轮加速自转
十年前他选了一条最重的路,从芯片起手逐层往上搭,用十年造出一个能循环内化的增长飞轮。在当时的行业环境下,从芯片开始做AI,意味着要承受长期的投入压力和市场质疑。 李彦宏的十年坚持,本质上是工程师气质在AI…

2026-09-02