ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

Meta推出Muse Voice Transcribe:实时转写支持超20人发言,70余种语言覆盖

时间:2026-09-02 13:03:36来源:快讯编辑:快讯

meta公司近日正式推出其首个实时音频感知模型——Muse Voice Transcribe,这一创新技术为语音转写领域带来了新的突破。开发者可通过meta Model API调用该模型,其定价为每1000分钟音频3美元(约合人民币20.2元),即每小时0.18美元(约合人民币1.2元),这一价格策略为开发者提供了高性价比的选择。

Muse Voice Transcribe的核心优势在于其流式自动语音识别能力,实现了边说边转写的功能。与传统的语音转写技术不同,该模型无需等待完整录音结束后再进行处理,而是能够实时、持续地输出文字结果。这种特性使得它在实时听写、会议记录、通话字幕等场景中具有显著优势,大大降低了延迟,提高了工作效率。

在技术实现上,Muse Voice Transcribe整合了说话人分离与端点检测功能。它能够在包含20余名说话者的录音中准确分离不同发言者,并识别说话的结束点,从而自动确定一段输入的边界。这一功能对于多人会议或访谈等场景尤为重要,能够确保转写结果的准确性和条理性。

该模型还具备强大的语言支持能力。其训练覆盖了70余种语言,其中25种语言在发布时已完成验证。无论是长音频还是短音频,无论是单一语言还是句内或句间的自然语言切换,Muse Voice Transcribe都能轻松应对。开发者还可以通过语言、关键词和上下文偏置来优化模型,提高特定语言、术语或场景下的识别效果。

为了兼顾实时响应和识别准确度,meta引入了自适应延迟的动态决策机制。该机制不会为所有词语采用固定的速度与准确度取舍,而是针对每个词判断需要额外接收多少音频后再输出识别结果。对于较容易识别的语音,系统会更快提交转写结果;而对于发音不清、术语较多或语境复杂的词语,系统则会调用更多前后文音频信息进行分析。这种机制确保了模型在各种场景下都能保持高效的性能。

根据Artificial Analysis的流式语音转文本排行榜显示,截至2026年9月1日,Muse Voice Transcribe位列榜首。这一成绩充分证明了该模型在语音转写领域的领先地位和卓越性能。随着技术的不断发展和完善,Muse Voice Transcribe有望为更多行业和场景带来便捷和高效的语音转写解决方案。

更多热门内容
Meta约七万员工转用Slack办公,适配AI智能体成核心迁移动因
【环球网科技综合报道】9月2日消息,据外媒BusinessInsider报道,Meta通过内部备忘录宣布,公司将把全体员工的内部通信工具,从Google Chat迁移至Salesforce旗下的Slack…

2026-09-02

阿里千问Qwen3.8-Max升级至0902版,前端编程夺冠且性价比优势显著
IT之家 9 月 2 日消息,阿里千问今日宣布 Qwen3.8-Max 模型升级到 0902 版本。官方围绕编程(Coding)和专业办公(Cowork),对 Qwen3.8-Max 进行了进一步的后训练,…

2026-09-02

马斯克预测:AI或推动全球经济增20%-30%,未来十年人形机器人将超10亿台
快科技9月2日消息,当地时间9月1日,马斯克在G20会议上表示,预计AI将使全球经济规模增加约20%至30%,相当于每年增加约20万亿至30万亿美元。 此外,马斯克预计到2027年底,AI将能够完成所有数字领…

2026-09-02