ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

Meta推出语音转写新模型:多语言无缝切换,超20人畅聊1小时精准识别

时间:2026-09-02 15:31:35来源:互联网编辑:快讯

meta超级智能实验室近日发布了一款名为Muse Voice Transcribe的实时音频感知模型,该模型在语音识别领域实现了多项突破性功能。其核心能力包括实时流式自动语音识别、支持超过20位说话人同时发声的语音分割技术,以及端到端的语音控制功能。模型经过多语言训练,可处理超过一小时的长音频输入,并能在中英文混合表达等复杂场景中保持高准确率。

在技术实现方面,该模型采用自回归多模态架构,以80毫秒为处理单元将音频转换为软标记。通过动态决策机制,模型能够自主选择继续监听后续音频或输出文本标记。当检测到音频流终止时,系统会插入特殊标记触发剩余文本的完整输出。这种设计使模型在准确率与延迟之间取得平衡,其自适应延迟功能通过强化学习算法,根据单词复杂度动态调整处理节奏,在速度与精度权衡中达到最优状态。

针对多说话人场景,研发团队引入特殊标记系统实现语音分割。通过"发言轮次开始"标记预判说话人切换,配合"说话人A-Z"标签实现身份区分。即使同一说话人出现语音间断,系统仍能保持标签一致性。在语音端点检测方面,模型使用"语音起始"和"语音结束"标记精准定位有效语音段,两项功能均通过流式ASR框架联合训练,在基础奖励机制上叠加专项优化信号。

该模型支持70余种语言训练,其中25种语言经过完整验证。在跨语言处理方面,模型展现出强大的语境适应能力,能够无缝识别句子内部或句子间的语码转换现象。测试数据显示,在包含中式英语口音、中英混合表达等复杂场景中,模型仍能保持高效准确的转写表现。在Artificial Analysis流式语音转文本基准测试中,该模型超越同类产品位居榜首。

开发者可通过三种方式调用该模型:meta Model API接口、Mac版meta AI应用,以及Muse Code开发环境。商业定价体系显示,每千分钟使用费用为3美元(约合人民币20元),折合每小时0.18美元(约合人民币1.21元)。模型与各类应用程序具有良好兼容性,用户通过按住"Fn"键即可激活语音听写功能,实现与屏幕窗口的实时交互。

这项技术突破标志着语音识别系统向持续在线感知层的演进。传统语音转文字工具正转型为具备语境理解能力的智能系统,未来竞争焦点将集中在低延迟处理、长上下文记忆、多说话人追踪等核心领域。随着与大型语言模型的深度融合,语音交互系统将具备更强的推理能力和工具调用功能,形成"听觉感知-身份识别-语境分析-行动决策"的完整闭环。

更多热门内容