小米集团AI实验室新一代Kaldi团队近日宣布,推出两款基于Flow Matching架构的语音合成模型——ZipVoice与ZipVoice-Dialog,分别针对单说话人语音合成和对话场景语音合成需求进行优化。
据技术团队介绍,ZipVoice作为零样本单说话人语音合成模型,通过创新架构设计显著降低了模型参数量,同时将语音合成速度提升至行业领先水平。该模型突破了传统零样本语音合成中“参数量大、效率低”的技术瓶颈,在保持合成音质自然度的前提下,实现了更轻量化的模型部署。
针对对话场景的特殊需求,团队同步推出ZipVoice-Dialog模型。该模型通过优化算法结构,有效解决了对话语音合成中常见的稳定性问题,同时将推理速度提升30%以上。在多轮对话测试中,模型展现出更强的上下文适应能力,能够保持音色一致性并减少语音断层现象。
研发团队透露,两款模型均采用非自回归生成框架,通过流匹配(Flow Matching)技术实现语音特征的渐进式生成。这种设计既保证了合成语音的流畅性,又大幅减少了计算资源消耗。目前,相关技术已应用于小米智能设备的语音交互系统,后续将逐步开放给开发者社区。
