千问大模型近日正式推出语音合成领域的全新力作——Qwen-Audio-3.0-TTS,该模型通过技术创新实现了语音合成能力的质的飞跃。此次发布的版本包含两个核心模块:面向实时交互场景的Flash版本,其首包响应延迟控制在300毫秒级别;以及专注高质量输出的Plus版本,可满足专业级语音生成需求。
在技术突破方面,新模型构建了多维度语音控制体系。通过引入细粒度标签系统,用户能够直接在文本中嵌入结构化指令,精准调节语气的轻重缓急、情绪的喜怒哀乐等微观特征。这种设计打破了传统语音合成中"一刀切"的调控模式,使语音输出更具情感表现力。
针对非专业用户的使用痛点,研发团队开发了Free-style自然语言指令系统。用户无需掌握声学专业术语或标注规范,只需用日常语言描述期望的语音特征,例如"用老年男性的声音,带着焦急的情绪,在嘈杂环境中快速讲述"等复合指令,系统即可自动解析并生成符合要求的语音。
多语言支持能力实现重大扩展,Plus版本现已覆盖16种主流语言及20种中国地方方言。在声学鲁棒性方面,模型通过引入复杂环境模拟训练,显著提升了在背景噪音、口音偏差、语速变化等实际场景下的合成质量,确保语音清晰可辨且自然流畅。
该模型的推出标志着语音合成技术从"机械发声"向"智能表达"的转型。通过将专业声学参数转化为直观的可操作维度,既降低了技术使用门槛,又拓展了语音合成的应用边界,为有声内容制作、智能客服、无障碍交互等领域提供更强大的技术支撑。