阶跃星辰近日正式推出新一代语音大模型StepAudio 3系列,一次性发布五款专业模型,覆盖实时交互、语音识别、语音生成及音乐创作等核心场景。该系列多款模型在权威评测机构Artificial Analysis的榜单中斩获全球第一,标志着语音技术从单一功能向全栈能力的跨越式发展。
StepAudio 3系列突破传统语音模型的能力边界,首次实现语音理解、实时推理、任务执行与音频创作的深度融合。模型不再局限于“听”与“说”的基础功能,而是能够感知声音背后的语义、情绪及环境信息,并参与完整的交互流程与内容生产。这一技术跃迁使AI语音应用从工具属性升级为创作伙伴。
针对实时交互场景,StepAudio 3 Realtime模型支持原生全双工对话,可智能判断回应时机、处理中断请求并维持上下文连贯性。在Artificial Analysis Conversational Dynamics评测中,该模型以98.9%的综合得分登顶全球榜首。其独创的并行推理架构允许模型同时处理语义理解、情绪分析与语音生成,工具调用与长任务执行则通过异步机制实现,确保对话流畅性不受影响。
语音识别领域,StepAudio 3 ASR模型将高精度转写与大语言模型的知识推理能力相结合,显著提升专业术语、方言及复杂语境的识别准确率。该模型支持中英混说、长音频及行业垂直场景,并针对低音量、快速语速、背景噪音等干扰因素进行优化。在非流式语音识别评测中,其1.7%的词错误率(WER)创下新低,与另一国际顶尖模型并列全球第一。
语音生成方面,StepAudio 3 TTS模型通过流式架构实现生成与播放同步,可精准还原笑声、迟疑等副语言特征,使机器语音更接近真人表达。而StepAudio 3 Gen模型则开创性地整合人声、音效与环境声生成,用户仅需自然语言描述即可一键生成包含多声音元素的完整音频,并自由调控角色音色、情绪及时序,为影视、游戏等行业提供高效创作工具。
音乐创作领域,StepAudio 3 Music模型突破“一句话生成歌曲”的局限,支持歌词创作、清唱配乐、歌曲翻唱及多轮交互编曲。用户可通过提供清唱片段、参考歌曲或ABC记谱法与模型协同创作,实现从旋律构思到作品迭代的完整流程。这一模式使AI真正融入专业音乐生产链条。
目前,StepAudio 3系列五款模型已全面上线阶跃星辰开放平台,开发者与企业用户可自由调用。此次发布标志着语音技术进入“全栈竞争”时代,从单一功能比拼转向理解、推理、创作等综合能力的系统化较量。阶跃星辰通过构建覆盖“听-说-理解-创作”的完整技术矩阵,重新定义了AI语音的应用边界。