ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

阶跃StepAudio 3系列发布:五款模型齐发,多场景能力登顶全球权威榜单

时间:2026-09-15 20:51:44来源:互联网编辑:快讯

阶跃公司近日正式推出新一代语音大模型StepAudio 3系列,包含五款针对不同场景的专用模型:StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music。该系列模型在语音交互、识别、生成及创作领域实现全面突破,多项技术指标位居全球领先水平,标志着语音大模型从单一功能向全栈能力的跨越式发展。

在实时语音交互领域,StepAudio 3 Realtime通过原生全双工对话技术重新定义交互标准。该模型可智能判断对话节奏,在连续交流中自主选择回应时机,支持实时打断与动态反馈。在权威评测机构Artificial Analysis的Conversational Dynamics榜单中,该模型以98.9%的综合得分登顶全球榜首。更值得关注的是,其突破性地将语音推理与任务执行能力融入实时交互,通过并行处理语义理解、情绪感知和环境音分析,实现工具调用与长任务的异步执行,确保对话流畅性不受后台任务影响。这一创新使其在Speech Reasoning评测中同样斩获全球第一。

语音识别模型StepAudio 3 ASR通过融合大语言模型的上下文理解能力,将识别精度提升至新高度。该模型不仅保持1.7%的超低词错误率(WER),更在专业术语、方言混说、长音频处理等复杂场景中展现卓越性能。针对低声输入、快速语流、含糊发音等挑战,模型通过多维度声学特征优化实现精准转写。在Artificial Analysis非流式语音识别评测中,其与另一国际顶尖模型并列全球首位,标志着中文语音识别技术进入国际第一梯队。

语音生成领域迎来双重革新:StepAudio 3 TTS突破传统合成语音的机械感,通过流式生成架构实现边生成边播放的实时效果。该模型可精准复现笑声、迟疑、改口等副语言特征,在音色、语调、节奏控制外,更赋予语音丰富的情感层次。而StepAudio 3 Gen则开创性地将人声、音效、环境音和背景音乐生成整合为统一流程,用户通过自然语言描述即可生成包含多声音元素的完整音频作品,并可精细调控各元素的出现时序与情感表达,为影视、游戏、广播剧等内容制作提供高效工具。

音乐创作模型StepAudio 3 Music重新定义AI音乐生产范式。该模型突破"一句话生成"的简单模式,支持从歌词创作、清唱配乐到歌曲翻唱的全流程协作。通过ABC记谱法交互和多轮迭代优化,用户可基于清唱片段、参考歌曲或文字描述与模型共同完善作品,实现编曲、混音等深度参与。这种协作模式使AI真正融入专业音乐制作流程,而非仅作为辅助工具存在。

随着StepAudio 3系列的发布,阶跃构建起覆盖语音交互全链条的产品矩阵。从实时对话到精准识别,从情感化语音生成到多模态音频创作,该系列模型通过技术融合打破功能边界,形成"听-说-理解-推理-创作"的完整闭环。目前,五款模型均已在阶跃星辰开放平台上线,为开发者提供多样化的技术解决方案。

更多热门内容