ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

阶跃星辰StepAudio 3系列语音大模型亮相,多领域表现卓越登顶全球榜单

时间:2026-09-15 17:47:52来源:互联网编辑:快讯

阶跃星辰近日正式推出StepAudio 3系列语音大模型,涵盖实时对话、语音识别、语音合成、音频生成及音乐创作五大核心场景。该系列包含StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型,其中多款产品在Artificial Analysis国际评测榜单中登顶全球榜首。

作为实时交互领域的突破性成果,StepAudio 3 Realtime实现了原生全双工对话能力。该模型在Conversational Dynamics评测中以98.9%的综合得分领先全球,在Speech Reasoning语音推理测试中更达到99.7%的准确率。其独特优势在于能同步解析语义、语气、情绪及环境声,支持推理计算与语音生成并行处理,工具调用与长任务执行采用异步模式,确保对话流畅性不受影响。

针对专业领域语音识别需求,StepAudio 3 ASR将高精度转录与上下文理解深度融合。该模型支持中英双语及方言混合识别,可处理长音频、专业术语及复杂声学环境下的输入,包括低语、快速连读、背景音乐干扰等场景。在医疗、法律、金融等垂直领域,其专业术语识别准确率显著提升。非流式语音识别测试中,该模型词错率(WER)低至1.7%,与另一国际团队并列全球第一。

StepAudio 3 TTS专注于自然语音合成,通过流式生成架构实现语音输出与播放实时同步。模型在音色表现、语调变化、节奏控制及呼吸停顿等维度高度拟人化,可精准还原笑声、迟疑、口吃等副语言特征。这种技术突破使合成语音在实时交互场景中更接近人类自然表达方式。

在音频生成领域,StepAudio 3 Gen开创了统一生成范式。用户通过自然语言描述结合参考音频,即可同时生成人声、音效、环境音及背景音乐。模型支持多角色音色定制,可精细调控语气、情绪、方言特征及呼吸声等细节,并具备音频时间轴编排能力,满足影视配音、游戏音效等复杂场景需求。

音乐创作模型StepAudio 3 Music提供从零生成到交互式编曲的全流程支持。用户既可通过自然语言指令控制曲风、旋律、节奏等要素,也能基于ABC记谱法进行精确创作。该模型特别强化了歌曲结构建模能力,可自动处理主歌、副歌过渡及跨段落旋律发展。在清唱配乐场景中,模型能分析人声特征并自动生成和声与乐器编配,实现从干声到完整作品的智能化转化。

更多热门内容
华为汪涛:AI大模型发展迅猛 10万卡超节点集群2027年或成标配
在近期举办的2026AIDC产业发展大会暨3D数据中心现场会上,华为技术有限公司副董事长兼轮值董事长汪涛透露,人工智能大模型发展已进入新阶段,参数规模突破万亿量级,预计到2027年,10万亿参数将成为超大模型的基础门槛。这一技术跃迁正推动AI从简单的问答交互工具,向具

2026-09-15

沐曦陈维良:筑牢国产GPU算力底座 赋能千行百业智算未来
在深圳国际会展中心(宝安)举办的国际集成电路创新博览会上,一场关于集成电路产业未来发展的深度对话引发广泛关注。沐曦集成电路(上海)股份有限公司创始人陈维良在集成电路创新高峰论坛上发表主题演讲,系统阐述了AI算力需求激增背景下国产GPU的突围路径,提出构建

2026-09-15