ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

字节跳动Seed Audio 1.0发布:多要素编排,音色稳定,多语种自然生成

时间:2026-07-21 00:23:40来源:互联网编辑:快讯

字节跳动旗下Seed团队宣布推出全新音频创作模型Seed Audio 1.0,该模型通过端到端技术实现影视级音频的自动化生成,标志着声音创作从辅助性工具向独立叙事媒介的转变。与传统音频处理方式不同,该系统在统一架构下同步处理人声、环境音及特效声三大核心要素,使声音元素能够直接构建听觉场景,甚至在听众脑海中形成具象化画面。

技术层面,模型实现了三大突破性功能。首先通过单条文本指令即可完成多音频要素的时空编排,创作者可精确控制不同声音元素的入场时机与持续时间,例如让雨声随着剧情推进逐渐增强,或让人物对话与脚步声形成精准配合。其次在音色一致性方面,系统支持通过参考音频锁定角色声纹特征,即使在跨场景、跨时长的创作中,也能保持角色声音的稳定性,同时支持同一音色演绎喜悦、愤怒等不同情绪状态。

多语言支持成为该模型的另一亮点。系统内置覆盖20余种语言的发音规则库,能够根据不同语种的语法结构和韵律特点,自动调整角色声音的发音方式、语速节奏及情感表达。例如中文角色切换至西班牙语时,系统会优化卷舌音的发音强度,同时保持角色原有的音色特质,确保跨语言叙事时的声音自然度。

目前该模型已登陆火山方舟体验中心开放测试。开发者表示,这项技术将首先应用于影视配乐、游戏音效及有声读物等领域,未来可能拓展至虚拟现实、智能客服等场景。测试用户反馈显示,系统生成的音频在情感表现力和场景还原度上达到专业水准,部分功能可替代传统音频工程师的繁琐操作。

更多热门内容
新一代Kimi K3模型发布:2.8万亿参数领跑全球,AI发展再添新动力
据了解,在评测中,Kimi K3综合智能水平接近全球前沿的闭源模型。过去一年,全球大模型竞争逐步从单一榜单成绩转向预训练规模、架构效率、复杂任务能力和工程可用性的综合较量。 在评测中,Kimi K3展现…

2026-07-21

苹果AI“牵手”千问:阿里寻得C端突破口,合作成效待市场检验
这话翻译成人话就是:如果千问在iPhone上说了不该说的、生成了不该生成的,锅是苹果的。但真正的考验在秋季:当苹果移动操作系统第27版推送的那一刻,用户不会因为苹果终于有人工智能了而欢呼,他们只会问一句话—…

2026-07-21

杭州“双芯对谈”:中外学者共探AI与中华经典融合新路径
阿里巴巴集团公共事务部副总裁董宇分享了当前中国人工智能发展的最新成果与实践探索,他提到人工智能大语言模型的训练深度与语言理解能力已经大幅提升,未来将在中华经典海外传播的个性化适配、多语言转译层面发挥更大作用…

2026-07-21

WAIC上「AI原生手机」成焦点,端侧模型、原生设计、生态成新趋势
但在现场看完一圈,我的另一个感受是:这些号称原生的 AI手机,在整体产品设计上,目前还是现有手机的面貌,属于「旧瓶新酒」;它们都还是基于传统手机开发而来——直板、触摸屏、App 网格,AI 是住进来的新房…

2026-07-21

2026世界人工智能大会:徐汇滨江上演人机共舞 上海爱乐弦乐邂逅AI新篇
东方网记者熊芳雨7月20日报道:在2026世界人工智能大会暨人工智能全球治理高级别会议上,徐汇滨江会场推出“智享弦韵——上海爱乐乐团弦乐队专场音乐会”,以科技对话古典弦乐,呈现一场人机共生、虚实交融的跨界艺术…

2026-07-20

谷歌研发Frozen v2芯片:专为Gemini模型打造,破解AI算力短缺难题
IT之家 7 月 20 日消息,据 The Information 报道,知情人士透露,谷歌正在研发一款代号为“Frozenv2”的全新服务器芯片,该芯片的核心突破在于将 Gemini 大模型的底层运算架构…

2026-07-20

WAIC 2026直击:荣耀Robot Phone开启预约 引领AI伙伴型类人生命体新风潮
Robot Phone正是中国这三大独特优势深度交汇的结晶——它既在小小的手机机身中整合了行业最精密的四自由度云台系统,更通过OpenClaw开放平台,将云台系统演进为智能体的执行器,让开发者可以用自然语言…

2026-07-20

谷歌研发Frozen v2芯片:固化Gemini架构,或破解AI算力瓶颈难题
IT之家 7 月 20 日消息,据 The Information 报道,知情人士透露,谷歌正在研发一款代号为“Frozenv2”的全新服务器芯片,该芯片的核心突破在于将 Gemini 大模型的底层运算架构…

2026-07-20