阿里云近日正式推出全新一代视频生成模型Wan3.0,并面向公众开启公测。该模型在视频生成时长、多模态输入支持及画面真实感等核心指标上实现突破性升级,单次可生成最长30秒的高质量视频内容,为办公场景与创意创作提供更高效的解决方案。
在办公场景应用方面,Wan3.0首次支持文档类文件直接转视频功能。用户可将PPT演示文稿、Excel数据图表、PDF报告文档以及Markdown格式文本等输入系统,模型能自动解析内容结构并生成包含动态元素的视频。例如,教学课件可转化为带有动画演示的讲解视频,产品手册能生成包含3D模型展示的宣传片,业务数据则可呈现为交互式动态图表。这一功能显著降低了视频制作门槛,尤其适合教育、商务和营销领域的内容创作者。
技术层面,模型引入智能时长控制机制。系统可根据输入内容的复杂程度自动推荐最佳视频时长,同时提供故事线延展功能。当用户需要延长视频时,模型能基于原有内容逻辑生成连贯的后续情节,确保叙事完整性。在分辨率支持方面,已开放480P至1080P三种清晰度选项,满足不同场景的播放需求。
人物生成技术是本次升级的另一亮点。通过改进的神经网络架构,模型可精准捕捉面部微表情与皮肤纹理细节,在单人特写场景中实现"千人千面"的个性化效果。在群像场景中,系统能同时处理多个人物的面部特征与情绪表达,确保每个角色的表情动作自然不重复。全能参考功能则支持对角色形象、道具细节、场景风格等要素进行跨片段一致性复刻,为系列内容创作提供技术保障。
公测阶段,用户可通过阿里云百炼平台、万镜一刻创作工具、万相官方网站以及千问创作PC端体验服务,千问移动端应用将逐步开放灰度测试。在商业化方面,API接口采用按秒计费模式,480P、720P、1080P分辨率对应价格分别为每秒0.3元、0.6元和1.2元,完整接口将于近期全面开放调用。