人工智能领域迎来重要进展,国内企业MiniMax正式推出新一代通用视频生成模型MiniMax H3,并面向全球开发者开源。该模型突破传统单模态生成框架,通过整合文本、图像、视频和音频的多维度信息,构建出具备跨模态理解能力的全模态生成系统,为视频创作领域带来全新解决方案。
在技术参数层面,H3模型展现出显著优势。其支持4至15秒的动态视频生成,帧率稳定在24FPS,音频采样率达到32kHz立体声标准。创作者可根据需求选择21:9、16:9等五种主流画面比例,基础分辨率默认设置为768像素短边,通过专用H3-Regenerate-2K模块更可实现2K超高清输出。多语言支持方面,该模型覆盖阿拉伯语、中文、英语等11种主流语言,确保全球用户都能获得流畅的交互体验。
针对不同创作场景,研发团队设计了双轨并行架构。H3-Base-FL2VA首尾帧模式支持0-2张图像输入,可灵活处理文生视频、首帧生成、尾帧生成及双帧协同创作四种任务类型。而H3-Base-Ref2VA全模态参考模式则支持最多9张图像、3段视频(总时长≤15秒)及3段音频的混合输入,文件总数上限达12个,为专业创作者提供精细化控制手段。这种模块化设计既保证了基础创作的便捷性,又满足了复杂场景的定制需求。
系统架构方面,H3采用三段式处理流程。H3-Context-IR模块负责将用户指令解析为模型可识别的结构化数据,为后续生成奠定基础;H3-Base模块承担768p基础音视频的合成工作;H3-Regenerate-2K模块则通过上下文回传机制实现分辨率提升,在保持动态细节的同时显著增强画面真实感。这种分层处理方式有效平衡了生成效率与输出质量。
目前,该模型已通过MiniMax H3 Community License协议开源,完整代码与训练资源可在Hugging Face平台获取。行业观察人士指出,此次开源将降低多模态视频生成的技术门槛,为影视制作、数字营销、在线教育等领域提供创新工具,有望推动AI驱动的内容生产进入规模化应用阶段。