智象未来(HiDream.ai)近日推出全新原生全模态视频生成模型HiDream-O1-Video-1.0(简称HD-V1),标志着该公司在多模态人工智能领域迈出重要一步。这款模型支持文本、图片、视频等多种输入方式,能够直接生成5至20秒的1080p高保真视频,在多个技术维度上实现了显著突破。
在国际权威AI评测平台Artificial Analysis的Image to Video Leaderboard(With Audio)榜单中,HD-V1跻身全球第四;在Arena.ai的Image-to-Video盲测榜单中,该模型位列第八。这两项排名均体现了HD-V1在AI视频生成领域的综合实力,为行业提供了重要的第三方评估参考。
技术架构方面,HD-V1采用智象自主研发的原生全模态框架,前置多模态意图理解模块。该模块可对视频内容进行结构化规划,涵盖镜头时长、场景地点、画面内容、角色动作与表情、运镜焦段、台词与背景声等细节。通过将物理规律纳入生成逻辑,模型使物体在重力、碰撞、惯性、光影衰减及空间连续性等方面的表现更贴近真实世界。
在音画同步方面,HD-V1通过文本、视频、音频联合建模技术,实现了原生一体化生成。镜头切换时,环境声与配乐能够自然过渡;人物开口说话时,口型、气口与情绪保持同步。这种技术突破使得生成的视频在视觉和听觉层面都更加协调自然。
时长控制是HD-V1的另一大亮点。与传统模型采用固定时长生成不同,HD-V1将时长选择与内容情境深度绑定。模型能够根据事件展开逻辑、动作完成周期及叙事推进节奏,自主规划生成时长,使视频内容更加连贯合理。
随着HD-V1的发布,智象未来已完成四大核心模型的布局,包括图像生成模型HiDream-O1-Image、交互式世界模型HiDream-O1-World、具身世界模型HiDream-O1-Embodied以及视频生成模型HD-V1。公司创始人梅涛博士表示,智象未来正致力于构建"一个原生全模态底座、四大模型同源演进"的技术矩阵。
在产品发布的同时,智象未来宣布完成C+轮融资,本轮投资方包括新微资本、交子资本和工银资本。此次融资将为公司在多模态AI领域的持续创新提供资金支持。