中国AI领域近期再度引发全球关注,一系列突破性成果让国际科技界为之震动。月初,Kimi K3模型以极具竞争力的成本优势挑战国际顶尖模型Claude Fable 5与GPT-5.6 Sol,其运算成本较竞品降低约40%,直接导致美股科技板块市值蒸发近万亿规模。紧随其后,DeepSeek-V4-Flash正式版上线,凭借超高性价比在性能对标中超越多款美国同类产品。
这些突破背后,隐藏着一个35年前由"AI教父"Hinton提出的技术架构——混合专家模型(MoE)。三年前,全球顶尖AI研究机构集体转向该架构,但视频生成领域始终未能突破技术瓶颈。如今,由清华学者曹越领衔的Sand.ai团队成功打破僵局,正式开源全球首个千亿级MoE音视频生成模型MAGI-2 Preview。
该模型总参数量达1140亿,但单次前向计算仅激活60亿参数,成本控制在主流模型的十分之一。在技术演示中,模型展现出惊人的生成能力:印度街头舞者的纱丽褶皱随动作自然舒展,窗边特写中人物微表情与呼吸节奏完美同步,雨夜街景的光影变化与环境音效浑然天成。这些案例证明,模型已实现高保真音画同步、电影级运镜控制与细腻角色表演的统一生成。
技术团队透露,传统视频模型通过扩大Dense架构提升性能,但面临算力消耗指数级增长的困境。MAGI-2 Preview创新采用超细粒度MoE架构,将3072维特征表示拆分为12个256维子空间,每个子空间独立选择6个专家模块进行处理。这种设计使单个视频令牌可根据不同特征维度,动态组合调用72个专家模块,突破传统MoE架构的能力边界。
为解决千亿级模型训练中的通信瓶颈,研究团队提出"头并行"(Head Parallel)架构。该方案颠覆传统"先路由后通信"模式,在路由决策前即完成数据分发,使跨设备通信量保持恒定。配合自主研发的MagiMoE算子库与MagiMuon优化器,形成从模型架构到硬件优化的完整技术栈。这种系统级创新使模型在保持1140亿参数规模的同时,训练效率提升300%。
在数据构建方面,团队摒弃简单过滤策略,建立覆盖2000小时专业视频的细粒度标注体系。通过将运动轨迹、声音特征、镜头语言等200余类标注信息转化为可学习信号,确保3072个专家模块形成差异化能力。这种数据驱动策略使模型在预训练阶段即掌握复杂场景的生成规律,显著降低后期微调成本。
该模型最引人注目的突破在于实现真正的音视频统一生成。传统方案采用视频与音频双模型串联工作,导致声画不同步问题。MAGI-2 Preview将文本、视频、音频特征映射至同一向量空间,通过共享专家模块捕捉模态共性,专属专家模块处理模态差异。这种设计使口型同步、动作重音匹配、环境声场变化等细节在生成阶段即完成自然融合。
在权威评测平台Artificial Analysis的图生视频榜单中,MAGI-2 Preview以1106分位列第六,超越多数激活参数超百亿的闭源模型。成本测算显示,使用8卡H100集群时,生成10秒高清视频的成本约0.5元,仅为行业平均水平的十分之一。这种成本优势正在改变视频内容生产逻辑,某动画工作室负责人表示:"当单分钟生成成本从千元级降至十元级,我们终于能尝试以前不敢想的创意项目。"