ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

Vivix发布实时互动模型A1,统一流式架构让AI“活”在平行世界

时间:2026-07-25 15:29:29来源:互联网编辑:快讯

诺兰的《星际穿越》曾以平行时空交汇的设定震撼观众,但如今,AI技术正让这样的科幻场景逐渐成为现实。最新发布的Vivix A1模型,让虚拟角色突破了传统交互的局限,实现了与用户实时视频通话的能力。这只小猫不仅能说土味情话,还能根据用户的声音即时调整动作——弓背、摇尾巴、抬爪子,甚至在虚拟世界中自由走动,脚下的影子也会随之变化。

A1的核心突破在于其原生流式架构,将多模态参考、实时交互和视频生成统一在一个模型中。传统视频模型通常一次生成完整片段,而A1则像“一边铺铁轨一边开火车”,在持续生成过程中维持角色、物体和场景的长期一致性。通过因果时序建模和流式状态维护,A1确保了相邻动作的自然衔接,同时在全球范围内保持角色身份、场景和物体关系的稳定。

交互方式的革新是A1的另一大亮点。传统数字人依赖语音转文字、文字生成回答、回答转声音的流水线处理,信息在传递过程中容易丢失语气、环境声音等细节。A1则直接建模语言语义、声学特征、非语言声音、环境事件、手势和动态视觉信号,实现了真正的多模态交互。用户的语气变化、环境中的新声音或画面中的动作,都能成为触发信号,实时改变生成内容。

实时性是A1面临的另一大挑战。视频扩散模型通常需要多个采样步骤,直接减少步数会导致画质和动作表现下降。Vivix提出的MJD技术,将8步采样压缩到2步,同时保持了短时画质、指令遵循、运动表现和长时稳定性。通过优化视觉细节、时间一致性和多模态分布对齐,MJD确保了视频生成的高效与质量。

让近30亿激活参数的模型在消费级显卡上实时运行,是A1落地的关键。Vivix通过三项技术实现了这一目标:首先,将Encoder与Decoder解耦,避免任务冲突;其次,采用原生NVFP4训推协同,让模型适应4-bit数值分布;最后,构建计算、通信和内存协同调度引擎,减少多卡系统中的等待时间。这些优化使A1在单卡上吞吐量超过10000 video tokens/s,多卡链路中PCIe带宽利用率达到88%以上。

与A1同步推出的W1模型,则进一步拓展了交互的可能性。W1允许用户介入虚拟世界,改变角色的选择、行动和剧情走向。这种设计让用户不再只是旁观者,而是成为故事的一部分。例如,用户可以通过输入指令,让小猫选择不同的路径,或与其他虚拟角色互动,从而影响整个世界的演变。

A1和W1的组合,标志着虚拟角色交互进入了一个新阶段。从统一多模态参考与流式生成,到原生交互信号建模,再到高效的推理优化,Vivix的技术组合填补了实时交互链路中的多个缺口。现在,屏幕另一端的AI不仅能听见用户的声音,还能转身、行走,并在虚拟世界中持续演变。虽然距离真正的“平行世界”还有很长的路要走,但这项技术已经迈出了关键的一步。

更多热门内容