今年早些时候,OpenAI做出了一项出人意料的决定——全面终止其曾风靡一时的视频生成模型Sora的相关服务。这一举措发生在Sora 2发布仅半年后,当时该模型在视频生成领域堪称佼佼者,甚至与谷歌的Veo不相上下。然而,OpenAI不仅关闭了所有相关服务,包括API接口,还宣布将清空用户数据,此前与迪士尼达成的10亿美元投资协议也随之化为泡影。
市场对于OpenAI的这一决定众说纷纭。一种观点认为,OpenAI此举是为了集中资源提升编程能力,以在Agentic Coding & Workflow这一新兴市场中占据先机,该市场当时已被Claude等模型主导。但这一解释并未完全解答外界的疑惑:为何OpenAI不选择保留部分服务,比如为特定企业客户提供定制化视频生成方案?毕竟,即便视频生成对算力需求较大,OpenAI也似乎有能力承担有限规模的服务。
另一种在知乎等平台上流传的观点则显得颇为荒谬,认为视频生成市场缺乏盈利前景,甚至预言其将迅速消亡。然而,自ChatGPT问世以来,知乎在AI行业的技术和市场预测上屡屡失准,其观点往往成为反向指标,因此这一说法并未引起广泛重视。
近期,随着GPT-6 Astra的走红,一个更为合理的解释逐渐浮出水面。在与影视行业人士的交流中,笔者了解到,OpenAI放弃Sora或许是因为其意识到,现有的原生视频生成模式难以满足工业级影视作品的高标准需求。未来的视频生成,尤其是面向大银幕的精品内容,将更依赖于Agentic Coding的模式,而Astra正是在这方面取得了突破性进展。
原生视频模型,如Sora、Veo、可灵等,均面临一个共同难题:生成结果的不确定性。由于视频生成过程本质上是随机的,缺乏精确的调度机制,导演难以完全掌控最终效果。尽管可以通过多次尝试来优化细节,但在关键的调度和镜头语言方面,仍难以达到理想状态。
这一问题在短剧和部分互联网原生中剧中尚不突出,因为这些作品更注重剧情而非技术细节。然而,随着市场逐渐饱和,尤其是竖屏短剧领域,未来的增长点将转向横屏和大银幕作品,这些领域对视频质量的要求更高,制作预算也更为充裕。
Astra的出现为视频创作者提供了新的解决方案。通过Astra,用户可以操纵Blender等专业3D建模软件,构建完整的场景和人物运动轨迹,从而实现“调度”。虽然这些生成的内容本身尚不足以直接呈现给观众,但作为Prompt输入到Seedance或可灵等原生视频模型中,可以显著提升输出精度。
以制作一场复杂的动作戏为例,传统方法需要依靠详细的文本描述和大量图片来调教模型,而效果往往难以保证。借助Astra,用户可以先构建一个3D场景,将人物和道具的关系一劳永逸地解决,再将其输入到视频模型中,从而大大简化制作流程并提高效果。
尽管如此,传统3D建模的成本和难度仍然较高,与AI视频生成的初衷相悖。Astra的突破在于,它能够通过Coding方式操纵专业软件,以较低的成本实现复杂的场景构建和人物调度。对于简单的示意或效果展示,Astra与Blender的组合已经足够;而对于更复杂的视频制作,则仍需借助原生视频模型的力量。
在AI视频生成领域,Seedance等原生视频模型虽然不可或缺,但更像是“工兵”或“角色球员”,而Astra这样的具有强大Agent能力的文本模型则扮演着“中场组织者”的角色。随着视频复杂度的提升和对精确度要求的提高,Astra的重要性将愈发凸显。
视频模型的开发者显然也意识到了这一点。据媒体报道,Seedance的开发者字节跳动在Astra发布后不久,便传出了基于Seedance开发“世界模型”的消息。尽管外界猜测字节跳动此举意在进军游戏或元宇宙产业,但更合理的解释是,该公司希望通过世界模型为视频创作者提供更自由、更精确的调度空间。
展望未来,AI视频创作或许将遵循这样的路径:先让3D建模的角色在世界模型中“演出”,再对演出视频进行修改润色,最终生成符合工业级标准的视频作品。这一思路与传统影视行业的制作方式不谋而合,有望推动AI视频生成技术迈向新的高度。