ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

京东开源160亿参数流式视频编辑模型,实时视频编辑新范式来了

时间:2026-08-07 14:20:47来源:互联网编辑:快讯

AI视频领域正经历一场技术革新,字节跳动与MiniMax等企业近期相继推出新模型,将视频生成时长与成本推向新高度。然而,一个长期被忽视的痛点始终存在:用户需等待视频完整生成后才能评估效果,修改则需重新排队处理。这种"离线式"交互模式,正在被语音赛道率先突破——OpenAI的GPT-Live已实现全双工实时对话,让语音交互告别"你说一句、我回一句"的传统模式。

京东近日开源的JoyAI-Video-Edit模型,将这种实时交互范式引入视频编辑领域。作为首个实现"流式架构+实时速度+可用质量"的开源模型,其在720P分辨率下达到30帧/秒的推理速度,系统端到端稳定输出24帧/秒,支持无限时长的连续编辑。这意味着用户可像操作实时滤镜般调整视频内容:将人物变为乐高形象、切换卧室装修风格,甚至实时替换服装配色,所有修改均能即时呈现。

该模型的技术突破体现在两方面。在速度优化上,研发团队采用SA-DMD训练方法,将传统扩散模型所需的十余步迭代压缩至两步,配合160亿参数的多模态Transformer架构,在单张Nvidia B200 GPU上实现226毫秒的端到端延迟。相较于其他流式编辑模型为追求速度而压缩至1.3亿参数的做法,JoyAI-Video-Edit在保持720P高清输出的同时,速度提升1.4至2倍。

针对长视频编辑的稳定性难题,研究团队提出"有界KV状态推理"机制。通过限制模型记忆范围至最近帧与首帧,既控制了计算资源消耗,又通过专项训练确保画面连贯性。测试数据显示,该模型在连续编辑1小时视频时,仍能保持风格统一与物体形态稳定,彻底解决了传统自回归模型"越改越飘"的技术瓶颈。

在权威基准测试OpenVE-Bench中,该模型以3.60分领跑流式编辑赛道,在局部删除等任务中超越所有离线商业模型。长视频专项测试LongV2VBench显示,其3.30分的综合评分较次优模型高出1.59分,30.19帧/秒的处理速度达到行业领先水平的两倍。人类评估盲测中,该模型在四组对比中均获得超80%偏好率,与顶级离线模型Bernini-R的对比中也以48%对44%微弱领先。

这项技术正在重塑内容生产流程。传统视频制作中"修改-渲染-预览"的循环被打破,创作者可实时调整色调、风格与元素,将后期制作转化为现场创作。电商直播场景中,同一视频流可根据观众偏好实时生成不同服装搭配;影视预演阶段,导演能即时调整场景元素观察效果,将共识形成成本降低60%以上。

京东的技术布局远不止于内容创作。在具身智能领域,该模型可一键将人类操作视频转换为机器人训练数据,完整保留物体位置与动作轨迹。这与京东已有的JoyAI模型矩阵形成协同效应:VL-Interaction模型实现环境感知,Talker模型完成语音交互,RA模型驱动机械臂操作,Video-Edit则负责批量生成训练素材。这套覆盖"感知-决策-执行-学习"全链条的技术体系,正支撑着京东构建全球最大物理世界运营中心的战略目标。

更多热门内容
效力谷歌27年首席科学家迪恩携手团队创立新企,借AI推动科学发现提速
IT之家 8 月 7 日消息,科技媒体 TechCrunch 昨日(8 月 6 日)发布博文,报道称在本轮谷歌母公司 Alphabet 旗下AI 公司 DeepMind 重组中,谷歌首席科学家杰夫 · 迪恩…

2026-08-07

马斯克预言AI将取代源代码引热议:行业大佬激辩未来编程新形态
就在刚刚,马斯克在 X 上甩出一条暴论:代码正在变成下一个汇编,下一步是彻底摒弃它,让 AI 直接生成二进制! 而这正是 Douma 那个「半个世纪前的类比」最薄弱的地方:一个是翻译官,忠实、准确、零发挥;…

2026-08-07