ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

京东全球首开源全栈实时视频视觉语言交互模型JoyAI-VL-Interaction 赋能多场景AI助手

时间:2026-06-22 21:42:50来源:快讯编辑:快讯

京东近日宣布正式开源全球首个全栈实时视频视觉语言交互模型——JoyAI-VL-Interaction,并同步获得vLLM-Omni框架的day-0原生支持。这一突破性技术标志着大模型应用从传统的"问答式交互"向"主动感知型交互"迈出关键一步,开发者可基于该框架快速构建具备环境感知能力的智能助手。

该模型实现了三大核心技术创新:首先突破传统模型的被动响应模式,通过持续视频流分析实现自主决策,无需等待用户提问即可判断交互时机;其次在实时性方面取得突破,针对安防预警、实时翻译等场景,可在画面变化瞬间完成响应,彻底改变传统视频分析"事后处理"的局限;第三创新设计了智能体委托机制,当遇到复杂任务时,前台模型保持环境观察,后台模型同步处理代码生成、工具调用等任务,形成高效协作的"双脑"架构。

技术架构层面,该系统支持多模态输入输出,包括摄像头、直播流、监控视频等视频源,以及语音交互、可视化界面等交互方式。其模块化设计允许开发者自由替换ASR语音识别、TTS语音合成、后台模型等组件,甚至可接入自定义业务系统。这种高度灵活性使其既能用于学术研究,也可快速适配安防监控、老人看护、直播解说、电商导购等20余个垂直场景。

在真实场景测试中,该模型展现出显著优势。针对监控预警、实时计数、多语言翻译等58个流式交互场景的盲测显示,与豆包视频通话助手相比取得77.6%的胜率,较Gemini视频通话助手更达到87.9%的胜率。测试特别强化了视觉触发响应和实时性两个维度,验证了模型在动态环境中的可靠性和效率。

目前,京东已完整开源模型代码、训练框架及部署方案,并提供vLLM部署工具包。开发者可基于现有组件快速搭建个性化AI助手,例如将语音服务替换为科大讯飞方案,或接入自研的Agent系统。这种开放生态策略有望推动实时交互技术在更多领域的创新应用,特别是在需要人机协同的复杂场景中展现价值。

更多热门内容
哈佛科学家提出大胆猜想:闯入太阳系的阿特拉斯或是外星探测器?
因为一个神秘的天体刚刚闯入了太阳系,哈佛大学的一位科学家坚称,它可能根本不是什么普通的彗星。 正因为这两个反常之处,勒布教授和他的同事们提出了一个大胆的假说:这可能不是什么天然彗星,而是某个先进文明故意派来的…

2026-08-01

SpaceX废弃火箭将“亲吻”月球 撞击或为科研添机遇也敲太空管理警钟
8月1日消息,一枚执行完任务后在太空漂移的SpaceX火箭上面级正高速飞向月球,预计将以每小时约8700公里的速度撞击月面,在爱因斯坦环形山附近形成新撞击坑。眼前这枚火箭将给月球增加一个小坑,却也为人类提出更…

2026-08-01

中美航天出舱对比引热议:载人航天不看“潇洒”步,关键在安全回家路
更值得注意的是,Crew-8返回后,4名乘员都被送往医院接受进一步检查,其中一名NASA航天员还留院观察。 一个刚在太空生活210天的人,明明可能头晕、肌肉力量下降,还非要他为了镜头站起来证明自己,这不叫强…

2026-08-01

SpaceX首份财报将至,投资者聚焦Starship及散户持股等多样问题
8月1日,财闻海外资讯,SpaceX作为一家上市公司,其首次财报电话会议预计将聚焦于人工智能支出和Starlink卫星通信网络的利润。许多散户投资者的关注点更为多样。 SpaceX开设了一个在线平台,供投资…

2026-08-01