ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

大晓机器人携手港大推出StreamPI,为机器人时序理解开启时空智能新篇

时间:2026-08-28 20:13:20来源:互联网编辑:快讯

在机器人技术领域,大晓机器人与香港大学联合发布了一项名为StreamPI(Streaming Multimodal Temporal Modeling for Vision-Language-Action Models)的全新研究成果,这一突破性进展为解决视觉-语言-动作模型(VLA)长期存在的“单帧智能”瓶颈提供了关键方案,成功为VLA补上了至关重要的“时间维度”。

传统VLA主要依据当前观测进行独立决策,这种“单帧智能”模式限制了机器人的能力。而StreamPI则为模型构建了持续的多模态时序上下文,使机器人能够记住过去、理解状态变化、判断任务进程,还能利用跨帧信息增强精细空间感知与动作决策能力。它推动VLA从单纯“识别当前状态”,迈向“理解正在发生的物理过程”,让机器人对世界的认知从静态画面转变为动态的时间流。

在技术实现上,StreamPI并未采用依赖额外参数堆叠来获取时序能力的方式,而是基于现有的VLA骨干,通过指令持续锚定、历史信息流式缓存与随机时间间隔训练,实现了从单帧决策到连续时序建模的轻量化扩展。这种创新方法避免了因参数堆叠带来的复杂问题,同时保证了模型的高效运行。

真实机器人实验以及在LIBERO、CALVIN等实验环境中的测试结果显示,StreamPI在时序记忆、精细空间操作与长程连续任务等方面取得了显著提升。以“猜杯子”任务为例,物体被藏入杯子并经过多次交换后,答案存在于整个变化过程而非最后一帧,传统单帧决策的机器人难以应对,而StreamPI赋能的机器人能凭借对历史信息的理解准确判断。在滚动物体场景中,单帧只能确定物体位置,连续观测才能理解其运动趋势,StreamPI让机器人真正理解了“物体正往哪里去”。

在给VLA加入时间信息的方法上,以往简单将过去多帧图像组成窗口一次性交给模型的方式存在诸多弊端。历史帧越多,视觉信息量越大,不仅需要反复计算已处理画面,增加推理开销,还易使任务指令被大量视觉信息稀释,导致机器人在长程执行中“忘记目标”。

StreamPI则采用了更科学的方法,它将每个时刻组织为“视觉观测 + 任务指令”的完整时序单元。语言指令持续绑定每次观测,成为贯穿任务始终的语义锚点,让机器人在接收新信息时始终明确目标。在时序单元内部,视觉与语言充分交互;不同单元之间按时间顺序持续读取和聚合历史信息,使模型既能理解当下所见,又能追溯过去发生的事,将离散的单帧判断连接成连续的时序理解。

为了让机器人拥有记忆的同时避免重复计算历史,StreamPI采用流式推理。首帧观测编码后存入键值缓存,后续只需处理新信息并调用历史表示,避免了重复计算整个观测窗口。而且,StreamPI无需额外引入视频编码器或独立记忆模块,通过重构原有VLA的注意力机制,直接继承π0.5的视觉—语言表征能力,在不增加额外模型参数的情况下,让单帧VLA获得连续时序能力。

真实机器人的运行环境复杂,相机采集、模型推理、通信与机械臂执行等环节都会产生延迟,导致观测时间波动,只在固定间隔数据上训练的模型在部署时易遭遇时序分布差异。为此,StreamPI引入随机时间间隔训练,随机改变历史观测间的时间距离并隐藏部分早期信息,让模型适应不同时间跨度和不完整上下文,学习更稳定的时序关系。

实验数据充分证明了StreamPI的有效性。在LIBERO上,随机时间间隔训练策略将三帧输入时的平均成功率从96.4%提升至97.5%,五帧输入时从97.0%提升至98.3%。在更依赖长程上下文的LIBERO - Long任务中,成功率从π0.5的92.4%提升至95.0%。在CALVIN上,StreamPI平均连续任务长度达到4.547,超过π0.5的4.313和MemoryVLA的4.090;任务推进到第五步时,成功率仍达85.0%,高于π0.5的79.5%。

团队还设计了四项真机任务检验StreamPI的时序记忆与精细空间感知能力,每项任务采集100条人类遥操作示范。在“猜杯子”任务中,StreamPI将π0.5的成功率从46.7%提升至80.0%;在滚动物体抓取任务中,从26.7%提升至63.3%。在强调空间精度的窄瓶口插笔任务中,成功率从40.0%提升至66.7%;纸杯插入杯套任务则从60.0%提升至92.0%。这些数据表明,时间不仅为机器人带来记忆,还帮助它更准确地理解空间。

StreamPI的出现,标志着机器人从基于当前状态决策迈向基于连续过程决策的重要转变。它让机器人对现实世界的认知不再局限于彼此孤立的静态画面,而是能够记忆、理解和持续更新时间流中的信息。目前,StreamPI在超长时间跨度训练和极端异步场景下仍有提升空间,但它的探索为机器人技术的发展开辟了新的道路,推动具身基础模型从空间智能向真正面向动态物理世界的时空智能迈进。

更多热门内容
大模型赋能:多模态生成项目引领新一代AI产品形态创新与升级
大模型技术的快速迭代与规模化落地,彻底颠覆了传统人工智能产品的研发逻辑、交互模式与服务形态,推动AI产品从单模态、指令式、工具化的初级形态,向多模态融合、自主化感知、场景原生适配的新一代形态深度演进。传统A…

2026-08-28

闲鱼邂逅高中生:郑立鹏对话揭AI时代高考生专业抉择与成长破局路
面对日新月异的AI时代,高考生在热门专业、稳定出路、地域机遇之间反复权衡。郑立鹏老师的分享,传递出一种务实的成长理念:不必盲从名校光环,不要困在书本理论,重视实践、拥抱时代工具,方能在变化的浪潮当中找准属于自…

2026-08-28

甘肃省成兴公司“AI大模型智能辅助评审系统”斩获全国数据要素创新大赛三等奖
经过层层筛选、激烈角逐,由甘肃省招标咨询集团成兴信息科技有限公司(以下简称“成兴公司”)牵头,联合黑龙江省招标有限公司共同研发的“AI大模型智能辅助评审系统”从全国2200余个参赛项目中脱颖而出,荣获大赛三等…

2026-08-28

DeepSeek V3赋能商务场景:大模型二次开发破局垂直落地难题与挑战
从通用能力到场景化应用,中间的二次开发、工程优化、成本控制都是必须跨越的门槛。一是场景适配偏差,通用大模型的回答逻辑与商务场景的专业需求存在错位,企业介绍、产品咨询、流程解答类问题的准确率难以达到商用标准;二…

2026-08-28

AI赋能千行百业催生新岗位,广东北京江苏成人工智能企业聚集高地
人社部发布的新职业中,超30个与AI紧密相关,AI训练师、提示词工程师、数字人设计师等新岗位市场需求持续走高,同时AI工具大幅降低创业门槛,单人即可完成多环节工作实现轻量创业。其中,2026年截至目前新增注册…

2026-08-28

OpenAI Codex新动态:持久化模式曝光,AI化身“永动机”引关注
但在持久化模式下,AI被明确告知:「当你完成用户的请求时,你的工作并没有结束。 近期,奥特曼及多位OpenAI高管在公开和私下场合,都在频繁探讨一种全新的产品形态——「常驻型」(always-on)AI智能体…

2026-08-28

Claude新突破:MHS标准发布,让AI“借身”操控物理世界硬件
MHS则进一步把这套思路延伸到现实世界,让机械臂、显微镜、相机和实验仪器也变成Agent可以发现和调用的工具。 换句话说,从MCP到MHS,Anthropic不只是想让Claude“会用更多工具”,而是在不…

2026-08-28

OpenAI测试Codex“持久模式”:AI可连续工作25小时 自主推进任务但风险待解
【环球网科技综合报道】8月28日消息,据外媒WIRED报道,通过查阅产品代码发现,OpenAI正在为代码智能体Codex测试“持久模式”新特性,这款AI可以持续自主处理任务,直至用户手动将其 “休眠”,标志…

2026-08-28