ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

大晓机器人与南洋理工大学联手,Puffin-World开启机器人训练新篇章

时间:2026-09-11 06:19:21来源:互联网编辑:快讯

大晓机器人与南洋理工大学S-Lab等科研团队近日联合推出了一项突破性成果——统一多模态世界模型框架Puffin-World,并同步开源相关代码、模型及数据集。该框架首次将物理状态、几何结构与视觉外观整合为三维世界的三种原生属性,构建了覆盖重力场感知、空间仿真、三维重建及闭环探索的完整技术体系,为机器人空间智能与具身智能训练提供了全新解决方案。

传统机器人训练依赖的环境信息往往局限于视觉呈现,但实际场景中,相机姿态、重力稳定性、空间连续性等物理参数同样关键。例如,机器人移动后能否准确预测新视角下的场景变化,取决于其对三维世界状态的全面理解。Puffin-World突破了单一模态的局限,通过统一框架同时处理物理方向、空间几何与视觉外观的交互关系,使模型能够从一张图片中解析相机姿态、场景结构及语义信息,甚至预测修正动作后的目标观测结果。

该框架的核心能力体现在四大任务整合上。其一,单图空间推理功能可基于地平线、垂直结构等线索,计算相机相对于真实世界的横滚角、俯仰角及视场角,同时生成场景语义描述,实现“看到什么”与“如何看到”的双重解析。其二,自由视点仿真技术允许用户通过文字或参数指定相机方向,模型据此生成符合目标视角的画面,将文生图的控制精度从内容层面延伸至空间维度。其三,三维世界重建支持从文字、单图或少量参考图像出发,沿指定轨迹生成多视角画面,并预测各视角的深度信息,最终融合为具有一致空间结构的三维模型。其四,闭环自校准机制通过“感知状态—预测动作—生成结果—动态校准”的循环,使模型在相机姿态偏离时自动修正,确保空间探索的连续性与准确性。

为推动技术落地,研究团队同步开源了Puffin-16M数据集,包含1500万组视觉-语言-相机三元组及100万条复杂旋转轨迹,并标注了28个公开数据集的约4450万张图像的绝对相机位姿。这一资源库不仅覆盖了多样化的场景类型,还通过高精度标注解决了机器人训练中数据稀缺的痛点,为仿真环境构建、合成数据生成及具身智能算法开发提供了可复现的技术底座。

据悉,Puffin-World的开源代码与模型已面向全球研究者开放,其模块化设计支持快速集成至现有机器人系统。随着空间智能技术的演进,这一框架有望在自动驾驶、工业自动化、服务机器人等领域引发新一轮创新应用。

更多热门内容
华海清科Master-P510APEX出机 助力我国板级封装装备自主发展新跨越
作为国内首台进入量产线的全自动板级CMP装备,此次出机标志着我国板级封装核心工艺装备实现了从研发到应用的关键跨越,为先进封装产业自主发展提供了重要支撑。 随着人工智能、高性能计算、5G通信与物联网等技术的持…

2026-09-11

苹果新动向:iPhone变身AI时代“智能个人中心” 开启设备使用新篇
【环球网科技综合报道】9月10日消息,苹果公司首席执行官约翰·特努斯在iPhone新品发布会上,提出“智能个人中心”全新产品定位,明确iPhone将作为个人人工智能重要入口,开启人工智能驱动的设备使用新体验…

2026-09-11

昕诺飞Interact Office Flex升级:以智能照明开启全空间能源管理新篇
中国,上海 – 全球照明领导者昕诺飞(阿姆斯特丹欧洲证券交易所代码:LIGHT)9月10日宣布,对旗下 Interact OfficeFlex 系统进行战略升级,依托照明系统中的传感器网络,实现对暖通空调…

2026-09-11

中国移动2026服贸会“秀肌肉”:数智赋能行业 科技普惠民生
依托坚实的网络与算力底座,中国移动将底层技术能力沉淀为标准化行业服务,面向中资出海、中小微企业、政府治理、汽车、金融等领域持续输出可复制、可落地的数智解决方案。 本次服贸会,中国移动集中呈现了“通信+算力+…

2026-09-11

新松亮相2026全球工业互联网大会 以机器人创新赋能“AI兴工”新未来
他以工业机器人、移动机器人、复合机器人、人形机器人在应用场景中的能力进化为案例,提到AI+机器人产业的爆发,本质上是一次控制理论的范式跃迁——从依赖人工编码规则的确定性系统,转向由数据驱动、自主学习的具身智能…

2026-09-11

李萌:从模型创新到场景落地,共筑智能体网络赋能AIGC发展
概括起来,这四个方面就是:模型能力驱动智能的上限——智能体是高智商的“爱因斯坦”还是普通人,取决于模型;垂直深度锚定价值根基——智能体好不好用、能不能创造价值,取决于在垂直领域扎根的深度;生态广度拓展行动半…

2026-09-11