ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

大晓机器人推出HSImul3R框架:打通人–场景交互重建链路 赋能机器人技能学习

时间:2026-09-08 23:57:01来源:互联网编辑:快讯

在三维重建技术领域,一项突破性成果正引发广泛关注。大晓机器人携手南洋理工大学 S-Lab 以及上海人工智能实验室,共同推出了全新的人–场景交互重建研究 HSImul3R。该研究聚焦于三维视觉领域长期存在的“感知—仿真鸿沟”难题,致力于推动三维重建从追求“视觉正确”迈向“物理可执行”的新阶段,其成果已被全球计算机视觉顶级会议 ECCV 2026 正式接收。

传统的人–场景交互重建方法,主要将关注点放在人和场景是否重建得逼真、是否对齐上。而 HSImul3R 独辟蹊径,把重力稳定性、真实接触与交互稳定性纳入核心评价标准。研究团队将其定义为首个面向非标定稀疏视角输入,能够实现稳定可仿真(Simulation-Ready)人–场景交互重建的框架,并且支持单目视频输入。与此同时,团队还构建了面向人–场景交互的 HSIBench,用于直接检验重建结果能否在物理仿真中实现稳定交互。

在实验数据方面,HSImul3R 表现亮眼。在 Easy、Medium、Hard 三档任务中,其交互稳定率分别达到 53.68%、30.56% 和 13.92%,远高于 HSfM 的 10.52%、4.50% 和 2.66%。同时,人–场景三维穿模率从 HSfM 的 69.51% 大幅降至 22.90%。这些数据充分彰显了 HSImul3R 在提升人–场景交互稳定性、降低穿模率方面的显著优势。

为了达成从“视觉正确”到“物理成立”的目标,HSImul3R 创新性地提出了物理闭环(Physics-in-the-Loop)双向优化框架。这一框架让物理仿真器不再仅仅是最终检验工具,而是成为重建过程中的主动监督者。具体而言,一方面通过面向场景的强化学习(Scene-targeted Reinforcement Learning)优化人体运动,确保人体运动既符合物理规律,又能与当前场景稳定交互;另一方面,借助直接仿真奖励优化(Direct Simulation Reward Optimization,DSRO),利用交互后的仿真反馈反向优化三维场景。

在物理闭环优化过程中,让恢复的人体运动适应当前场景是首要任务。传统动作跟踪与强化学习往往更注重人体自身的稳定性以及动作与原始轨迹的接近程度,却容易忽略人–物交互关系。例如,一段“坐在椅子上”的动作经过普通运动优化后,人体可能为保持平衡而偏离椅子,导致原本的交互消失。而 HSImul3R 的面向场景的强化学习,通过人体关键接触点与物体表面的空间关系,使优化后的动作既忠实于原始观测,又能与当前场景保持正确、稳定的接触,真正实现物理交互。

然而,仿真失败的原因并非总是人体动作错误,场景重建不准确也可能导致这一问题。特别是在人类遮挡严重、桌腿或椅腿等结构较细的场景中,图像生成三维模型(Image-to-3D)容易出现结构缺失或几何畸变,即使人体动作合理,也无法支撑真实交互。针对这一情况,HSImul3R 在反向过程中采用直接仿真奖励优化(DSRO),直接利用物理仿真的交互结果作为监督信号,反向优化三维物体生成模型,将评价标准从“物体自身能否站稳”提升为“人与它交互之后能否稳定”。

为了验证新的评价体系,团队构建了面向人–场景交互的 HSIBench。该数据集包含 19 个场景物体、超过 50 段人体动作序列和 300 个独立交互实例,由 3 名参与者完成,每个案例均从 16 个视角同步采集。与传统三维重建基准关注几何误差不同,HSIBench 将人–场景交互稳定性(Stability-HSI)作为核心指标之一,不仅要求物体在重力下稳定,还要求整个交互进入仿真后保持稳定,并保留有意义的人–物接触。

HSImul3R 的意义不仅在于稳定的物理仿真,更在于将经过物理优化的人体动作迁移到真实人形机器人上,实现从仿真到真实世界(Sim-to-Real)的跨越。团队先将优化后的人体运动重定向至 Unitree G1,再以这些动作作为先验,在仿真环境中训练全身控制策略,最终直接部署到真实 G1 上,使机器人能够在现实环境中复现相应的人—场景交互。这一过程实现了从人类视频中的行为到真实机器人执行的完整转换,为机器人学习真实物理技能提供了新的途径。

更多热门内容
国产硫化物全固态电池突破:中试线年底建成,全固态家用车普及或加速
目前全球绝大多数全固态技术成果,仍停留在实验室小样品、小批次验证阶段,参数亮眼但无法适配工业化生产,一上产线就面临良率崩盘、成本失控的问题,这也是固态电池迟迟难走进民用市场的核心原因。通俗来说:行业多数玩家还…

2026-09-08

OpenAI再突破:ChatGPT Sites公测,GPT-6频谱识音开启AI新纪元
传统软件SaaS的核心壁垒是「我们把代码封装成了好看的按钮供你点击」,而大模型的降维打击是:你只要张嘴说话就行。而且,就在今天,AI研究员ChrisGPT和Max Rubin公布的一组测试,让无数音频工程…

2026-09-08

以法治为笔 绘就人工智能健康发展蓝图 守护你我合法权益
意见明确,针对同一商品或者服务,经营者利用算法在交易价格等交易条件上实行不合理的差别待遇,侵害他人合法权益造成损害的,人民法院应当依法认定其承担相应的侵权责任;利用人工智能“仿冒名人带货”且构成欺诈,消费者…

2026-09-08

AI赋能“中国智造”:从科技展品到外贸订单,创新产品加速走向世界
在本次科技创新展上,深圳拓竹科技有限公司展出的3D打印机吸引了不少参会嘉宾的目光。在华强北创业近二十年的李伟明深有感触:“AI应用提升智能眼镜技术含量,有了好东西,才有竞争力。”2026年初,深圳领先边端智…

2026-09-08

宇树科技再突破:世界模型驱动人形机器人首秀全自主搏击
宇树科技表示,该模型突破了世界-动作大模型在瞬时规划、决策和动态交互执行等方面的瓶颈,实现了高动态、强交互以及对未来的实时预测和规划。 王兴兴此前曾多次提出一个具身智能的“ChatGPT时刻”标准:如果在80…

2026-09-08

华沿机器人HRC平台:以20年技术积淀,为具身智能筑牢执行基石
诚然,AI大模型、强化学习大幅度提升机器人环境理解、任务规划和自主决策能力,但 AI 能力进入机器人本体后,仍然需要解决一系列底层问题:高速运动下的轨迹精度、复杂环境中的动态响应、机器人与物体接触时的柔顺性…

2026-09-08

2026人形机器人赛道大变局:从炫技表演到产业落地,分化拐点已现
这些数字合在一起看,宇树的盈利来自性价比高的标准化硬件单品+科研展演窄赛道,无跨产业复制能力,这也是其营收增速、利润增速率先见顶的核心原因;对比优必选全尺寸具身人形+多行业真实场景落地,两者商业化场景、客户…

2026-09-08

宇树科技全球首秀:世界模型驱动人形机器人全自主搏击,AI自主决策显实力
宇树说,这是全球首次实现世界模型实时驱动的全自主人形机器人格斗。这个模型突破了瞬时规划、决策和动态交互执行等瓶颈,能实时对未来做出预测和规划。视频里,机器人在单腿站立状态下出拳击打,说明动态平衡和实时决策是同…

2026-09-08