ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

大晓发布全球首个可仿真人–场景交互重建框架HSImul3R,让人类视频变成机器人技能

时间:2026-09-08 21:10:27来源:TechWeb编辑:快讯

9月8日消息,近日,大晓机器人联合南洋理工大学 S-Lab、上海人工智能实验室发布全新人–场景交互重建研究 HSImul3R,直指三维视觉长期存在的“感知—仿真鸿沟”,推动三维重建从“视觉正确”走向“物理可执行”。该成果已被全球计算机视觉顶级会议 ECCV 2026 正式接收。

不同于传统方法主要关注人和场景是否重建得像、是否对齐,HSImul3R 将重力稳定性、真实接触与交互稳定性纳入核心评价标准。团队将其定义为首个面向非标定稀疏视角输入、实现稳定可仿真(Simulation-Ready)人–场景交互重建的框架,并进一步支持单目视频输入。与此同时,团队构建了面向人–场景交互的 HSIBench,直接检验重建结果能否在物理仿真中稳定交互。HSImul3R 在 Easy、Medium、Hard 三档任务中的交互稳定率分别达到 53.68%、30.56% 和 13.92%,显著高于 HSfM 的 10.52%、4.50% 和 2.66%,并将人–场景三维穿模率从 69.51% 降至 22.90%。

为实现这一目标,HSImul3R 提出物理闭环(Physics-in-the-Loop)双向优化框架,让物理仿真器从最终检验工具变成重建过程中的主动监督者。一方面,通过面向场景的强化学习(Scene-targeted Reinforcement Learning)优化人体运动,使其既物理可行,又能与当前场景稳定交互;另一方面,通过直接仿真奖励优化(Direct Simulation Reward Optimization,DSRO),利用交互后的仿真反馈反向优化三维场景。最终,团队将优化后的人体动作迁移至 Unitree G1 人形机器人,贯通日常图像/视频 → 三维人–场景交互重建 → 物理仿真优化 → 人形机器人动作迁移 → 真实机器人执行的完整链路,让人类视频中的交互经验从视觉信息进一步转化为可仿真、可学习、可执行的机器人技能资产。

从“视觉正确”到“物理成立”:重新定义三维重建

近几年,三维重建、人体运动估计与人–场景交互建模持续发展,机器从图像和视频中恢复三维世界、理解人类行为的能力不断提升。但传统方法大多仍以几何准确、姿态还原和视觉对齐为主要标准,回答的更多是“人和场景重建得像不像”。问题在于,机器人最终面对的是一个由重力、碰撞、摩擦与接触共同决定的物理世界。一个视觉上高度可信的场景,进入仿真器后可能立即失效:椅子可能因为结构缺失无法站稳,人体与物体也可能发生穿模,原本看似正确的交互因此无法真正成立。

HSImul3R 概览图

HSImul3R 因此将评价标准从“视觉正确”进一步推进到“物理成立”,把重力稳定性、真实接触和交互稳定性纳入重建过程。它不再只要求人和场景在画面中对齐,而是要求重建结果能够真正进入物理仿真,并保持原有的人–场景交互关系。更关键的是,HSImul3R 并非先完成重建、再用仿真器验证,而是提出物理闭环(Physics-in-the-Loop)双向优化机制,让仿真反馈直接参与重建。正向过程优化人体,反向过程修正场景,物理仿真器由最终的“裁判”转变为整个重建过程中的主动监督者。

不只是动作可行,更要让交互真正成立

物理闭环的第一步,是让恢复出来的人体运动真正适应当前场景。传统动作跟踪与强化学习通常更关注人体自身是否稳定、动作是否接近原始轨迹,但即使人体动作在物理上成立,也可能已经偏离原有的人–物交互关系。例如,一段“坐在椅子上”的动作经过普通运动优化后,人体可能为了保持平衡而偏离椅子。人虽然没有摔倒,但“坐椅子”这一原本的交互已经消失。对于具身智能而言,只做到“动作可行”显然还不够。

去除面向场景的强化学习,仿真中出现非预期的物体位移,且难以稳定交互

为此,HSImul3R 提出面向场景的强化学习(Scene-targeted Reinforcement Learning),在运动跟踪基础上进一步加入场景交互约束。系统通过人体关键接触点与物体表面的空间关系,使优化后的动作既忠实于原始观测,又能与当前场景保持正确、稳定的接触。也就是说,HSImul3R 优化的不是一条抽象意义上“符合动力学”的人体轨迹,而是一段能够在特定场景中真正成立的物理交互。“坐下”意味着人必须真实坐到这把椅子上,而不是只在空间中复现一个相似动作。

用真实交互反过来优化三维世界

但仿真失败并不一定意味着“人动错了”,也可能是场景本身没有重建正确。尤其在人类遮挡严重、桌腿或椅腿等结构较细的场景中,图像生成三维模型(Image-to-3D)容易产生结构缺失或几何畸变,即使人体动作合理,也无法支撑真实交互。针对这一问题,HSImul3R 在反向过程中提出直接仿真奖励优化(Direct Simulation Reward Optimization,DSRO),直接利用物理仿真的交互结果作为监督信号,反向优化三维物体生成模型。评价标准也由“物体自己能不能站稳”,进一步提升为“人与它交互之后还能不能稳定”。

图像到三维物体重建的定性对比

团队将仿真反馈划分为从“物体在重力下失稳”到“人与物体实现稳定交互”的四种状态。只有当物体自身稳定、交互后仍保持稳定,并且人与物体之间确实形成有效接触时,重建才被认为真正成立。因此,一把椅子即使单独放在地面上不会倒,如果人坐上去就倾覆,或者人与椅子最终完全分离,它仍然没有被真正“重建对”。HSImul3R 由此把评价标准从“物体自身是否物理合理”推进到“物体在人–场景交互中是否物理合理”,让人类交互本身成为优化三维世界的重要监督信号。

HSIBench:不只看“像不像”,更要看“能不能交互”

为了验证这一新的评价体系,团队进一步构建了面向人–场景交互的 HSIBench。数据集包含 19 个场景物体、超过 50 段人体动作序列和 300 个独立交互实例,由 3 名参与者完成,每个案例均从 16 个视角同步采集。与传统三维重建基准更多关注几何误差不同,HSIBench 将人–场景交互稳定性(Stability-HSI)作为核心指标之一,不仅判断物体在重力下能否稳定,还要求整个交互进入仿真后保持稳定,并保留有意义的人–物接触。换句话说,三维重建不仅要通过“视觉和几何考试”,还要真正通过“物理实操”。

HSIBench 示例及 HSImul3R 对应的仿真结果

实验结果显示,在 Easy、Medium 和 Hard 三档任务中,HSImul3R 的人—场景交互稳定率分别达到 53.68%、30.56% 和 13.92%,而 HSfM 分别为 10.52%、4.50% 和 2.66%;人—场景三维穿模率也从 HSfM 的 69.51% 降至 22.90%。这些结果意味着,当三维重建真正服务于具身智能时,“渲染得足够真实”已经不再是终点。重建出来的世界,还必须能够承受机器人真实的动作与交互。

从人类视频到真实机器人,让交互经验真正被“学会”

如果 HSImul3R 最终只停留在稳定的物理仿真,它仍然只是完成了从真实世界到仿真的迁移(Real-to-Sim)。这项工作的另一关键一步,是进一步将经过物理优化的人体动作迁移到真实人形机器人上,实现从仿真到真实世界(Sim-to-Real)。团队首先将优化后的人体运动重定向至 Unitree G1,再以这些动作作为先验,在仿真环境中训练全身控制策略,最终直接部署到真实 G1 上,使机器人能够在现实环境中复现相应的人—场景交互。

部署于 Unitree G1 人形机器人上的仿真到真实(Sim-to-Real)结果

当然,这条路线仍处于早期阶段,复杂交互、多物体场景和动态环境依然存在大量挑战。但 HSImul3R 已经给出一个重要方向:机器人从人类视频中学习的,不应只是“人看起来怎么动”,更应该是这个动作为什么能够在真实物理世界中成立。从视觉重建到可仿真重建,从人体动作到人—场景交互,再从真实世界到仿真、最终回到真实机器人,HSImul3R 正在推动人类视频从视觉信息进一步转化为可仿真、可学习、可执行的机器人技能资产。

更多热门内容
OpenAI再突破:ChatGPT Sites公测,GPT-6频谱识音开启AI新纪元
传统软件SaaS的核心壁垒是「我们把代码封装成了好看的按钮供你点击」,而大模型的降维打击是:你只要张嘴说话就行。而且,就在今天,AI研究员ChrisGPT和Max Rubin公布的一组测试,让无数音频工程…

2026-09-08

以法治为笔 绘就人工智能健康发展蓝图 守护你我合法权益
意见明确,针对同一商品或者服务,经营者利用算法在交易价格等交易条件上实行不合理的差别待遇,侵害他人合法权益造成损害的,人民法院应当依法认定其承担相应的侵权责任;利用人工智能“仿冒名人带货”且构成欺诈,消费者…

2026-09-08

AI赋能“中国智造”:从科技展品到外贸订单,创新产品加速走向世界
在本次科技创新展上,深圳拓竹科技有限公司展出的3D打印机吸引了不少参会嘉宾的目光。在华强北创业近二十年的李伟明深有感触:“AI应用提升智能眼镜技术含量,有了好东西,才有竞争力。”2026年初,深圳领先边端智…

2026-09-08

宇树科技再突破:世界模型驱动人形机器人首秀全自主搏击
宇树科技表示,该模型突破了世界-动作大模型在瞬时规划、决策和动态交互执行等方面的瓶颈,实现了高动态、强交互以及对未来的实时预测和规划。 王兴兴此前曾多次提出一个具身智能的“ChatGPT时刻”标准:如果在80…

2026-09-08

华沿机器人HRC平台:以20年技术积淀,为具身智能筑牢执行基石
诚然,AI大模型、强化学习大幅度提升机器人环境理解、任务规划和自主决策能力,但 AI 能力进入机器人本体后,仍然需要解决一系列底层问题:高速运动下的轨迹精度、复杂环境中的动态响应、机器人与物体接触时的柔顺性…

2026-09-08

2026人形机器人赛道大变局:从炫技表演到产业落地,分化拐点已现
这些数字合在一起看,宇树的盈利来自性价比高的标准化硬件单品+科研展演窄赛道,无跨产业复制能力,这也是其营收增速、利润增速率先见顶的核心原因;对比优必选全尺寸具身人形+多行业真实场景落地,两者商业化场景、客户…

2026-09-08

宇树科技全球首秀:世界模型驱动人形机器人全自主搏击,AI自主决策显实力
宇树说,这是全球首次实现世界模型实时驱动的全自主人形机器人格斗。这个模型突破了瞬时规划、决策和动态交互执行等瓶颈,能实时对未来做出预测和规划。视频里,机器人在单腿站立状态下出拳击打,说明动态平衡和实时决策是同…

2026-09-08

宇树科技全球首秀:世界模型实时驱动 人形机器人自主格斗成现实
来源:环球网【环球网科技综合报道】9月8日消息,宇树科技正式对外宣布,在全球范围内首次完成由世界模型实时驱动的全自主人形机器人格斗演示,同步公开了该场景下的实拍运行画面。 根据宇树科技官方披露的技术细节,…

2026-09-08

清华博士领衔千诀科技,获数亿元A+轮融资,加速机器人智能技术落地
今年3月,据千诀科技发布,在北京举办的 “中关村U30” 青年创新创业评选活动中,千诀科技创始人兼CEO高海川博士成功入选年度青年创新创业优胜者榜单。此次入选,是对千诀科技在具身智能与“机器人大脑”方向持续…

2026-09-08

杭州智能建造新篇:建筑机器人跨越实验室门槛,工地“常驻”正当时
该企业积极搭建中试服务平台,以建筑机器人为装备支撑、以人工智能为技术核心,服务智能建造研发应用,把实验室里的成果一步步推到施工场景中去。 一方面可实时掌握各项目机器人部署数量、施工面积、作业进度与智能建造产值…

2026-09-08