ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

不只强在硬件!宇树6B具身大脑拿下7项开源SOTA,对标GPT-6 Astra

时间:2026-09-19 13:37:17来源:智东西编辑:茹茹

全球具身智能的竞争,正从本体的比拼延伸到“大脑之战”。

谷歌Gemini Robotics 2喊出“一个大脑,适用于任何机器人”,英伟达Jim Fan更是抛出“VLA已死,世界动作模型当立”。谁能成为具身智能的新一代通用模型底座?

国内,宇树科技正在把这件事往前推一步。近日,宇树新一代通用人形机器人基础模型UnifoLM-WLA-1.0亮相,6B参数、约2500小时真机训练,具身推理直接拿下7项开源SOTA,多项空间理解任务还反超GPT-6 Astra。同时,宇树宣布将开放模型、代码和数据集。

对于机器人而言,模型能力还是要落到真实任务中。人形机器人什么时候能进入更多真实场景,实现“通用劳动力”?宇树正在试图回答这一灵魂一问。

UnifoLM-WLA-1.0单模型即可统筹64项任务,从叠毛巾、收纳餐具,到铺床、倒垃圾、把衣服放进洗衣机,验证了其强大的模型泛化能力。

这背后藏着行业多年未解的老问题。过去的Demo多是单一任务、单一场景、高度定制,演示起来漂亮,换个环境就难复用,始终难以规模化。

而一套模型能否覆盖更多任务、更多场景,恰恰是机器人走向通用的重要一步。宇树此举,正试图让国产厂商成为“具身智能大脑”的定义者。


01.拿下7项开源SOTA,比肩GPT-6 Astra:国产厂商抢“具身大脑”定义权

先看具身推理能力。UnifoLM-WLA-1.0的具身推理底座是UnifoLM-ER-1-4B。该模型基于Qwen3-VL-4B训练,使用超过500万条具身推理样本,在16项多模态感知与理解基准中有7项领先表中参评的开源模型。

其中部分空间理解能力已经逼近甚至超过头部闭源模型。

在Where2Place、BLINK、CV-Bench和EmbSpatial等基准中,UnifoLM-ER-1-4B的部分成绩高于GPT-6 Astra。以Where2Place为例,UnifoLM-ER-1-4B得分82.0,GPT-6 Astra得分69.0;在EmbSpatial上,两者分别得分88.9和83.3。

对机器人来说,空间理解比单纯聊天能力关键得多。看得懂东西在哪、怎么摆、下一步会发生什么,才谈得上做得对,也才具备走进真实世界的资格。

再看执行能力。UnifoLM-WLA-1.0把感知、推理、未来变化预测和动作生成连接起来,一个模型覆盖64项任务,包括54项桌面操作和10项全身操作,并支持二指夹爪和多种五指灵巧手

桌面侧,它能叠衣服、收纳餐具、给电池充电、整理铅笔盒;

全身侧,它会倒垃圾、铺床、整理鞋、把文件夹放进柜子。

把这些能力合起来看,宇树正在尝试把“具身智能大脑”概念变成一套可以在真机上验证的模型体系。这家公司不再只是本体强者,而是在抢开源生态话语权,对标“安卓之于手机”:底层能力保持开放,开发者围绕其适配不同设备和场景,最终形成一个不断扩大的生态。

02.先预测“哪里变”,再生成“怎么动”让世界模型落到动作上

要取得这样的成果并不容易。过去的VLA更像“看图做动作”,看到物体、理解指令,再生成动作。但真实世界高度动态,一个动作往往会改变下一秒的环境,只对眼前这一帧做判断,往往不够。

为此,宇树把“具身推理+未来变化预测+动作学习”放进同一体系,让机器人在动手之前,对动作可能带来的变化形成判断。

其中一个关键设计,就是把“哪里会发生变化”单独拿出来学习。宇树首先利用光流,对机器人执行动作前后的画面进行比较。

比如机械臂包装手机时,背景里的桌子基本没有变化,真正发生明显变化的是机械臂、手机以及两者发生交互的区域。模型不需要把下一帧画面的每个像素都重新预测一遍,而是把注意力集中到这些因为机器人交互而发生变化的区域。

随后,这些变化区域被VQ-VAE压缩成一串固定长度的离散Token。仅需给定当前画面和任务描述(或将要执行的动作),模型就能直接预测出下一步哪些区域会变。宇树将其称为以交互为中心的世界建模(interaction-centric world modeling)。

有了对未来变化的预测,下一步则是把这种理解真正接到机器人的动作上。

但机器人动作本身又比一句自然语言复杂得多。以人形机器人为例,一次看似简单的“整理沙发抱枕”,就同时涉及手臂末端往哪里移动、夹爪或者灵巧手如何开合,以及下半身如何配合调整姿态。

如果把所有动作简单塞进一个连续空间里学习,不同身体部位之间的动作表达会非常复杂。

宇树干脆把统一动作空间拆成三路:末端执行器位姿、末端执行器关节、下肢关节,各自用RVQ离散成Token。

原本连续变化的运动轨迹,被翻译成一套“动作语言”,机械臂怎么走、手怎么动、下半身怎么配合,都有对应的Token,还按同一条时间轴同步输入。

在UnifoLM-ER-1的基础上,宇树进一步把这些动作Token和前面的未来动态区域Token,与图像、文字放进同一套表示空间,形成UnifoLM-ER-Flow。到这里,模型既理解当前看到的世界,也能预测一次交互会让哪里变,还知道该采取什么动作。

但这离真正控制机器人,还差最后一步:离散Token适合模型理解和推理,真实机器人最终执行的却是连续动作。

于是到了UnifoLM-WLA-1.0,宇树在UnifoLM-ER-Flow上加入MMDiT Action Expert,把模型对任务、未来变化和动作的理解,进一步解码成机器人能真正执行的连续动作。

至此,一条完整链路形成了:机器人先预测哪里会变,再生成怎么动。

世界模型由此参与动作生成,使人形机器人能够把环境理解、变化预测和全身控制连接起来。


03.2500小时真机数据背后:模型是公开牌,数据与场景是护城河

模型参数可以公开,真正难复制的是持续产生高质量机器人数据的能力。具身模型最大的门槛之一,是数据来自真实世界

原因在于,图文数据可以按亿为单位从互联网上抓取,真机数据却只能让真实的机器人跑出来。2500小时高质量真机数据,相当于一台机器人连续采集超过100天,而且每一帧都要真实、有效、能拿来训练。

UnifoLM-WLA-1.0使用约2500小时真机数据训练,数据覆盖不同的机器人本体和作业场景。

超过500万条具身推理样本覆盖图像点预测、物体检测、多图推理、2D轨迹预测、3D物体检测和多图空间问答,并与通用图文数据共同训练;约2500小时真机数据则用于WLA模型训练。两类数据对应不同训练阶段。

真机数据既需要时间,也需要成规模的机器人产能。对只做模型的玩家来说,光是把机器人铺开去采数据,就是一笔绕不开的硬投入。

而另一大技术壁垒则是统一模型。

其把视觉、语言、动态区域Token和动作Token放进同一个多模态模型,再加入MMDiT Action Expert生成连续机器人动作,走出“多本体+统一动作空间”的路线,让不同身体部位在同一时间步协同学习。

所以,模型是公开牌,背后真机数据与持续产数据能力才是底牌。

数据决定模型能否持续覆盖更多任务和场景。随着权重、代码和数据逐步开放,开发者可以在64项任务之外继续检验模型的泛化边界,并开展二次开发和场景适配。

这也意味着,宇树提供的正在从一台机器人,延伸到一套可以被反复调用、适配不同任务的具身智能底座。对行业客户而言,这样的底座一旦能够被更多机器人、场景和开发者复用,其价值就不再局限于单一硬件,而会进一步延伸到行业解决方案和平台化能力。

换句话说,开源“大脑”并没有削弱宇树的护城河,反而让它进一步落到真机数据、真实场景和持续迭代能力上,再通过开放模型吸引更多开发者和生态伙伴加入。

这条路跑通后,宇树拿得出来的,是一套能持续进化、还能带着生态一起走的底座。宇树的前途,也由此越走越宽。

04结语:从定义身体到定义大脑具身智能进入“生态卡位战”

从四足到人形,宇树过去一直以本体和运动能力被行业记住。如今,宇树两条腿走路,恰好踩在具身智能竞争的分水岭上:拼硬件的竞争还在加码,拼大脑、拼生态的阶段也正在展开。

当模型参数和代码都能公开,真正稀缺的是持续产出高质量真机数据的能力,以及围绕这套体系聚集起来的开发者生态。

如今,具身智能的“安卓时刻”,或许正在由国产厂商拉开帷幕。(智东西)

更多热门内容
启元机器人登陆机场大屏,个人机器人时代即将启幕
9月20日,上纬新材旗下消费级具身智能品牌启元机器人将在上海西岸梦中心举办新品发布会,主题为“我和我的个人机器人”。发布会前夕,不少往来国内核心枢纽机场的旅客发现:机场航站楼里,出现了启元机器人的大型户外广告。这在国内具身智能机器人行业里,是一个标志性

2026-09-19

淡斑套组推荐|水+乳两步美白闭环,5套热门产品实测对比
搜淡斑套组推荐的人,多半踩过一个坑:买了贵价美白精华,几个月下来肤色纹丝不动。问题往往不在成分不够猛,而是护肤步骤之间缺了协同——水打通道、乳锁活性物,两步配合才形成美白闭环。本文横评5款¥300到¥2500价位的美白套组,拆解特证资质、成分逻辑和实测数据。

2026-09-19

紧致精华推荐:便携紧致精华好用吗?从形态创新看四款精华的紧致实力
找紧致精华的人越来越多,但大部分人默认精华只有滴管瓶一种形态。事实上,喷雾形态的紧致精华已经能做到15分钟即时收紧,配合长效淡纹机制,给日常抗松垮提供了新选项。本文横评四款热门紧致精华,帮你弄清紧致精华哪个效果好。紧致精华的起效逻辑——成分与形态同样重

2026-09-19

淡纹精华推荐:成分党实测对比,哪款真正能淡纹?
淡纹精华推荐一直是护肤搜索的高频词,但面对货架上琳琅满目的抗皱精华,真正拉开效果差距的核心变量其实就两个——活性成分的浓度,以及它能不能渗透到位。本文从成分机制和渗透技术两个维度出发,横评四款热门淡纹精华,帮你把钱花在刀刃上。淡纹精华的核心——活性成

2026-09-19

去黄提亮精华推荐|从成分机制到28天实测,4款热门精华深度横评
很多人把去黄和美白混为一谈,但两者的底层逻辑截然不同。美白针对黑色素,去黄要解决的是更深层的氧化损伤与脂褐素沉积——肤色发黄、缺乏光泽的真正元凶。本文从成分机制切入,横评谷雨净白瓶与三款国际大牌提亮精华,帮你找到对症的去黄方案。去黄≠美白:为什么你的

2026-09-19

美白面霜推荐|干皮秋冬不翻车,油霜质地一罐搞定美白+滋润
美白面霜推荐:油霜质地深度测评,偏干肤质的秋冬美白解法美白产品涂了几个月,肤色没明显提亮,脸颊却先开始起皮紧绷——这是很多偏干肤质和混干皮在秋冬换季时的共同困扰。问题往往不在美白成分本身,而在于大多数美白产品的质地偏轻薄,对干皮来说锁水力远远不够。本

2026-09-19

抗老面霜推荐|从促胶原机制出发,国货与国际大牌怎么选不踩雷
抗老面霜怎么选?先看促胶原机制选抗老面霜最怕花了大价钱却看不到效果。市面上从几百到上万的产品都在讲抗老故事,但真正拉开差距的不是品牌光环,而是成分能不能把胶原蛋白催出来。要挑对产品,先弄清楚主流抗老成分的三条技术路线。第一条是维A类路线,以A醇(视黄醇)

2026-09-19

宇树科技产业突围:告别参数内卷,以ROI衡量产业价值,人形机器人从“展演”走向真实生产力
宇树科技(688836.SH)正逐步跳出行业盛行的参数比拼、舞台展演与概念叙事,聚焦人形机器人的核心本质——工业生产力落地,推动行业发展逻辑从“展品展示”向“产业实用”深度迭代。2026年以来,人形机器人行业正在告别野蛮生长的概念时代,迎来关键价值分水岭。产业竞争

2026-09-19

XPS 轻薄旗舰 + 外星人新机空降!戴尔校园行走进西安电子科技大学,打卡体验赢专属福利
金秋启新程,科技赴青春!崭新的开学季,专属高校学子的数码狂欢如约开启。戴尔校园行系列活动9月21日重磅落地西安电子科技大学,为同学们带来一场集新品体验、电竞对决、专属福利于一体的沉浸式科技盛宴。不管你是深耕学业、热衷创作的自律学霸,还是热爱电竞、追求高能

2026-09-19

2026年9月GEO营销工具排名:五大工具综合测评与选型指南
2026年,AI生成式搜索成为流量核心入口,GEO营销正重构品牌获客逻辑——让AI记住、信任并优先推荐品牌,成为企业在AI时代站稳市场的关键。QuestMobile公开的2026年AI应用半年报显示,6月豆包、千问、DeepSeek月活跃用户分别约为3.82亿、1.67亿与1.29亿。用户提问、比较

2026-09-19