ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

GigaBrain-0.7:三系统协同赋能,让机器人操作更智能高效

时间:2026-09-04 23:33:39来源:互联网编辑:快讯

在机器人技术领域,一个核心难题长期困扰着研究人员:如何让不同形态的机器人学会通用且精准的操作技能?GigaAI团队近期发布的技术报告提出了一种创新解决方案——通过三系统协同架构,让单一模型在16种机器人平台上实现跨形态操作。这项突破性成果正在重新定义机器人大模型的发展路径。

传统VLA(视觉-语言-动作)模型存在明显局限。这类模型通常只能处理当前帧画面,如同仅凭静态照片判断故事走向,难以捕捉动作的时空连续性。更严重的是,分阶段训练方式导致视觉理解与动作生成模块之间存在信息损耗,就像让解说员与操作工强行配合手术,效果可想而知。GigaBrain-0.7通过整合理解、预测、行动三大核心能力,构建起有机协作的智能系统。

系统2作为"认知中枢",承担着任务拆解的重任。基于30亿参数的PaliGemma2视觉语言模型,它能将"整理衣物"等复杂指令转化为"捡起红色帽子"等具体步骤。这种分层规划机制类似于为机器人配备导航系统,确保每个动作都服务于最终目标。实验显示,缺乏这种拆解能力的模型在执行多步骤任务时,成功率会下降60%以上。

系统3的创新性体现在其独特的"未来想象力"。通过50亿参数的世界模型GigaWorld-1,该系统不仅能生成动作执行后的预期画面,更能自主计算任务进度值。当机器人操作盒盖时,系统能通过画面变化自动判断"盖子掉落"等异常状态,无需人工标注。这种基于视觉预测的评估机制,使机器人获得类似人类的自我纠错能力。

动作生成系统1融合了混合Transformer架构与软知识隔离技术。MoT结构允许视觉语言模块与动作专家共享注意力机制,同时保持参数独立。Soft KI技术则通过可控梯度传导,在保留语言理解能力与获得具身控制力之间取得平衡。这种设计使系统既能利用语言模型的丰富知识,又能精准控制机器人关节运动。

短期视觉记忆模块的引入解决了机器人"健忘症"问题。通过时空模块压缩历史信息,系统能记住最近数帧的关键特征。在模拟测试中,配备记忆模块的机器人成功跳出重复动作循环,任务完成效率提升40%。这种机制使机器人获得类似人类的场景记忆能力,能区分同一位置的不同访问阶段。

预训练模型展现出的零样本泛化能力令人印象深刻。在未经过任何微调的情况下,模型能在全新机器人平台上完成70%以上的复杂任务。当面对训练数据中未出现的葡萄抓取任务时,机器人仍能准确识别目标并完成操作。这种能力源于模型对操作逻辑的抽象理解,而非简单的场景匹配。

后训练阶段的数据显示,GigaBrain-0.7在语言跟随任务中的成功率达到91.5%,较前代模型提升15.4个百分点。在Maker H01人形机器人平台上,复杂操作任务的成功率更是提高30.9%。特别在食物加工等需要多阶段规划的任务中,系统3的预测评估能力使任务完成质量显著提升。

经验驱动的强化学习机制构成最后一道优化屏障。离线阶段通过优势加权回归技术,从3000小时的真实操作数据中提炼优质动作片段。在线阶段则引入人工纠正信号,专门针对扎带打结等精细操作进行强化训练。四个测试任务在经历完整训练流程后,成功率均达到100%,验证了该机制的有效性。

标准化测试进一步证明模型的鲁棒性。在RoboTwin 2.0基准测试中,模型在域随机化困难设置下取得67.9%的成绩,领先第二名8.3个百分点。RoboColiseum评测显示,其在空间推理维度上的表现尤为突出,这得益于系统3对三维场景变化的精准预测能力。

更多热门内容
GPT‑6 Astra系列大模型发布:强化智能体实操力,开启通用AI新征程
这一代产品不再局限问答文本生成,重点强化直接操作电脑软件、闭环完成复杂工作流程的智能体能力,在多项专业评测中取得亮眼成绩,同时在定价、安全对齐等方面带来新变化,引发行业广泛讨论。 在实际演示案例中,该模型可直…

2026-09-04

OpenAI宣布AGI时代来临:取代部分脑力,却难触达人类心灵深处
布罗克曼本人在多次访谈中也承认,AGI不是一个开关瞬间拨亮的灯泡,而是一条连续光谱——他个人估算当前进展约到80%,模型在写代码、跑科研流程、操作电脑桌面等任务上已逼近或超越普通人类员工,但离“像人一样理解活…

2026-09-04

2026世界动力电池大会启幕 王鹤:人形机器人具身智能或2028迎关键突破
红星资本局9月3日消息,9月3日,2026世界动力电池大会在四川宜宾开幕。银河通用创始人兼CTO、北大研究员、具身智能大模型北京市重点实验室主任王鹤表示,今年中国全行业大约有6万台人形机器人的出货量,行业处在…

2026-09-04