谷歌旗下DeepMind团队近日推出全新机器人人工智能系统,旨在推动人形机器人向更智能、更灵活的方向发展。此次发布的核心模型Gemini Robotics 2实现了对机器人全身动作的精准控制,能够协调行走、下蹲、抓取物体等复杂动作,并基于环境感知自主完成指定任务。这一突破标志着谷歌将Gemini系列AI技术从语言和视觉领域延伸至物理交互场景。
与以往专注于上半身控制的模型不同,Gemini Robotics 2通过整合摄像头画面与自然语言指令,直接生成机器人电机控制信号。在演示视频中,搭载该系统的Apptronik公司Apollo机器人成功完成穿越房间、避开障碍物、拿起洒水壶并放置到指定位置等连续动作。DeepMind团队强调,新系统突破了传统机器人"分段控制"的局限,首次实现全身动作的动态协调。
同步发布的Gemini Robotics ER 2模型则专注于任务规划与多机协作。该系统作为机器人的"推理中枢",能够将复杂任务拆解为可执行的子步骤,并协调多个机器人共同完成目标。例如在测试场景中,ER 2系统成功指挥机器人群体完成物品分类与搬运任务,展现出跨设备协同能力。谷歌透露,ER 2模型在安全性能上实现显著提升,能够主动识别潜在风险并拒绝危险指令。
技术测试数据显示,新系统在特定任务中已达到较高执行精度。在"拧下灯泡"测试中,机器人成功率达92%,但在处理扎垃圾袋、密封包装袋等需要精细触觉反馈的任务时,成功率仍不足40%。研究人员指出,当前机器人动作存在明显延迟,主要源于决策过程需要反复验证环境数据,这与人类凭直觉快速反应的能力形成鲜明对比。
谷歌宣布将通过AI Studio开发者平台开放ER 2模型,并向企业用户提供私人预览服务。更专业的Gemini Robotics 2和On-Device 2模型则优先向早期合作伙伴及100余家认证机构开放。目前,DeepMind已与Apptronik、Agile Robots SE、Boston Dynamics等企业建立合作,共同推进技术落地。
DeepMind机器人业务副总裁卡罗琳娜·帕拉达表示,团队目标是构建通用型机器人智能系统,使不同厂商的设备都能共享底层技术框架。但业务总监卡尼什卡·劳同时承认,实现人类级操作灵活性仍面临重大挑战。当前机器人学习效率远低于人类,需要经历数千次训练才能掌握简单技能,而人类通常只需1-2次试错即可调整行为模式。
此次发布建立在谷歌2025年推出的Gemini Robotics基础模型之上,该系统首次实现了多模态信息到物理动作的转化。值得注意的是,谷歌正重启已搁置十余年的机器人战略——Alphabet曾收购多家机器人初创公司,却在2023年关闭Everyday Robots部门。当前技术突破显示出谷歌重新布局实体机器人领域的决心,而OpenAI与英伟达等竞争对手也在加速推进类似技术研发。



