ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

从视觉到触觉:李飞飞引领AI探索,机器人“手感”时代正来临

时间:2026-08-02 12:49:27来源:互联网编辑:快讯

当李飞飞团队在2009年发布ImageNet时,人工智能领域迎来了一场革命,海量图像数据让机器首次具备了理解视觉世界的基础能力。十五年后,这位计算机视觉领域的先驱者将研究重心转向更具挑战性的领域——她提出的“空间智能”概念,正在重塑人们对AI的认知边界。这种新范式不再满足于识别图像中的物体,而是要求机器理解物体间的空间关系、动态变化以及人类行为对物理世界的影响。

今年6月,李飞飞参与的T-Rex机器人研究项目引发行业关注。研究人员通过为机械臂配备高频触觉传感器,使其能够完成翻书页、捏鸡蛋、挤牙膏等精细操作。这项突破性成果揭示了一个关键问题:要让AI真正融入物理世界,仅靠视觉感知远远不够。当机器人试图抓取桌上的杯子时,精确判断物体位置只是第一步,更需要实时感知接触力度、物体形变等动态信息,这些恰恰是传统视觉系统的盲区。

行业实践正在印证这种判断。宇树科技最新发布的G1机器人同时搭载深度相机与3D激光雷达,前者负责测量物体距离,后者构建空间地图;智元灵犀X2则采用五摄像头配置,配合触摸传感器形成多维度感知网络。这些技术升级并非简单的传感器堆砌,而是针对不同应用场景的精准补强——头部摄像头适合全景扫描,但容易被机械臂遮挡;激光雷达擅长空间建模,却无法区分杯子与苹果的材质差异。

视觉系统的局限性在真实场景中暴露无遗。今年3月的一项实验显示,当研究人员故意不向多模态模型输入图像时,部分前沿AI仍能“自信”地分析胸肺X光片,甚至在测试中取得高分。这种被称作“幻景推理”的现象,暴露出模型过度依赖语言线索和训练数据中的统计规律,而非真实的视觉理解。对于需要精确操作的机器人而言,这种“似是而非”的判断可能导致灾难性后果——机械臂可能因几厘米的定位误差而抓空,或因无法感知接触力度而捏碎物体。

世界模型领域同样面临类似挑战。当前主流的视频生成技术能够创建逼真的物理场景,但这些画面中的物体往往缺乏真实的物理属性。机器人需要知道杯子重量、柜门承重、接触面摩擦力等细节,而这些信息在传统渲染模型中往往被简化处理。World Labs的分类框架将现有技术分为渲染器、模拟器和规划器三类,指出多数模型仅停留在“绘制世界”的层面,而无法支持真实的物理交互。

行业正在探索突破路径。英伟达的Cosmos平台将世界生成、视频预测与机器人训练整合为物理AI体系,通过合成数据弥补真实场景的稀缺性。逐际动力的TRON 1仿真平台支持多种物理引擎,允许开发者在虚拟环境中测试机器人应对不同地面摩擦、物体碰撞等场景的能力。智元发布的AgiBot Digital World则通过生成操作数据来训练模型,这种“虚拟试错”模式显著降低了实体机器人的损耗风险。

触觉技术的突破为解决这些难题提供了新思路。Figure公司的Helix 02机器人整合了头部摄像头、手掌摄像头、指尖触觉传感器和全身本体感知系统,形成多模态感知闭环。当头部摄像头被遮挡时,手掌摄像头可提供近距离画面;指尖传感器能感知3克级的微小力变化,使机器人能够从药盒中精确取出单粒药片。国内厂商帕西尼则构建了从触觉传感器到人形机器人的完整产业链,将触觉数据直接融入机器人训练流程。

李飞飞参与的T-Rex研究进一步揭示了触觉融合的复杂性。研究人员发现,简单地将触觉数据输入现有视觉-语言模型效果不佳,原因在于不同感官的工作节奏存在差异——视觉处理需要时间进行全局分析,而触觉反馈必须以毫秒级响应调整操作力度。T-Rex系统因此采用异步处理架构,让视觉系统规划整体动作,触觉系统实时修正执行细节,这种分工模式使机器人在12项精细操作任务中的成功率达到65%,较传统模型提升30个百分点。

这场感知革命正在重塑AI的技术栈。从ImageNet时代的单模态识别,到如今的多传感器融合;从虚拟世界的仿真训练,到真实场景的物理交互;从被动接收视觉信号,到主动感知接触反馈——AI系统正在进化出更接近生物体的感知能力。当机器人不仅能“看”到世界,还能“感受”到世界时,它们与人类共同塑造物理未来的可能性将彻底改变。

更多热门内容