在人工智能与机器人技术深度融合的进程中,如何让机器从“看懂世界”转向“精准行动”,成为行业突破的关键瓶颈。传统视觉语言模型虽能识别物体、理解指令,却难以解决三维空间定位难题——机器人可以“看到”桌上的杯子,却无法判断杯柄的精确位置;能识别出操作目标,却无法规划机械臂的运动轨迹。这种“数字认知”与“物理执行”之间的断层,正被一款名为SpatialPoint的空间智能模型逐步填补。
由视启未来(深圳)科技有限公司联合清华大学、粤港澳大湾区数字经济研究院共同研发的SpatialPoint,通过融合RGB图像、深度信息与自然语言指令,构建了一套统一的空间推理框架。该模型将机器人执行任务所需的空间信息抽象为两类核心点位:实点(Touchable Point)对应物体表面可接触位置,如抓取杯柄、按压按钮;虚点(Air Point)则标记自由空间中的操作区域,如物体放置点、机器人导航路径。这种分类方式使复杂任务被简化为实点与虚点的组合,为机器人提供了通用的行动接口。
技术突破体现在四大创新维度。首先,模型在传统视觉输入基础上增加深度编码网络,通过RGB-D传感器获取的深度数据构建真实三维场景;其次,将图像、深度与语言信息纳入统一序列进行协同推理,避免多模块独立运算导致的误差累积;第三,直接输出结构化三维坐标,省去了传统方案中坐标转换的复杂流程;最后,通过实点-虚点任务分类,将抓取、放置、导航等动作统一为空间定位问题,显著提升系统泛化能力。以“将水杯从餐桌移至茶几中央,再导航至玄关”为例,SpatialPoint可一次性完成场景识别、空间关系计算与操作点匹配,而传统方案需依次调用视觉识别、抓取规划、路径规划等多个独立模块。
实测数据显示,该模型在实点任务中展现出显著优势:有效操作位置准确率达79%,三维距离预测误差仅17.2毫米,较纯RGB方案提升超30倍;在虚点任务中,模型训练3轮后方向识别正确率达50.71%,5厘米范围内定位成功率33.47%。这种精度提升直接转化为工业场景中的效率革命——在柔性抓取任务中,机器人可根据工件实际形态自主规划抓取点;在物流分拣中,系统能动态调整物品放置位置以适应不同包装尺寸;在人机协作场景中,机器人可实时感知人员位置变化并调整运动轨迹。
“SpatialPoint的价值不仅在于定位精度,更在于重构了机器人信息处理范式。”视启未来创始人张磊指出,传统工业机器人依赖固定工位与预设程序,面对产线变更时需重新编程调试,导致设备柔性不足。而SpatialPoint通过视觉感知与语言指令的动态解析,使机器人具备“现场理解”能力,可自主适应SKU更替、物料位移等变化。这种能力在粤港澳大湾区的产业环境中得到充分验证——该区域密集的电子制造、汽车装配、仓储物流场景,为模型提供了多元化训练数据,助力技术团队构建“模型-机器人-真实环境-数据反馈”的闭环优化体系。
目前,SpatialPoint已完成多场景机器人部署验证,其技术架构支持与各类机器人本体解耦。无论是机械臂、移动机器人还是人形机器人,只要配备RGB-D传感器,均可通过上层空间智能模块获得场景识别、指令理解与空间定位能力。这种“算法大脑+硬件本体”的协同模式,正在推动工业制造向柔性化、智能化转型。在某家电企业的产线改造中,搭载SpatialPoint的机器人实现了不同型号产品的混线生产,换型时间从2小时缩短至15分钟,设备综合利用率提升40%。
尽管技术突破显著,但从实验室到产业化仍面临挑战。张磊坦言,真实场景中的光照变化、物体遮挡、传感器噪声等问题,要求模型具备更强的鲁棒性;同时,需进一步优化计算效率以满足实时性要求。为此,团队正与制造业、物流业伙伴开展深度合作,通过真实场景数据持续迭代模型。在仓储物流领域,SpatialPoint已实现动态避障与多机协同导航;在零售服务场景中,机器人可根据顾客指令自主完成商品抓取与交付。这些应用不仅验证了技术的商业价值,也为物理人工智能的进化积累了关键数据。
随着技术成熟度提升,SpatialPoint的产业化路径逐渐清晰。团队计划通过模型API、SDK等方式输出基础能力,同时针对不同行业开发定制化解决方案。在工业制造领域,重点解决柔性抓取、精准装配等痛点;在仓储物流领域,优化动态分拣与路径规划效率;在零售服务领域,探索人机自然交互新模式。这种分层推进策略,正在构建连接基础模型、机器人平台与行业应用的生态体系,为物理世界智能化提供核心基础设施。

