ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

智元WITA-Omni登顶DailyOmni:人形机器人交互从“生硬”迈向“自然”新篇

时间:2026-07-29 12:49:52来源:快讯编辑:快讯

在科技飞速发展的当下,人形机器人正逐渐从实验室走向实际应用场景,然而,交互生硬的问题却如同一道难以跨越的沟壑,阻碍着它们真正融入人类生活。近日,具身全模态理解权威榜单DailyOmni公布了最新评测结果,智元自研的WITA - Omni Preview以85.21分的综合成绩一举登顶,超越了千问、Gemini、豆包、英伟达等18款国内外主流模型,在八项细分指标中更是斩获六项第一,这一成绩为解决人形机器人交互难题带来了新的曙光。

在人工智能领域,大模型榜单层出不穷,但DailyOmni榜单却独树一帜。常规的多模态榜单多聚焦于图文问答,主要考验模型对图片内容的识别以及文字问题的回答能力,更适用于线上内容消费场景。而DailyOmni的测试集则大量采用开放环境的真实音视频素材,着重考核模型三个关键能力:能否将画面中的人物与声音精准对应,能否理清事件发生的先后顺序,以及能否结合视听信息进行跨模态推理。这就好比普通榜单考的是“看图说话”,而DailyOmni考的是“察言观色”,更贴近真实社交场景中人类所需的感知能力,也是人形机器人在家庭、工厂、公共服务等场景中最为刚需且欠缺的感知基础。

过去,模块化机器人方案存在诸多弊端。视觉、语音、决策分属不同模块,数据在多个系统间流转,不仅延迟高,还常常出现“声画错位”的现象。例如,画面中的人已经移动到左边,语音识别却还停留在上一个指令,机器人的反应总是慢半拍。在多人同时说话的场景下,机器人更是难以精准定位交互对象,经常答非所问。DailyOmni榜单也因此被业内视为具身智能感知能力的“试金石”,智元WITA - Omni能够登顶,意味着在机器人急需的视听时序理解能力上占据了领先地位。

WITA - Omni之所以能在时序推理方面表现出色,关键在于它采用了面向具身场景的三层架构:Thinker(思考) - Talker(说话) - Actor(动作),跳出了“把聊天大模型装进机器人”的传统思路。以往的机器人交互如同一条流水线,视觉模块处理画面,语音模块转写文字,大模型生成回答文本,最后运动控制模块转化为肢体动作和表情。各环节依次进行,前一步未完成,后一步就无法启动,不仅延迟高,各模块还容易“配合失误”,导致交互生硬。而WITA - Omni将感知、决策、表达整合到同一个端到端模型中,共享同一套认知状态。Thinker作为核心,将视觉、音频、文本统一映射到同一语义空间进行联合推理;在此基础上,Talker流式生成语音,Actor同步输出动作和表情,三者并行推进,共用同一时间轴,实现了“边想边说,边说边动”,与真人聊天状态更为接近。比如用户呼唤机器人名字时,它能一边顺着声音方向转头,一边开口应答,眼神和动作同步跟上;讲解物品时,手指指向位置和嘴里说的内容精准对应,避免了“指东说西”的错位感。这种一体化设计有效解决了行业长期存在的“交互割裂感”,在多人对话场景中,模型能通过声画同步判断说话者和目光方向,从而确定回应对象,不再对着空气作答;在持续交互中,也能判断何时倾听、何时插话,更符合人类社交习惯。

同样是多模态大模型,为何专门做具身的在时序交互上更具优势?答案在于数据和训练方法。普通公开音视频数据集大多仅标注画面和语音内容,如“说了什么、发生了什么”,却不会标注“何时回应、对谁回应、做什么表情动作”。用这类数据训练出的模型虽能答对问题,却不懂交互的“分寸感”,如同只会背书却不知聊天时机的人。为解决这一问题,智元构建了一套以人为中心的全模态数据集,完整保留真实交互场景中声音、画面、语言、动作、表情之间的时序关系,将人类社交的“节奏”融入训练数据。在此基础上,模型采用三阶段训练策略:先用监督微调打基础,让模型学会基础视听理解和表达;再用同策略蒸馏方式,使模型在“有额外信息辅助”和“无辅助”状态下对齐,提升复杂上下文推理精度;最后用强化学习优化交互决策,奖励信号不仅包括“答案正确”,还涵盖时间点、交互对象、是否主动回应等社交维度指标。这相当于教人社交,不仅要教说正确的话,还要教察言观色、把握时机,这也是WITA - Omni与普通全模态模型的核心区别,其训练目标从“回答准确”升级为“交互自然”。

随着人形机器人运动能力逐渐成熟,行业竞争重心正从“走得稳、抓得准”向“交互自然、融入人类场景”转移。此前在WAIC 2026上,多家厂商展出的人形机器人虽能完成行走、抓取、搬运等动作,但人机交互仍显生硬,多数停留在“指令 - 执行”初级阶段。不过,高质量具身交互训练数据稀缺仍是行业瓶颈。智元千小时级的专项数据集虽覆盖典型交互场景,但面对家庭、工厂等复杂多变的真实环境,数据的丰富度与泛化性还需在实际落地中持续扩充。

智元WITA - Omni登顶榜单,释放出一个重要行业信号:具身智能竞赛已从单维度运动能力比拼进入综合交互能力下半场。如今主流产品运动能力已达可用门槛,接下来谁能让机器人更自然融入人类环境,谁就能获得下一阶段入场券。从全球范围看,特斯拉Optimus、Figure 01等产品都在加速端到端多模态交互研发,试图让机器人从“执行命令的工具”变为“能协作的伙伴”。智元此次在具身全模态榜单上领跑,表明中国厂商在具身认知算法层面已进入全球第一梯队。对智元自身而言,WITA - Omni是其“三智一体”架构中交互智能的核心底座,后续将与运动智能、作业智能联动,支撑机器人在更多场景落地。但从榜单成绩到真实商用,还有漫长的工程化路径要走,算力成本能否降低、真实场景稳定性能否达标、量产时体验能否一致,都是比跑分更现实的考验。

更多热门内容
奥普特拟募资12.7亿加码机器人赛道,多项目布局助力工业智能化升级
近日,国内机器视觉龙头奥普特发布公告称,拟向不特定对象发行可转债拟募集资金总额为人民币12.70亿元,扣除发行费用后的募集资金净额投向四大板块,分别为工业3D视觉传感器及智能硬件扩产建设项目,AI智能视觉解…

2026-07-29

付航化身REDMI新品体验官 8月1日ChinaJoy骁龙馆现场开箱试玩新机
【CNMO科技消息】7月29日,小米手机部总裁@卢伟冰 宣布,脱口秀演员付航将担任REDMI新品体验官,并于8月1日亮相ChinaJoy,对一款尚未公布名称的重磅新品进行现场开箱和试玩。官方预热文案以“魔王空…

2026-07-29

2026下半年新机大战一触即发!华为Mate90、iPhone18、小米18谁将领跑高端市场?
一份 2026 下半年重磅新机热度排行榜新鲜出炉,排名顺序引发数码圈热烈讨论:华为 Mate90 系列稳居榜首,iPhone18系列位列第二,小米 18 系列拿下第三名。小米 18 系列承担冲击高端市场、…

2026-07-29

华为新品发布会前瞻:尊界豪车亮相,nova新机配置猛料十足
要说更值得关注的,必须有过两天的小米鹏程大 SUV 新车、还有预热已久的荣耀 Robot Phone 、华为全场景新品集中发布等等。畅享系列的实力也是愈发强劲了,4 月上市的华为畅享 90 Pro Max…

2026-07-29

智元WITA-Omni登顶DailyOmni榜单 引领人形机器人交互迈向自然新境界
不同于常规图文大模型榜单,这份侧重音视频时序推理与声画联动的评测,直指人形机器人交互生硬的核心痛点,也让行业看到了具身交互从“能用”走向“自然”的可能。 为了解决这个问题,智元构建了一套以人为中心的全模态数…

2026-07-29

渴创Keychron开源G6 HE鼠标3D模型,创新电磁光学按键微动引关注
IT之家 7 月 29 日消息,渴创(Keychron)昨日(7 月 28 日)在 X 平台发布推文,宣布在 GitHub 上开源尚未发布的G6 HE 鼠标的 3D 模型。 IT之家曾于 7 月 25 日报…

2026-07-29

华为9月双箭齐发!三折叠新机与Mate 90系列硬刚苹果,高端市场激战在即
目前市场上能量产三折叠手机的厂商仅有华为与三星,而三星暂无9月发布新品的计划,由此确认,华为新一代三折叠新机与Mate90系列,将集中在9月登场,恰逢苹果秋季新品发布会周期,两大高端品牌将迎来正面交锋。 …

2026-07-29