智能手机行业近期迎来一场关于人工智能能力认证的热潮,多家厂商集中宣布旗下产品通过国家人工智能终端智能化L3级认证。这场认证风潮的起点,是首批人工智能终端智能化分级测试结果的公布,共有11款移动终端产品达到L3标准,涵盖9部手机和2台平板电脑,涉及华为、摩托罗拉、荣耀、vivo、OPPO、小米等主流品牌。
厂商在宣传策略上呈现差异化表达:华为强调"首获认证",小米突出"国家级标准",vivo则将L3定义为"当前最高智能化评级"。尽管表述各有侧重,但核心均指向工信部今年5月发布的《人工智能终端智能化分级》指导性技术文件。该标准采用"2+N"架构,其中移动终端测试方法对应GB/Z 177.3—2026条款,为行业提供能力评估标尺而非强制性准入门槛。
需要澄清两个关键认知误区:首先,认证对象是具体机型而非品牌整体,某型号通过L3不意味着同品牌其他机型自动达标;其次,首批名单源于厂商主动送测,未涵盖所有AI终端产品,例如OPPO近期宣布内测的小布NEXT项目就未参与此次认证。这种特性决定了L3认证目前更多作为产品技术亮点,而非行业排名依据。
从能力维度看,该标准突破传统模型评测框架,构建起包含感知、认知、执行、记忆、学习五大维度的评估体系,细分为用户意图理解、任务规划、工具调用等14项具体能力。以"安排杭州旅行"任务为例,L1级设备仅能完成设置提醒等单一操作;L2级可查询天气、生成行程建议;L3级则需主动确认日期预算、拆分交通住宿等子任务,并记忆用户偏好如"不住早班车""靠近西湖"等信息。
实际测试要求设备在至少3个典型场景中,以不低于80%的任务完成率通过评估,单项任务限时5分钟且最多3次尝试机会。离线环境测试端侧能力,联网环境测试端云协同能力。长期记忆需覆盖用户基本信息、工具偏好等至少3类数据,但复杂推理和持续学习未作强制要求。这种设计体现"整机能力"评估理念——即便模型参数不大,只要与操作系统、应用接口形成有效协同,同样可达L3标准。
与汽车自动驾驶等级不同,移动终端的L1-L4分级聚焦任务处理复杂度而非责任划分。当前L4级标准尚处"待定"状态,核心障碍在于跨设备协同规则、责任界定机制尚未成熟。例如当手机将订票任务交给旅行智能体、预算控制转交支付服务时,如何协调车机、耳机、日历等设备更新计划,以及出现错误时的责任归属,这些问题仍需行业共识支撑。
消费者最关心的问题是:现有设备是否需要为L3认证换机?从认证名单看,华为Pura X Max、联想moto系列等机型已上市销售,说明L3设备已进入消费市场。但真正影响用户体验的是实际任务完成质量,而非证书本身。荣耀披露的路线图显示,其Robot Phone将于8月搭载AgenticOS内核,Magic9系列四季度提供尝鲜版;原生Android系统也在推进AppFunctions框架建设,计划年内发布相关能力实践。
市场研究机构Counterpoint预测,2027年生成式AI手机将占全球出货量52%,但这一数据与L3认证市场占比并无直接对应关系。对于非换机周期用户,系统更新可能带来部分L3功能;计划购机者则需关注三个核心指标:真实场景任务成功率、主流应用覆盖范围,以及操作透明度(是否支持查看、暂停、撤销操作)。毕竟,认证证书只能证明设备跨越技术门槛,而能否真正接管用户数字生活,仍需实际体验检验。