近年来,大模型技术持续突破,推理成本显著降低,智能体部署的门槛也随之下降。越来越多的企业开始探索让AI从“回答问题”转向自主处理业务流程,智能体因此成为大模型落地的重要方向。然而,尽管技术进步迅速,产业应用却未能同步跟上。许多智能体项目仍停留在演示阶段,真正能够稳定投入生产环境的案例并不多。为何模型能力不断提升,智能体距离大规模应用仍有差距?针对这一行业关注的焦点,记者专访了香港中文大学(深圳)数据科学学院助理教授王本友。
王本友主导研发的医疗大模型华佗GPT已在深圳多家公立医院和社康医院部署,并在真实临床环境中持续运行,这为他积累了丰富的落地经验。他指出,当前智能体的发展可以用“局部能力足够强,整体系统仍脆弱”来概括。这一现象被他称为“锯齿状智能”,即模型能力分布不均衡,可能在复杂任务中表现优异,却在简单问题上犯错。这种反差容易让用户误以为模型已具备全面可靠的能力,而忽视其短板。
王本友认为,智能体的“能力不均衡”首先体现在推理能力上。在目标明确、信息充分、结果可验证的任务中,大模型已达到较高水平,例如代码生成、数学推导和文档处理等场景。然而,当任务目标模糊、背景信息不完整或涉及隐性规则时,模型仍可能给出逻辑严密但不可靠的答案。相比之下,规划能力更依赖环境反馈。当前智能体的规划能力在短流程任务中表现较好,但在长流程任务中容易出现目标漂移、上下文遗失和错误累积等问题。
系统能力是智能体落地的关键。王本友强调,智能体不能仅依赖模型自身完成任务,还需借助工具获取环境反馈并调整行动。工具不仅让模型能够访问数据库和执行代码,更重要的是提供真实反馈,成为决策依据。他以Claude Code、Codex等产品为例,指出它们之所以在软件开发场景表现突出,是因为提供了完整的运行环境,包括代码库访问、文件编辑和测试反馈等。
王本友认为,智能体交付给用户的能力是模型、工具、上下文、验证机制和运行环境共同组成的系统能力。一次成功的演示并不能证明智能体适合生产环境,真正的考验是系统在面对输入变化、工具异常和复杂边界情况时能否持续稳定运行。因此,产业关注的重点应从提升模型能力转向构建可靠的运行闭环。
限制智能体规模化落地的最大瓶颈已不再是模型“会不会做”,而是系统能否在模型出错时及时发现、控制影响并重新尝试。王本友解释道,多步骤任务的可靠性是乘法关系,假设每一步正确率达99%,连续执行50步后,整条链路一次性全部正确的概率仅约60%。解决这一问题的关键是在具体场景中建立闭环工程,包括观察当前状态、执行操作、验证结果、回滚错误和明确停止或人工接管条件。
然而,许多现实场景缺乏天然反馈机制。例如,城市治理、医疗和制造领域的结果可能需要数小时甚至数月才能显现,操作涉及多个系统和部门,有些错误甚至不可逆。王本友指出,在这些场景中,仅更换更大模型无法解决问题,必须将开放、混乱的现实流程改造成可观察、验证和控制的局部闭环。智能体规模化落地本质上是一个环境工程问题,即如何将真实世界的模糊反馈转化为模型可理解的机器反馈。
对于想引入AI智能体的传统产业企业,王本友建议进行反事实检验:假设没有AI,业务问题是否仍值得投入资源解决。如果答案是否定的,项目可能源于AI焦虑而非业务需求。真正适合AI的场景通常在AI出现前就存在痛点,如流程重复、人工成本高、响应慢或知识分散。场景需具备输入输出数字化、系统和数据可访问、成功标准可定义等基础条件。
王本友提醒,如果流程本身缺乏标准、数据未治理、系统未打通,首先应进行流程梳理、数据治理和工具接口建设,而非直接部署智能体。对于考虑自研大模型或智能体的垂直行业企业,他建议优先选择具体业务流程,如识别异常订单或完成设备故障排查,而非宽泛的行业。企业应优先建设五类资产:任务完成标准、模型可调用工具、场景知识和上下文、评测集以及权限和回滚机制。这些能力共同构成智能体运行的驱动框架。
尽管对当前智能体的发展瓶颈保持冷静判断,王本友对AGI(通用人工智能)的未来持乐观态度。他提到,Claude Code、Codex等产品已能在软件开发等真实场景中持续调用工具并根据反馈修正方案,这让他对AGI的判断发生变化。他认为,如果将AGI定义为在相当比例的知识工作和数字化任务中达到或超过普通人水平,那么其到来时间可能比预期更早。在软件开发、数据分析和研究辅助等领域,未来三到五年内出现AGI级别能力的可能性已非常高。
王本友认为,2026年将是中国AI智能体从模型能力竞赛转向闭环工程和规模化交付的分水岭。AGI不会一次性、均匀地降临,而是会先在边界清晰、工具完备、结果可验证的场景中以“局部AGI”形式出现。随着产业竞争重心从模型能力转向系统能力,AI智能体也将真正从技术突破迈向规模化应用的新阶段。