ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

长程智能体研究新突破:人大等高校联合发布149页全景综述

时间:2026-07-26 23:54:53来源:互联网编辑:快讯

近年来,人工智能领域的大模型技术经历了迅猛发展,从最初的单轮对话机器人迅速进化为能够处理复杂软件工程、深度信息检索、计算机操作和多模态交互的核心决策工具。然而,随着智能体能力的提升,新的问题也随之浮现:即便智能体在单步操作中表现出色,能否在成百上千次相互依赖的行动中始终保持目标明确、及时修正错误、有效管理上下文,并安全可靠地完成任务,成为新的研究焦点。

这一挑战催生了长程智能体(Long-Horizon Agents)这一新兴研究方向。长程能力被视为智能体进入真实生产环境的关键瓶颈。根据相关研究数据,在约50%的成功率下,前沿智能体完成软件工程类任务所需的“人类专家等效时长”已从早期模型的几秒钟延长至十余小时,且这一时间跨度每7个月翻一倍,2023年后缩短至约4个月,显示出智能体长程能力正处于高速扩展阶段。

值得注意的是,智能体能够长时间运行并不等同于具备长程能力。真正的关键在于能否在更长、更复杂、更真实的推理依赖链上持续有效行动。长期以来,Autonomous Agent、Self-Evolving Agent等概念常与长程智能体混淆。为理清这一局面,一项长达149页的综述系统梳理了超过900项研究、系统与工程实践,首次从“外部脚手架工程×内部模型优化”的协同演化视角,给出了长程智能体的统一定义、完整分类与未来路线图。

长程任务的难点在于单步错误的积累会导致整条轨迹失控。长程任务需要大量紧密耦合的步骤组成连贯轨迹,单步偏差在长链条中会被反复继承和放大。论文将典型失败归纳为目标漂移与误差累积、上下文腐化与窗口压力、稀疏延迟奖励与不可逆行动三类。单纯扩大参数量或上下文窗口并不能解决全部问题,模型需具备计划维护、状态持久化、工具治理、验证和恢复机制,才能在长轨迹中保持稳定。

该综述提出的核心论点是,长程智能体能力是系统级能力,源于外部“脚手架工程”与内部“模型优化”的协同演进。模型提供推理和行动策略,而脚手架工程则负责支持模型决策的执行,包括组织上下文、维护状态、调度工具、编排流程,并对关键步骤进行验证与恢复。二者共同决定智能体能否在漫长而相互依赖的轨迹中稳定前进。长程能力应被视为整个系统的属性,而非基础模型的孤立指标。

论文进一步提出了一条双向演化路径:脚手架工程先将计划、记忆、工具和验证等能力外置,用工程手段迅速拓展模型的能力边界;系统在真实交互中积累的轨迹与反馈,再通过模型优化,用数据/环境构造、微调、强化学习、蒸馏和自进化等策略逐步沉淀到模型内部。模型变强后,又能驾驭更复杂的脚手架,形成持续循环。

论文不以“运行时长”作为长程任务的唯一标准,而是考察任务是否包含大量相互依赖的逻辑决策,以及这些依赖需要跨越多大的执行边界。为此,提出了H1-H3三层任务与C1-C3三层能力的阶梯框架。任务层级包括窗口内任务、跨窗口/跨会话任务和跨任务流;能力层级包括交互式推理、状态与记忆和经验积累。三个能力层级相互关联,C2以C1为前提,C3建立在C1与C2之上。

综述将大模型系统的演进概括为三个阶段:Prompt Engineering阶段通过指令、思维链等提示策略引导模型在单次调用中产生更可靠的推理;Context Engineering阶段系统开始主动组织检索结果、工具返回等上下文;Runtime Harness阶段控制面扩展到智能体运行脚手架,管理工具、记忆、工作流等,使智能体演化为可持续运行的系统。这一演进解释了为何当下的智能体竞争越来越像系统工程竞争。

为将碎片化的智能体研究放入统一坐标系,综述从六个视角构建了六维图谱,将分散在记忆、工具学习、多智能体等方向的工作放入同一张图谱。其价值不仅在于列出更多论文,更在于回答每项改进究竟发生在哪里,是基础策略更强,还是脚手架更完善;是提升单窗口推理,还是解决跨会话状态;是任务成功率更高,还是成本和安全边界得到改善。

脚手架工程被拆分为六个相互连接的核心组件,覆盖从目标设定到最终交付的完整生命周期:循环与工作流负责任务分解、追踪子目标;上下文与记忆执行丢弃、压缩和选择;工具、MCP与技能连接外部能力;编排管理多个模型或智能体的协同;Hooks与中间件执行规则、权限、监控与安全策略;验证检查正确性、安全性和目标一致性。脚手架承担的是长期执行中的状态机、控制器和安全边界。

内部模型优化解决的是如何让策略本身越来越适合长程任务。综述沿完整训练链路梳理了七类方向:架构底座使长轨迹可表示、可训练;任务、环境与轨迹合成构建规模化交互环境;预训练与中期训练注入推理先验;微调让模型逐步面对更长、更难的任务;智能体强化学习处理长轨迹中的信用分配;On-Policy Distillation从模型自己生成的分布中学习;自进化探索智能体与环境共同演化。训练数据需包含真实的环境反馈、过程状态、工具结果与错误恢复轨迹。

论文按智能体与环境交互的接口,将实践形态归纳为五类:软件工程智能体理解大型代码仓库,维护跨文件计划;信息检索智能体执行深度或广度搜索,整合多源证据;计算机操作智能体在浏览器、桌面和移动端持续感知界面状态;多模态智能体在图像、视频、音频等高成本信息中主动选择观察对象;通用智能体面向个人助理、具身系统和生产力任务,在多工具、多环境和长期目标之间切换。评测需从一次性问答升级为“面向时间跨度的评测”。

论文将开放问题归纳为四个轴、九个具体方向。随着任务跨度继续增长,研究重点将从“能不能跑起来”转向“能否长期有效、经济并且可信地运行”。包括泛化与持续学习、进入真实环境、学会花预算、可恢复且可治理的自治等方向。生产环境中的安全与权限边界主要落在脚手架工程中,模型侧对齐必要但不充分,真正决定工具调用、行动审批、经验复用的是运行时控制层。

更多热门内容
两万元内情感机器人现身,科技助力生活却难替代人类真挚情感
据了解,这款机器人目前市场均价在1.58万元至1.68万元之间,上下浮动约一千元,核心功能集中在面部表情和触觉交互,专注于为人类提供情感陪伴。现实是,即便机器人真的能做到这一点,也无法替代真实的人类情感与互动…

2026-07-26