ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

浙江大学等联合研究:让AI智能体化身“经验工匠”实现跨任务持续成长

时间:2026-08-08 00:34:59来源:互联网编辑:快讯

人工智能领域的一项新突破为解决AI“健忘症”问题提供了创新方案。由多所高校与企业联合研发的SkillRise强化学习框架,通过构建可跨任务迁移的“技能手册”,使AI智能体在连续完成相关任务时能够持续积累经验,显著提升了任务处理效率。这一成果已在三个经典文字交互环境中完成验证,实验数据显示其性能超越现有主流方法,最高领先幅度达8.5个百分点。

传统强化学习模型普遍存在“任务割裂”缺陷,每次处理新任务时均需从头探索,导致学习效率低下。研究团队以手工艺人积累经验为灵感,设计出让AI在任务执行后立即总结通用规则的机制。该框架通过“任务排序-执行-总结-迭代”的闭环流程,将每个任务的处理结果转化为可复用的技能模块,形成类似工作手册的知识体系。这种设计使AI在处理后续任务时,能够直接调用手册中的通用策略,避免重复试错。

在模拟家居环境的ALFWorld测试中,SkillRise在六类任务中取得85.9%的综合成功率,较最优基线方法提升2.3个百分点。在需要同时处理颜色、尺寸等多维度条件的WebShop购物场景中,其优势扩大至7.1个百分点。更引人注目的是ScienceWorld科学实验场景的表现,该框架以54.6%的成功率领先第二名8.5个百分点,展现出在复杂决策任务中的突出能力。

研究团队通过消融实验证实了框架设计的有效性。当移除跨任务经验传递机制后,模型性能下降超过6个百分点,证明技能手册的持续更新是提升性能的关键。与需要独立记忆模块的RetroAgent和SkillRL等系统相比,SkillRise通过单一模型实现任务执行与经验总结的双重功能,在保持同等性能的同时,将计算耗时降低至前者的1/6和1/4.3。这种端到端的设计显著提升了系统实用性。

框架的核心创新在于“去实例化”经验总结机制。在处理“将番茄放入微波炉”的任务时,AI不仅记录基本操作流程,更提炼出“检查目标容器是否可开启”的通用规则。这种抽象化处理使手册内容摆脱具体场景限制,当后续任务涉及冰箱、柜子等需要开门的容器时,AI可直接调用该规则。实验显示,这种技能迁移能力使模型在序列任务中的成功率随任务数量增加持续提升,在长度为6的任务序列中达到87.5%,较长度为2时提升3.9个百分点。

模型规模测试进一步验证了框架的普适性。在17亿参数的Qwen3-1.7B模型上,SkillRise即展现出显著优势,成功率超越基线3.1个百分点。当模型规模扩大至40亿参数时,其性能提升幅度达到7.8个百分点,较基线方法的提升幅度扩大近一倍。这表明框架能有效利用大模型的参数容量,在复合型学习任务中释放更大潜力。

该研究通过独特的双阶段训练机制,将任务执行反馈与经验总结反馈解耦。AI在执行任务时接收即时奖励信号优化操作策略,而手册质量评估则依赖后续任务完成情况。这种设计避免了传统多阶段系统常见的误差累积问题,确保技能总结始终服务于实际任务需求。研究团队开发的折扣反馈机制,使近期任务对手册更新的影响权重更大,进一步提升了经验迁移的时效性。

实验数据显示,在需要三次尝试才能成功的复杂任务中,SkillRise的Pass@3指标达到61.0%,较专门优化同任务多次尝试的LaMer方法高出14.2个百分点。这证明其积累的跨任务技能不仅能提升新任务处理能力,对同一任务的多次尝试同样具有指导价值。研究团队认为,这种泛化能力源于框架对任务本质特征的捕捉,而非对表面模式的记忆。

该成果为强化学习领域提供了新的研究范式。通过将任务序列设计与经验迁移机制相结合,SkillRise展示了在不依赖模型规模扩张的前提下提升AI智能水平的有效路径。其简洁高效的架构设计,为开发适用于复杂现实场景的通用人工智能系统提供了重要参考。相关技术细节已通过论文编号arXiv:2607.26784公开,供学术界和产业界进一步研究验证。

更多热门内容
OpenAI更新ChatGPT模型:付费用户享精准回答,免费用户畅聊无忧
当地时间8月6日,OpenAI宣布更新ChatGPT模型体验,提升GPT-5.6Sol在事实准确性、回答聚焦度和多场景一致性方面的表现,同时扩大免费用户对GPT-5.6 Luna的访问权限。 OpenAI…

2026-08-07

OpenAI新动向:全新预训练大模型Astra最快下周登场,多项能力引关注
【太平洋科技】据 IT 之家报道,8 月 6 日,消息源 @synthwavedd 在社交平台 X 发布爆料信息,OpenAI 全新大模型Astra 有望最快于下周正式推出,该模型内部研发代号为 mew…

2026-08-07

DeepSeek V4 Flash受关注后将涨价,性能强成本低但容量体验待提升
舆论普遍认为,DeepSeek价格远低于海外闭源模型,但性能却能接近,这意味着其对大部分模型画出了一条“斩杀线”。也有网友发文表示:DeepSeekV4 Flash官方API上午几乎不可用,和Kimi K3…

2026-08-07

美国科研新突破:AI成功设计完整噬菌体基因组 开启生物技术新篇章
这为利用AI在全基因组尺度设计生物功能奠定了基础。美国斯坦福大学和弧形研究所等机构人员组成的研究团队利用经过数百万个天然基因组训练的生成式人工智能模型,成功设计了完整的噬菌体基因组。 研究团队表示,噬菌体是…

2026-08-07

OpenAI重大更新:免费用户享GPT-5.6 Luna 无限聊,付费版功能再升级
每月20美元或以上的Plus和Pro用户自今日起可更新至GPT-5.6Sol,该模型旨在提高事实可靠性、提供更直接简洁的回答,并新增滑块功能。 在事实可靠性方面,GPT-5.6 Luna相比GPT-5.5…

2026-08-07

OpenAI报告:ChatGPT用户超10亿,35岁以上群体使用活跃度显著提升
在使用场景方面,伴随着 ChatGPT 功能不断完善,多媒体成为增长最快场景,自 2026 年 4 月发布 ChatGPT Images2.0 以来,全球多媒体相关消息占比升至 7.8%。 在法国和捷克,…

2026-08-07