ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

从GLM-5到具身智能:九章智算云如何以强化学习重构AI“训推一体”新范式

时间:2026-08-18 21:03:40来源:互联网编辑:快讯

近年来,大模型领域的竞争焦点逐渐从单纯追求更大规模、更多数据和更强算力,转向探索模型能力持续提升的新路径。随着预训练边际效益递减,后训练强化学习(RL)正成为突破模型能力上限的关键技术。数学推理、代码生成、复杂决策等高阶能力,愈发依赖RL激发的持续学习能力。这种转变标志着大模型发展从“一次性训练”迈向“持续迭代”的新阶段,算法创新与AI基础设施的协同进化成为竞争核心。

强化学习通过“生成-执行-反馈-奖励”的闭环机制,使模型具备自主推理、规划和纠错能力。智谱最新发布的GLM-5.3模型验证了这一趋势:在相同基座上通过RL后训练,其在SWE-bench Pro和Terminal-Bench 3.0等基准测试中取得显著提升,核心驱动力正是面向长时序、多步骤场景的RL训练。这种变化正在重塑AI产业链分工——模型厂商不再孤立优化算法,而是与AI基础设施提供商形成深度协作,共同构建“智能持续生产”体系。

九章智算云与主流模型厂商的合作模式具有代表性。其平台通过算法与工程系统的双向RL Scaling,实现模型训练与工业级应用的闭环:模型厂商持续突破RL算法边界,基础设施方则优化算力调度、推理服务和状态管理。这种协作使GLM-5系列、DeepSeek R系列等模型得以规模化生产Token,形成“模型进化-基础设施升级-更大规模RL”的良性循环。数据显示,该模式使前沿模型的首日训练速度提升1.5倍,流量波动下的动态响应效率再提高25%。

RL系统的工程化面临独特挑战。完整RL系统包含生成器(Generator)、环境模拟器(Environment)和训练器(Trainer)三大组件,形成“生成-奖励-训练-更新”的持续闭环。与传统预训练依赖静态数据集不同,RL的训练数据由模型实时生成,这就要求训练与推理能力必须动态匹配。若生成速度低于训练消费能力,会导致算力闲置;反之则造成数据陈旧,引发策略滞后(Policy Staleness)。九章智算云通过全局动态调度技术,使生成与训练吞吐量保持高效协同,将AI调度对象从“单机GPU”升级为“模型、轨迹、状态的组合优化”。

状态资源管理成为基础设施创新的关键领域。RL运行过程中产生的上下文、KV Cache、轨迹数据和模型权重等状态资产,若被孤立存储将导致大量重复计算。九章智算云通过分布式文件系统(DingoFS)、零拷贝数据链路和分布式KV缓存(DFKV)等技术,将状态转化为可迁移、可复用的资源。例如,在Agent交互场景中,系统可自动复用已有KV Cache避免重复Prefill;模型权重更新通过高速数据路径完成,降低传输成本。这种设计使训练与推理共享统一基础设施,实现真正的“训推一致”。

技术融合进一步放大系统效能。MoE架构、推理优化、模型量化等技术,与RL基础设施形成协同效应。例如,通过分离Prefill与Decode计算负载,系统可将不同任务匹配至最优资源池;Speculative Decoding技术利用小模型生成候选Token,由大模型批量验证,显著降低串行计算开销。这些优化使单位算力的有效Token产出率大幅提升,训练与推理过程统一为“Token生产-模型进化”的连续流水线。九章智算云的实践显示,这种整合模式可使Token成本直线下降,同时提升模型迭代速度。

RL技术的影响正在向具身智能领域扩展。机器人感知-推理-行动的闭环、Agent的多轮工具调用等场景,本质都是RL的动态试错过程。随着迭代环境从代码沙箱延伸至物理世界,基础设施需求呈现共性特征:需要支持弹性算力、实时推理、状态管理和高频反馈。九章智算云的技术栈已具备这种扩展能力,其统一AI Runtime可整合生成器、训练器、环境模拟器和状态资源,为不同场景提供标准化支持。

这场变革标志着RL从模型训练算法升维为AI基础设施的核心能力。当模型能力持续Scaling的需求遇上工程化挑战,算法与基础设施的深度融合成为必然选择。九章智算云的实践表明,通过构建覆盖“生成-训练-状态-推理”的全链路优化体系,可实现RL技术的高效规模化落地。这种模式不仅推动大模型进化,更为具身智能等新兴领域提供了可复制的技术范式,重新定义了AI云的服务边界。

更多热门内容
豆包工作任务模式迎新升级 虚拟桌面助力Windows端高效完成复杂任务
IT之家 8 月 18 日消息,据豆包消息,豆包工作任务模式上新,全新的豆包虚拟桌面已在 Windows 版本上线。 据IT之家了解,在豆包电脑端选择工作任务模式和本地电脑,在技能栏选择“操作电脑”,完成授权…

2026-08-18

豆包功能再突破:虚拟桌面助力,轻松操作Windows电脑推进复杂任务
豆包虚拟桌面基于更通用的GUI(图形用户界面)能力,模型在没有MCP、API、插件和CLI的情况下也能看懂界面并完成操作,支持在不干扰用户的环境中操作应用、浏览网页并完成跨软件任务,不会抢占用户的鼠标、键盘…

2026-08-18

人形机器人酒店场景赛开赛 半小时完成多项任务探索“以赛促产”新模式
场景赛酒店场景宾客服务岗负责人李梓烨介绍,本次比赛限时30分钟,机器人需依次完成行李搬运、客房补货、客房整理三项任务,重点检验人形机器人综合具身智能,包括移动负重与推控平衡、不同软硬物体的灵巧抓取摆放、实景…

2026-08-18

OpenAI总裁警示:AI时代网络安全升级,企业需速行十项防御举措
IT之家 8 月 18 日消息,OpenAI 总裁兼联合创始人格雷格 · 布罗克曼向企业敲响了网络安全警钟:OpenAI 的 AI 模型成功入侵Hugging Face 已经成为“网络安全的分水岭时刻”,企…

2026-08-18