九章智算云如何落地“训推一致”:以GLM-5为例解析强化学习基础设施新范式

2026/08/19 15:55阅读量 2

随着预训练边际收益递减,强化学习(RL)成为模型能力持续Scaling的关键。九章智算云提出“训推一致”的RL基础设施,将Generator、Environment、Trainer纳入统一调度,并以GLM-5系列为例展示后训练RL的效果,同时通过动态调度和状态复用降低训练与推理成本。

事件概述

大模型竞争正从预训练转向后训练强化学习(RL)。RL通过生成、执行、反馈和奖励,让模型持续获得推理、规划与自我纠错能力。九章智算云围绕RL构建基础设施,强调“训推一致”,即以GLM-5系列为案例,将训练与推理作为连续生产线进行统一调度。

核心信息

  • 智谱GLM-5.3与GLM-5.2在相同基座上推进强化学习后训练。GLM-5.2在SWE-bench Pro得分62.1,Terminal-Bench 3.0得分81.0,核心驱动力是面向长时序、多步骤、工具联动场景的RL训练。

  • 九章智算云将RL系统拆分为Generator(生成)、Environment(环境)、Trainer(训练)三部分,并统一调度。通过动态匹配Trainer吞吐与Generator有效吞吐,避免训练算力闲置或Policy Staleness问题。

  • 在MiniMax M2.1 229B和Qwen3-Coder-Next 80B等模型上,九章智算云称首日速度提升1.5倍;随着流量变化,速度比静态预测器再提升1.25倍。同时,其将在线投机者学习定义为异步RL问题,通过接受/拒绝令牌作为奖励信号持续更新,实现零停机热插拔。

  • 状态资源化是另一关键点。九章智算云依托DingoFS分布式文件底座、DFKV分布式缓存、全域零拷贝链路和RDMA高速网络,将KV Cache从单GPU临时缓存升级为可定位、可迁移、可跨任务复用的状态资源,减少重复Prefill和跨节点搬运开销。

  • 九章智算云与中国人民大学STILL项目团队联合研究显示,Qwen2.5-32B、DeepSeek-R1-Distill-Qwen-1.5B等模型可通过持续RL迭代释放推理能力,后者在AIME 2024上的准确率达39.33%。研究还表明,On-policy学习是持续提升性能的重要机制;通过动态更新Reward Model的Cooper方法可缓解Reward Hacking,改善端到端RL效果。

值得关注

  • RL系统本质上是分布式生产系统:Generator是生产者,Trainer是消费者。训练与推理首次形成连续生产关系,RL基础设施的优化核心从单点GPU利用率转向吞吐、数据新鲜度与资源利用率的动态平衡。

  • AI基础设施的竞争焦点正在从“模型+算力”转向“单位算力的有效Token产出率”以及“Token向模型智能的转化效率”。训练与推理优化最终统一为生产级目标:以更低成本持续产出有效Token。

  • 这一能力有望从大模型延伸至具身智能。Agent工具调用、多轮决策以及机器人感知、推理、行动与反馈,本质都是动态试错和持续学习的RL闭环,对基础设施的需求一致:弹性算力、实时推理、状态管理、高频反馈和持续迭代。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。