九章智算云以GLM-5为例,拆解强化学习“训推一致”落地路径

2026/08/18 17:51阅读量 2

大模型能力Scaling正从预训练转向后训练强化学习(RL),九章智算云据此提出“训推一致”的AI基础设施思路,将生成、推理、训练与状态管理统一调度,并已在GLM-5系列等模型上落地。文章结合具体案例和数据,解释了RL系统如何通过动态匹配Generator与Trainer、状态资源化等机制,支撑模型持续迭代。

事件概述

随着预训练边际收益递减,大模型能力Scaling正从单纯堆叠参数转向后训练强化学习(RL)。数学推理、代码生成、复杂决策、长时序Agent等高阶能力越来越依赖RL激发。SemiAnalysis指出,当RL成为模型能力持续Scaling的关键,竞争的不只是算法,还有支撑持续生成、训练和更新的AI基础设施系统。

核心信息

  • GLM-5系列验证RL路线:智谱公告显示,GLM-5.3与GLM-5.2在同一基座上推进强化学习,通过后训练Scaling提升模型智能上界。GLM-5.2在SWE-bench Pro取得62.1分、Terminal-Bench 3.0达到81.0分,核心驱动力正是面向长时序、多步骤、工具联动场景的RL训练。
  • RL系统结构:完整RL系统由Generator(生成)、Environment(环境)、Trainer(训练)三部分组成。Generator生成Rollout,Environment执行并返回Reward,Trainer更新权重,形成持续闭环。与传统预训练不同,RL训练数据由模型实时生成,训练与推理首次形成连续生产关系。
  • 训推一致的关键:RL基础设施优化的核心是Trainer Throughput与Effective Generator Throughput的动态匹配。Generator过慢会导致训练算力闲置;过快则造成Rollout堆积、数据陈旧(Policy Staleness)。九章智算云将Generator、Trainer、Environment纳入统一工作流,通过全局动态调度应对不同阶段资源需求。
  • 实际效果数据:在MiniMax M2.1 229B和Qwen3-Coder-Next 80B等模型上,首日速度提升1.5倍;随流量变化,速度比静态预测器再提升1.25倍。同时,九章智算云将在线投机者学习定义为生产环境中的异步RL问题,以接受/拒绝的令牌作为奖励信号实时更新投机者,新权重可热插拔,实现零停机。

状态资源化与“智能生产线”

九章智算云提出,运行状态(KV Cache、轨迹数据、奖励信号、模型权重)也是基础设施核心资源。其依托DingoFS分布式文件底座、DFKV分布式缓存、全域零拷贝链路、RDMA高速网络等技术,降低RL闭环中的非计算开销,将KV Cache从单GPU临时缓存升级为可复用状态资源,避免重复Prefill。

其核心思路并非简单共享训练与推理算力,而是让两者共享一套能同时感知计算、数据、状态和工作流的统一基础设施。推理效率直接前置为训练效率:每一次高效Token生成、KV Cache复用、精准调度,都可能转化为模型迭代效率的提升。SemiAnalysis RL系统专项分析认为,只有实现训推吞吐与系统状态高度匹配的基础设施,才能充分释放RL性能潜力。

值得关注

  • 与中国人民大学STILL项目团队研究:联合发布的《An Empirical Study on Eliciting and Improving R1-like Reasoning Models》显示,Qwen2.5-32B、DeepSeek-R1-Distill-Qwen-1.5B等模型可通过持续RL迭代释放推理能力,后者在AIME 2024上准确率达39.33%。研究强调On-policy学习是关键机制,单纯奖励更长回答易产生“length hacking”,而动态更新Reward Model的Cooper方法可缓解Reward Hacking。
  • 技术融合方向:Prefill与Decode分离(PD分离)、Chunked Prefill、Speculative Decoding等推理优化技术,统一目标都是让有限GPU生产更多有效Token。在九章智算云体系中,Generator产生的Token成为下一轮训练的原材料,训练与推理优化最终统一为有效Token产出率及Token向模型智能的转化效率。
  • 延伸应用:该能力将从大模型延伸至具身智能,Agent工具调用、多轮决策及机器人感知、推理、行动与反馈,本质同样是动态试错和学习闭环。RL正从单一训练算法,成为连接大模型、Agent与具身智能的通用技术底座。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。