关于ZAKER Skills 合作
雷锋网 3小时前

以 GLM-5 为例,探究九章智算云强化学习系统如何落地“训推一致”


过去几年,大模型竞争的主线很清晰:更大的模型、更多的数据和更强的 GPU 集群。

但随着预训练边际收益递减,模型能力 Scaling 正从单纯的预训练堆叠向后训练强化学习(RL)转变,数学推理、代码生成、复杂决策、长时序 Agent 等高阶能力,越来越依赖后训练强化学习(RL)激发。RL 通过生成、执行、反馈和奖励,让模型持续学习推理、规划与自我纠错的能力。

由此,大模型发展从 " 一次性训练 " 进入 " 持续训练 ",模型能力 Scaling 也从预训练延伸至生成、反馈和迭代全过程。SemiAnalysis 指出,当 RL 成为模型能力持续 Scaling 的关键,竞争的就不只是算法,还有支撑模型持续生成、训练和更新的 AI 基础设施系统。

问题也随之变成:当模型越依赖 RL 获得能力,谁来支撑这种能力持续低成本地生产。

从 " 模型 + 算力 " 到算法与 AI 基础设施共同 Scaling

智谱近期的模型迭代,为观察后训练 RL 提供了一个窗口。

智谱公告指出,GLM-5.3 与 GLM-5.2 在相同基座上推进强化学习,通过后训练 Scaling 持续提升模型智能上界。以 GLM-5.2 为例,其在 SWE-bench Pro 取得 62.1 分、Terminal-Bench 3.0 达到 81.0 分,核心驱动力正是面向长时序、多步骤、工具联动场景的 RL 训练。这意味着,复杂推理和 Agent 能力的提升,正越来越依赖强化学习。

这一变化也正在影响 AI 产业链分工方式:模型厂商不再只是单独推进算法,而是需要与 AI 基础设施共同服务于 " 智能持续生产 "。

目前,GLM-5 系列、DeepSeek R 系列等主流推理模型均已部署于九章智算云,实现规模化 Token 生产。不同于 " 模型 + 算力 " 的传统产业关系,九章智算云与模型厂商双方形成了算法与工程系统双向 RL Scaling 的协作模式:模型厂商持续挑战 RL 算法和策略边界,九章智算云则持续打磨适配的算力调度、推理服务和状态管理,实现工业级应用。大规模应用的模型算法再进化,进而提出更高的基础设施要求,而基础设施的持续迭代又为更大规模 RL 实现打开空间。

由此,模型厂商与 AI 基础设施成为 RL 的一体两面,RL 从模型训练中的单一算法环节,升级为 AI 云必须具备的核心能力。模型、算力、数据、状态和推理不再彼此割裂,而是共同构成一条持续运行的智能生产线。

真正的问题也由 " 模型 + 算力 " 转向如何让算法与基础设施协同 Scaling,以 " 一条智能生产线 " 更低成本持续生产有效 Token 和模型能力。

RL 让训练与推理成为一条生产线

强化学习与传统预训练的核心差异,不在于增加一种训练算法,而在于改变了训练系统的结构。

一个完整的 RL 系统通常由三部分组成:Generator、Environment 和 Trainer。

Generator 接收 Prompt 并通过推理生成 Rollout;Environment 执行代码、工具调用或任务模拟并返回 Reward;Trainer 依据 Rollout 和 Reward 更新模型权重,再将新权重回传 Generator,形成 Generate → Reward → Train → Update → Generate 的持续闭环。与预训练依赖固定数据集不同,RL 的训练数据由模型实时生成,因此训练与推理第一次真正形成了连续生产关系。

问题也因此出现。如果 Trainer 每秒能够消费 100 个样本,而 Generator 只能生成 60 个,训练算力就会闲置;反之则会造成 Rollout 堆积、数据陈旧,形成 Policy Staleness。

因此,RL 基础设施优化的核心不再是单点 GPU 利用率,而是 Trainer Throughput 与 Effective Generator Throughput 的动态匹配。

依托这套机制,训练与推理首次形成真正意义上的连续生产关系。RL 系统越来越像一个分布式生产系统:Generator 是生产者,Trainer 是消费者,整个 RL 系统本质上成为一个需要持续平衡吞吐、数据新鲜度与资源利用率的分布式生产系统。

九章智算云与中国人民大学 STILL 项目团队联合发布的《An Empirical Study on Eliciting and Improving R1-like Reasoning Models》验证了这一机制,研究显示,Qwen2.5-32B、DeepSeek-R1-Distill-Qwen-1.5B 等模型均可通过持续 RL 迭代释放潜在推理能力,后者在 AIME 2024 上的准确率达到 39.33%。研究同时表明,On-policy 学习是持续提升性能的重要机制,而单纯奖励更长回答容易产生 "length hacking";通过动态更新 Reward Model 的 Cooper 方法,可以缓解 Reward Hacking,改善端到端 RL 效果。

这说明 RL 绝非简单的增量训练,而是策略、生成、环境、训练和反馈高度耦合的系统工程。

其中最容易被忽视的,是 Generator 与 Trainer 之间的动态匹配。Generator 过慢,训练 GPU 等待;Generator 过快,Rollout 堆积并逐渐陈旧。对于长时序 Agent 任务,一次 Rollout 还包含多轮工具调用和超长上下文,使 Generator 本身已经成为完整的实时推理系统。更进一步,两者共享的不只是 GPU,还包括模型权重、Rollout、KV Cache、Environment 状态和任务队列。权重更新过慢会导致 Policy Staleness,更新过于频繁又会增加模型加载与数据搬运成本。

所以,RL 基础设施真正要解决的并非单独提高训练吞吐或推理吞吐,而是让 Generator 与 Trainer 在整个生命周期内保持高效匹配。

九章智算云正是围绕这一问题构建 RL 工程化基础设施:将 Generator、Environment 和 Trainer 纳入统一工作流,通过全局动态调度适应不同阶段的资源需求——生成环节成为瓶颈时增加推理资源,训练进入高峰时重新分配算力,Environment 等待时释放闲置 GPU。由此,AI 调度对象从 " 哪台机器有空闲 GPU" 升级为 " 模型、轨迹、状态和下一步计算应该在哪里 "。

这么做的好处是直接提升模型速度,在 MiniMax M2.1 229B 和 Qwen3-Coder-Next 80B 等前沿模型上,首日速度提升 1.5 倍;随着流量变化,速度比静态预测器再提升 1.25 倍。

与此同时,大多数部署方案都是离线训练投机者并将其冻结,导致部署速度慢,且会随着流量和目标模型的变化而失效。九章智算云将在线投机者学习重新定义为在生产环境中运行的异步强化学习问题:接受和拒绝的令牌作为奖励信号,训练服务器持续更新投机者,并且新的权重可以热插拔到服务器,实现零停机时间。

这意味着,AI 云正走向 AI 全工作流调度的自适应推测训练。

状态资源化:训推一致是衡量 AI Infra 的核心之一

计算之外,运行状态本身也是基础设施的核心资源。

Agent 交互产生的上下文与 KV Cache、RL 生成的轨迹数据与奖励信号、实时更新的模型权重,共同构成 AI 持续进化的状态资产。若这些资源被绑定在单一 GPU 或节点,跨节点搬运、重复 Prefill 和计算就会成为新的系统瓶颈。

传统数据路径通常需要经过存储、CPU 内存、框架 Buffer 和 GPU 显存,多次复制和转发。在 RL 持续循环中,这些非计算开销会层层累积、持续放大。针对这一行业痛点,九章智算云依托 DingoFS 分布式文件底座、DFKV 分布式缓存、全域零拷贝链路、RDMA 高速网络等底层技术,重新组织数据与状态流转。

零拷贝缩短数据传输路径、减少 CPU 参与,降低 RL 闭环中的非计算开销;DFKV 则将 KV Cache 从单 GPU 临时缓存升级为可定位、可迁移、可跨任务复用的状态资源,让已经产生的上下文继续创造价值。

由此,AI 调度逻辑也从 " 哪里有空闲 GPU",升级为 " 模型、算力、上下文和状态应该在哪里组合 "。如果 Agent 已在某节点完成大量 Prefill,后续请求即可复用已有 KV Cache,避免重复计算;训练与推理间的模型权重交换,也可依托高速数据路径降低传输成本。

基于此,九章智算云真正的训推一致的核心思路:不是简单共享训练与推理算力,而是让两者共享一套能够同时感知计算、数据、状态和工作流的统一基础设施。在 RL 体系中,Generator 本身就是训练闭环的一部分;在 Agent 运行场景中,上下文与 KV Cache 又是任务持续运行的核心状态,二者天然深度耦合。这意味着,推理效率正在直接前置为训练效率:每一次高效 Token 生成、每一次 KV Cache 复用、每一次精准调度,都可能转化为模型迭代效率的提升。

SemiAnalysis RL 系统专项分析指出,只有实现训推吞吐与系统状态高度匹配的基础设施,才能充分释放 RL 的性能潜力,支撑模型获得更优能力。而九章智算云则因专注于这一点,在中国市场率先完成了大规模、全场景的工程验证。

AI 云也由 " 算力供应商 " 成为连接训练、推理、状态与模型迭代的核心底座。

从 RL 到推理优化,竞争的是 " 有效 Token"

" 训推一致 " 的系统能力成为 RL 的基础,这样的做法带来显著好处:加速推理优化技术进入生产级别,反过来影响训练效率,促成 Token 成本的直线下降。

这其中与 MoE 架构、推理优化、模型量化、模型架构和硬件协同设计等技术融合尤为关键。如 Prefill 与 Decode 具有不同的计算特征,PD 分离可以将两类负载匹配到更合适的资源池;Chunked Prefill 通过拆解超长上下文,缓解不同阶段的资源竞争;Speculative Decoding 则由小模型生成候选 Token、大模型批量验证,降低逐 Token 串行计算带来的开销。

这些技术看似独立,本质在解决同一个问题:让有限 GPU 生产更多有效 Token。在九章智算云体系中变为一条生产线—— Generator 产生的 Token 不是最终答案,而是下一轮训练的原材料。Generator 效率越高,同等算力就能生成更多 Rollout;KV Cache 复用减少重复 Prefill;PD 分离与动态调度则进一步提升计算与带宽匹配效率。

由此,训练与推理优化最终统一为 AI 基础设施生产级目标:单位算力的有效 Token 产出率,以及 Token 向模型智能的转化效率。

这也是九章智算云 RL 技术路线核心价值:并非单独搭建 RL 训练平台,而是将 Generator、Trainer、Environment、模型权重、KV Cache 与 GPU 算力整合进统一 AI Runtime。模型厂商持续提高 RL 训练强度,基础设施同步优化 Rollout 生成、状态复用和资源调度,两者共同决定后训练 Scaling 能够走多远。

这一能力也将从大模型延伸至具身智能。Agent 的工具调用、多轮决策,以及机器人的感知、推理、行动与反馈,本质都是动态试错和持续学习的 RL 闭环。未来,迭代环境将从代码沙箱、工具调用场景,延伸至模拟器、真实机器人与物理世界,但基础设施需求依然一致:弹性算力、实时推理、状态管理、高频反馈和持续迭代。

随着行业从大规模训练转向后训练强化学习,RL 正在从单一模型训练算法,成为连接大模型、Agent 与具身智能的通用技术底座。RL 让模型能力持续 Scaling,九章智算云则让这种 Scaling 能够高效、规模化地发生。这正是强化学习从算法走向 AI 云原生基础设施核心技术栈的关键所在。

最新评论

没有更多评论了
雷峰网

雷峰网

读懂智能&未来

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容