一、案例背景
自2022年底生成式人工智能爆发以来,全球大模型竞争的主线清晰而单一:更大的参数规模、更多的训练数据和更强的GPU集群。然而,进入2025年后,这一范式正在发生根本性转变。随着预训练边际收益递减,单纯堆叠算力和数据的“暴力美学”已难以持续提升模型的上限能力。业界共识逐渐凝聚:模型能力的Scaling正从预训练阶段向后训练强化学习(Reinforcement Learning, RL)转移。数学推理、代码生成、复杂决策、长时序Agent等高阶能力,越来越依赖RL通过“生成-执行-反馈-奖励”的闭环机制来激发模型的推理、规划与自我纠错能力。
这一转变的深层含义在于,大模型的发展从“一次性训练”进入“持续训练”时代。模型能力不再仅由一次预训练决定,而是在持续生成、反馈和迭代的RL循环中不断进化。正如市场研究机构SemiAnalysis所指出,当RL成为模型能力持续Scaling的关键,竞争的焦点就不只是算法本身,还包括支撑模型持续生成、训练和更新的AI基础设施系统。问题随之而来:当模型越来越依赖RL获得能力,谁来支撑这种能力持续且低成本地生产?
智谱近期的模型迭代为观察这一趋势提供了窗口。智谱公告显示,其GLM-5.3与GLM-5.2在相同基座上推进强化学习,通过后训练Scaling持续提升模型智能上界。以GLM-5.2为例,其在SWE-bench Pro取得62.1分、Terminal-Bench 3.0达到81.0分,核心驱动力正是面向长时序、多步骤、工具联动场景的RL训练。这意味着,复杂推理和Agent能力的提升,正越来越依赖强化学习。
在这一背景下,AI产业链的分工方式正在被重塑。模型厂商不再只是单独推进算法,而是需要与AI基础设施共同服务于“智能持续生产”。目前,GLM-5系列、DeepSeek R系列等主流推理模型均已部署于九章智算云,实现规模化Token生产。九章智算云与模型厂商之间形成了一种“算法与工程系统双向RL Scaling”的协作模式:模型厂商持续挑战RL算法和策略边界,九章智算云则持续打磨适配的算力调度、推理服务和状态管理,实现工业级应用。这一模式标志着大模型竞争从“模型+算力”的简单叠加,转向了算法与AI基础设施共同Scaling的深水区。
……