智谱RSI战略解析:以密集反馈机制在十万张国产芯片集群中实现极致优化
智谱将递归式系统优化(RSI)下沉至基础设施层,构建由GLM-5.3驱动的推理系统,成功在十万张国产芯片集群上支撑GLM-5.3-Flash模型的高效运行。通过引入“密集反馈”体系,AI自动完成正确性、系统行为及性能层面的排查与优化,使端到端吞吐量提升3.2倍,并大幅缩短部署周期。这一策略旨在突破硬件生态限制,通过软件定义算力,解决大规模推理中的成本与效率瓶颈。
事件概述
智谱(Zhipu AI)近期将其核心策略聚焦于基础设施层的递归式系统优化(Recursive System Intelligence, RSI)。通过将RSI能力嵌入底层架构,智谱构建了由GLM-5.3驱动的推理基础设施。该系统的核心成果是支撑了匿名模型Ox-Alpha(即GLM-5.3-Flash)的快速普及,该模型在发布六天内处理了超过62万亿Token,且全部运行于十万张国产芯片集群之上。
面对国产芯片在内存带宽、算子兼容性及网络稳定性上的短板,智谱并未依赖传统的工程堆砌,而是通过软件层面的极致优化弥补硬件缺陷。从首次全量跑通到生产流量切换仅耗时两周,相比传统数月周期大幅压缩。最终实现端到端吞吐量提升3.2倍,单Token成本逼近英伟达水平,验证了“软件调动算力”在物理算力受限环境下的非线性超车潜力。
核心信息:技术解法与密集反馈体系
针对国产芯片集群部署的三大难点——硬件性能局限、软件栈缺失、长上下文负载压力,智谱采取了以下关键技术融合策略:
-
资源置换策略:
- 通信换内存:采用节点内张量并行与层分割,将模型按层拆分,多卡分担核心注意力计算。
- 计算换内存:启用ReplaySSM策略,在内存不足时丢弃数据并在需要时实时重算,以极短计算时间换取存储空间。
- 精度换容量:采用W8A8量化压缩权重与激活值,并对KV缓存实施INT8/FP8/BF16混合动态压缩,最大化显存利用率。
- 解耦调度:将编码、预填充、解码三个阶段彻底解耦,提升调度自由度。
-
“密集反馈”(Dense Feedback)分层验证体系:
为解决复杂系统中“稀疏反馈”导致的调试难题,智谱将资深工程师的直觉转化为AI可执行的自动化反馈机制,涵盖三个维度:
-
正确性反馈(Correctness Feedback):
* 场景:长上下文处理中的精度漂移。
* 机制:AI像显微镜一样追踪执行链路,识别因KDA内核默认计算精度导致的舍入误差累积。自动匹配开源经验库,将计算升级为高精度组合算法,消除数据污染。 -
系统行为反馈(System Behavior Feedback):
* 场景:KV传输并发瓶颈导致Prefill阶段计算与通信无法重叠。
* 机制:构建“全链路X光机”,自动拉取时序图标记异常时间片。AI跨越Python/C++语言边界,深入底层接口检查锁状态(如GIL释放问题),秒级定位并修复并发阻塞,同时通过时序和性能双重标准验证修复效果。 -
性能反馈(Performance Feedback):
* 场景:解码内核冗余计算拖慢生成速度。
* 机制:建立基于SGLang、Flash Linear Attention等项目的“优化模板库”。AI根据性能瓶颈自动检索匹配模板,重构代码进行小规模测试,有效方案反哺模板库,形成复利效应。
值得关注:商业逻辑与战略转向
智谱向Infra层深耕并非单纯的技术追求,而是由市场需求倒逼的商业必然:
- 算力约束与收入弹性:GLM-5发布后,Coding产品调用量暴增10倍导致算力耗尽,甚至被迫停售主力产品。7月融资到位后重启销售,销量增长超15倍,证实“算力规模直接决定营收上限”。
- 规模化扩张必要性:高层测算显示,若投入300亿元算力(40%训练/60%推理),凭借GLM-5.3高达80%的毛利率,年营收可达400亿元,一年即可覆盖成本。保守投入则会导致研发受阻与订单流失的双输局面。
- 三层战略布局:
- 基建自主可控:搭建1GW级超大算力数据中心,全面采用国产芯片以控制长期风险。
- 轻资产变现:通过云分成模式,将GL系列开源模型以托管API形式上架各大云平台,外包运维与分发压力。
- 企业级落地:GLM-5.3率先打通网络安全场景,已接入100家安全企业及金融机构,契合全球信息安全支出增长趋势。
智谱试图通过RSI建立“底层解耦”能力,使AI能够自主适配不同硬件生态,将“国产算力不好用”的行业难题转化为“AI自动挖掘硬件极限”的技术主动权。
