智谱发布首个 RSI 成果:GLM-5.3 驱动 Infra Agent 优化国产算力集群
智谱团队宣布 GLM-5.3-Flash 在超10万颗国产AI加速器上的部署与优化取得突破,端到端吞吐能力提升3.2倍。核心亮点在于引入由模型自身驱动的Infra Agent,通过“dense feedback”机制参与系统性能瓶颈定位与代码修复,标志着AI开始实质性参与优化承载自身的运行环境。尽管距离真正的递归自我改进(RSI)仍有距离,但已出现“模型优化系统,系统服务模型”的最小规模闭环雏形。
事件概述
智谱首席科学家唐杰在 X 平台分享了 GLM-5.3-Flash 推理系统的最新优化成果。该模型成功部署于由超过 10 万颗国产 AI 加速器组成的集群上,从首次运行到稳定承载生产流量仅耗时两周。在此过程中,系统端到端吞吐能力提升了 3.2 倍,硬件利用率和单 token 成本接近主流 NVIDIA GPU 平台水平。
此次优化的核心特征并非单纯增加计算资源,而是引入了由 GLM-5.3 驱动的 Infra Agent(基础设施智能体)。该 Agent 参与了性能瓶颈分析、优化方案提出及部分代码修改,实现了“模型优化系统,系统服务模型”的早期形态,被视为递归自我改进(Recursive Self-Improvement, RSI)的一种初步体现。
核心技术与挑战
1. 大规模国产算力部署难点
在缺乏成熟经验参考的情况下,团队需解决以下关键问题:
- 硬件限制:国产芯片显存容量和互联带宽不足。
- 架构适配:新模型架构适配及 100 万 token 长上下文支持。
- 生态短板:部分 Kernel 支持不足,工程团队需自行探索资料。
2. 关键优化方案
为平衡算力、内存、通信和调度,智谱团队采取了多项措施:
- ReplaySSM:以计算换取内存空间。
- 张量并行:降低节点内显存压力。
- 混合精度缓存:采用 INT8、FP8、BF16 提高容量利用率。
- EPD 分离式架构:将 Encode、Prefill、Decode 阶段分离,实现更灵活的调度。
3. “Dense Feedback”反馈机制
Infra Agent 面临的最大挑战并非编写代码,而是判断“为什么结果变差”。为此,团队构建了 dense feedback 机制,使 Agent 获得接近人类工程师经验的反馈信息:
- 正确性反馈:确认计算是否正确。
- 时间消耗分析:查看系统运行过程中的时间分布。
- 实验验证:通过客观实验判断优化方案的适用性。
这种机制要求反馈必须足够具体、快速获取且可验证,避免被大量日志淹没。
实际优化案例
在 dense feedback 辅助下,Infra Agent 成功定位并修复了多个隐蔽的系统问题:
-
KDA 上下文并行路径精度问题:
- 现象:TF32 计算产生的舍入误差随序列长度累积,导致长上下文计算偏差。
- 解决:Agent 通过比较不同执行路径结果,定位到状态传播和合并过程中的精度处理问题。修复代码已合并至 Flash Linear Attention 项目 PR #1180。
-
KV Transfer 与 DeepEP 调度冲突:
- 现象:KV Transfer 未与 DeepEP Dispatch 有效重叠,传输开销超过 30%。
- 原因:节点内路径未及时释放 Python GIL,阻碍传输任务推进。
- 结果:额外开销从 >30% 降至 <1%。
-
Decode Kernel 重复计算优化:
- 发现:Kernel 切分方式导致同一组归一化计算被重复执行四次。
- 方法:Agent 学习 SGLang、Flash Linear Attention 等项目的优化经验,提炼出“optimization skeleton”,重新组织计算结构。
- 结果:获得 1.71 倍性能提升。
行业意义与展望
- 角色转变:人类工程师的角色正从直接解决具体问题,转向设计反馈系统和审核高风险修改。
- 数据积累:建立在真实基础设施任务上的可验证反馈环境,可能成为训练下一代模型的重要基础。每一次 Agent 完成的工程任务,都可能转化为下一代模型的学习数据。
- RSI 雏形:虽然距离真正意义上的递归自我改进仍有距离,但“模型优化系统,系统服务模型”的最小规模循环已经出现。
此外,GLM-5.3-Flash 在匿名测试期间(代号 Ox-Alpha)表现优异,曾在 OpenCode 和 OpenRouter 平台一周内处理超过 62 万亿 token,成为使用量最高的模型之一。
