智谱唐杰发布RSI首个工程案例:GLM-5.3驱动Agent两周优化十万卡集群,吞吐提升3.2倍

2026/09/17 16:28阅读量 5

智谱创始人唐杰分享了由GLM-5.3驱动的Infra Agent在超10万张国产芯片集群上从零搭建并优化生产级推理系统的早期成果。该Agent通过“稠密反馈”闭环,在不到两周内将端到端吞吐提升至初始基线的3.2倍,解决了算子精度、跨层并发瓶颈及Kernel性能等复杂工程问题。这标志着模型优化系统、系统承载模型的递归自我改进(RSI)雏形已出现,但核心目标设定与风险控制仍由人类工程师主导。

事件概述

清华大学计算机系教授、智谱创始人唐杰近日分享了智谱在递归自我改进(Recursive Self-Improvement, RSI)领域的首个工程化案例。由 GLM-5.3 驱动的 Infra Agent 在超过 10 万张国产芯片组成的集群上,从零参与搭建并优化了一套生产级推理系统。在不到两周的时间内,该系统端到端吞吐量提升至初始基线的 3.2 倍。这一实践展示了 AI 模型开始深度参与构建和优化自身运行基础设施的早期形态,即“模型优化系统,系统承载模型”。

核心技术与工程突破

此次优化的核心在于建立了一套基于“稠密反馈”(Dense Feedback)的 Infra Agent 迭代闭环。传统端到端指标无法解释性能下降的具体原因,智谱通过将正确性测试、运行日志、执行 Trace、微基准测试等细粒度数据整合,为 Agent 提供可归因、局部化且低成本验证的工程反馈。

在此机制下,Agent 自主完成了以下关键优化任务:

  1. 算子精度修复

    • 问题:在 KDA 算子的上下文并行(Context Parallel, CP)路径中,由于 tl.dot 默认使用 TF32 计算导致误差累积,引发数值偏差。
    • 解决:Agent 定位到精度问题后,将计算显式指定为 input_precision="tf32x3",通过三次 TF32 Tensor Core 运算组合出更高精度结果,既修正了误差又保留了性能优势。相关修复已合并至 Flash Linear Attention 上游。
  2. 跨层并发瓶颈消除

    • 问题:在 KV Transfer 场景中,Python/C++ 边界存在 GIL(全局解释器锁)阻塞。DeepEP v1.2.1 中的 intranode_dispatchintranode_combine 未释放 GIL,导致 Python 侧的 Mooncake Transfer 线程调度被推迟,使得 Prefill + KV Transfer 相比单独 Prefill 产生超过 20% 的性能损失。
    • 解决:Agent 通过分析时间线和调用链,发现 C++ 执行区间需释放 GIL 以允许 Python 线程推进任务。修复后,Prefill + KV Transfer 与单独 Prefill 的性能差距压缩至 1% 以内
  3. Kernel 性能优化

    • 问题:KDA Decode 算子沿 V 维度分块,导致相同的 FP32 归一化与门控计算被重复执行四次,成为性能瓶颈。
    • 解决:Agent 从存量代码库中学习优化经验,将分块合并至同一线程块,提前批量计算并共享中间结果,以牺牲部分并行度为代价消除重复计算,最终获得 1.71× 的性能提升。

值得关注的关键结论

  • RSI 雏形落地:虽然距离“AI 完全自主设计并训练继任者”仍有距离,但 GLM-5.3 驱动的 Agent 已经能够独立处理复杂的系统工程问题,包括读取系统反馈、提出假设、修改代码、跑实验并迭代。这超越了抽象讨论,进入了生产环境验证阶段。
  • 人机协作新范式:目前的目标设定、边界划定和风险判断仍由人类工程师负责。工程师定义优化目标与系统约束,构建反馈环境,并审核关键修改;Agent 负责分析、假设、修改和实验验证。这种分工确保了系统在追求性能提升的同时,维持数值正确性和线上稳定性。
  • 效率显著提升:借助稠密反馈闭环,原本依赖资深 Infra 团队数周的工作被缩短至两周以内,证明了高效的反馈机制比单纯的模型代码生成能力更能决定 Infra Agent 的工程效果。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。