智谱发布GLM-5.3-Flash:原生多模态加持,国产算力集群实现低成本高性能推理
2026/08/27 08:40阅读量 3
智谱AI发布GLM-5.3-Flash,这是GLM-5系列首个原生多模态模型,在Artificial Analysis Intelligence Index中得分57分,超越DeepSeek V4 Pro并接近Claude Opus 4.8水平。该模型定价极低,约为Claude Opus 4.8价格的1/40,且全部请求流量由超10万张国产芯片集群承载。通过专用推理引擎优化和EPD分离式架构,实现了端到端性能提升3倍及与主流GPU相当的硬件效率。
事件概述
智谱AI正式发布GLM-5.3-Flash模型。此前在OpenCode和OpenRouter平台上以“Ox-Alpha”(中文社区称“牛来”)名称迅速走红的模型,经智谱确认即为此款产品。GLM-5.3-Flash是GLM-5系列中首个原生支持多模态能力的模型,其核心突破在于将视觉能力深度集成至编程闭环中,并在大规模真实负载下验证了国产芯片集群承载前沿大模型的可行性。
核心信息
1. 性能与定价打破行业定律
- 能力表现:在Artificial Analysis Intelligence Index榜单上,GLM-5.3-Flash获得57分,高于上一代旗舰GLM-5.2及DeepSeek V4 Pro正式版(53分),远超同类模型中间值(18分)。综合智能评分与Claude Opus 4.8持平。
- 极致性价比:打破了“参数越大、价格越贵”的传统曲线。官方数据显示,输入价格为0.8元/百万Token,输出为2.8元/百万Token,缓存命中0.23元/百万Token。相比Claude Opus 4.8(约35元/百万Token输入,175元/百万Token输出),成本仅为后者的约1/40;相较于DeepSeek V4 Flash更具价格优势。
2. 原生多模态重构Coding工作流
- 视觉编码技术:不同于传统的“生成代码-人工测试”模式,GLM-5.3-Flash具备自主观察界面、渲染结果及交互反馈的能力,形成“生成-观察-修正”的闭环。
- 实测案例:
- 在Blender环境中,模型自主运行16小时,从零搭建了一套约400平方米的专业主厨自宅与测试厨房,涉及几何、材质、光照及空间布局的复杂调整。
- 成功复刻游戏《泰拉瑞亚》,展示了从图像理解到可运行工程转化的能力。
3. 全量跑在国产芯片集群上
- 基础设施:GLM-5.3-Flash在OpenCode和OpenRouter上的所有线上请求流量,均由超过10万张国产芯片提供算力支持。供应商涉及华为、摩尔线程与海光等(具体数量未公开,训练可能由海光DCU支持)。
- 技术挑战与解法:针对国产芯片内存容量和带宽瓶颈,以及长上下文(1M Token)带来的显存压力,智谱采取了以下措施:
- 推理引擎优化:基于SGLang构建专用引擎,采用节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化及Layer Split等技术,核心思路为“以算力换带宽、以通信换显存”。
- 架构创新:采用Encode-Prefill-Decode (EPD) 分离式架构,将多模态编码、Prompt预填充和逐Token解码拆分为独立调度的工作池。
- 成效:相比同一批硬件基线,端到端服务性能提升3倍,单Token成本达到与主流英伟达GPU相当的水平。
4. 生态与开源
- GLM-5.3-Flash的模型权重已通过MIT许可证在Hugging Face等平台开源,API同步开放。
- 智谱利用GLM-5驱动的infra agent加速了推理引擎的开发与算子优化,形成了“模型优化系统,系统承载模型”的正向循环。
