智谱发布GLM-5.3 Flash:首个原生多模态模型,全栈国产算力支撑
2026/08/27 00:48阅读量 6
智谱正式开源GLM-5.3 Flash,这是GLM系列首款原生多模态模型。该模型参数量仅320B(激活18B),但性能全面超越上一代753B的GLM-5.2,并在AA榜单中与Claude Opus 4.8持平。其核心亮点在于采用混合注意力架构大幅降低推理成本,且所有线上请求均运行于国产芯片之上,实现了前沿能力与低成本的结合。
事件概述
智谱(Zhipu AI)正式发布并开源了 GLM-5.3 Flash 模型。此前在海外平台匿名测试时被称为“牛来”(Ox Alpha)的神秘模型,其真身即为该模型。GLM-5.3 Flash 是 GLM-5 系列中首个原生支持多模态的模型,凭借高效的架构设计和低廉的价格迅速在 OpenRouter 和 OpenCode 等平台引发关注,刷新了单日 Token 用量纪录。
核心信息
1. 性能与规模对比
- 参数效率:总参数量为 320B,实际激活参数仅为 18B,层数从 GLM-4.5 的 92 层压缩至 45 层。
- 能力表现:尽管体积缩小,但其综合能力全面超越了体量为 753B 的上一代模型 GLM-5.2。
- 基准评分:在 AA 榜单中得分达到 57分,与 Claude Opus 4.8 持平,跻身全球前沿模型行列。
- 价格优势:定价为 GLM-5.3 的 1/10(限时折扣 1/20),仅为 Opus 4.8 的 1/40,低于 DS-V4-Flash。
2. 架构创新:Flash 背后的技术突破
为了在减少计算量的同时保持高性能,智谱对模型架构进行了深度优化:
- 混合注意力机制:采用 线性注意力 + 稀疏注意力 的混合架构。线性注意力处理局部信息,稀疏注意力通过轻量级索引器召回全局上下文,有效应对 1M 超长上下文。
- IndexPool 优化:将索引器的缓存向量从 4 个压减为 1 个,使注意力计算量降低 3.01倍,KV Cache 缩小 4.44倍。
- Visual Coding 数据合成:专为视觉编码任务构建了数据合成流水线,使模型具备“边写、边看、边改”的能力,显著提升了代码还原和 3D 场景构建的效果。
3. 全栈国产算力支持
- 硬件底座:GLM-5.3 Flash 承接的所有线上真实请求(包括创纪录的 62T Tokens 流量)均运行在 国产加速芯片 上。
- 系统优化:针对国产硬件,采用了 Encode-Prefill-Decode 分离式架构,并结合 Layer Split 和混合缓存量化等技术。相比初始基线,端到端服务性能提升 3倍,单 Token 成本与主流英伟达 GPU 相当。
实测表现
- 多模态理解:在处理多人说话视频时,能精准识别不同说话人并生成带有卡拉 OK 效果的字幕;能将完整电影剪辑为包含剧情梳理、配音和中文字幕的解说视频。
- Coding 能力:基于 UI 设计稿,能直接生成可交互的移动端购物 App 界面,涵盖首页、购物车、支付等全流程功能;独立运行 12 小时完成复杂的 3D Blender 场景构建。
行业意义
GLM-5.3 Flash 的发布标志着“模型+国产算力+开源生态”的闭环形成。通过将前沿模型的性能与极低的调用成本相结合,使得大模型在处理长耗时 Agent 任务时更具经济性,推动了 AI 应用从“奢侈品”向“日常消耗品”的转变。
