智谱开源GLM-5.3-Flash,商汤大装置以国产异构算力支撑前沿模型普惠落地

2026/08/27 20:50阅读量 2

8月26日,智谱科技正式上线并开源原生多模态模型GLM-5.3-Flash(320B-A18B),该模型在AA综合智能指数中得分57分,与Claude Opus 4.8持平。依托商汤大装置的国产异构混推技术,该模型在大规模真实业务测试中实现了端到端性能提升3倍,单Token成本与主流英伟达GPU相当。此举标志着国产算力已具备高效、经济支撑前沿大模型推理的能力,推动AI基础设施向规模化商用迈进。

事件概述

2026年8月26日晚,智谱科技正式推出并开源了GLM-5系列的首个原生多模态模型——GLM-5.3-Flash (320B-A18B)。该模型总参数量为320B,采用专为极低成本设计的架构,结合30T Token的多模态预训练语料,旨在以更少的计算资源实现更强性能。

在能力评估方面,GLM-5.3-Flash在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数)中获得57分,进入全球前沿模型能力区间,其得分与Anthropic最受欢迎的模型Claude Opus 4.8持平,且整体能力超越前代GLM-5.2。

核心信息:国产异构算力的规模化验证

GLM-5.3-Flash的上线由商汤大装置提供底层算力支持,双方合作展示了国产算力在大规模商用场景下的成熟度。

  • 大规模压力测试数据:在正式发布前,该模型以匿名代号“Ox-Alpha”(中文社区称“牛来”)在OpenCode和OpenRouter上进行测试。期间Token调用量高达62T,所有请求流量均由国产芯片集群提供支持。
  • 性能与成本突破:相较于同一硬件环境下的初始基线,基于国产芯片集群的GLM-5.3-Flash实现了端到端服务性能提升3倍。其硬件效率和单Token成本已达到与主流英伟达GPU相当的水平,打破了市场对国产算力“性价比不高、难以规模商用”的认知。

值得关注:商汤大装置的技术体系与产能规划

此次合作印证了商汤大装置构建的“一套模型、一座Token工厂、一套智能体管控系统”核心能力体系的有效性。其中,“Token工厂”通过多模态模型与大装置基础设施的联合优化,将不同芯片、集群及能源节点组织起来,形成高质量、低成本的Token供给闭环。

针对国产算力规模化商用的痛点,商汤大装置从三个维度进行系统性优化:

  1. 性价比:采用先进的异构混合推理技术,让不同架构的国产芯片协同工作。整体推理性价比达到NVIDIA H系列的1.25倍;相比国产同构推理,同等成本下Token产能扩大约2.5倍。
  2. 适配性:通过底层算子优化、多卡并行调优和工具链适配,大幅降低应用门槛。
  3. 能效比:推出算电协同Agent,并重新定义TPW(Tokens Per Watt)作为AIDC全新价值标尺。

在产能方面,商汤大装置Token Factory的日均Token服务量在7月已达到2.42万亿,预计2026年年底将突破日均10万亿,全年Token量级增长25倍,正逐步形成大规模、高效率、低成本的Token供给能力。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。