智谱 GLM-5.3-Flash 上线,商汤大装置以国产算力支撑大规模推理

2026/08/28 12:06阅读量 2

8月26日,智谱开源原生多模态模型 GLM-5.3-Flash(320B-A18B),其综合智能指数达57分,与 Claude Opus 4.8 持平。该模型依托商汤大装置的国产异构混推技术,在发布前通过匿名测试验证了国产芯片承载62T Token调用的能力。实测显示,基于国产集群的端到端服务性能提升3倍,单Token成本与主流英伟达GPU相当,标志着国产算力在大规模商用场景下的性价比突破。

事件概述

2026年8月26日晚,智谱正式开源 GLM-5.3-Flash 模型。这是 GLM-5 系列的首个原生多模态模型,总参数量为 320B,激活参数为 18B。该模型结合智谱最新的 30T Token 多模态预训练语料,旨在以更低的计算资源实现更强的性能。

在权威评估指标 Artificial Analysis Intelligence Index(AA综合智能指数)中,GLM-5.3-Flash 取得 57 分,进入全球前沿模型能力区间,得分与 Anthropic 的 Claude Opus 4.8 持平,且整体能力超越上一代 GLM-5.2。

核心信息:国产算力规模化商用实证

此次模型上线由商汤大装置提供底层算力支持,双方合作重点在于验证国产算力在大规模真实业务场景下的高效性与经济性。

  • 大规模压力测试:在正式发布前,GLM-5.3-Flash 以匿名模型 Ox-Alpha(社区称“牛来”)在 OpenCode 和 OpenRouter 平台进行大规模测试。期间产生的高达 62T Token 调用量,全部由国产芯片提供算力支持。
  • 性能与成本突破:相较于同一硬件环境下的初始基线,基于国产芯片集群的 GLM-5.3-Flash 端到端服务性能提升 3 倍。其硬件效率和单 Token 成本已达到与主流英伟达 GPU 相当的水平。
  • 异构混合推理技术:商汤大装置采用先进的异构混合推理技术,根据推理阶段对计算和带宽的不同需求,让不同架构、定位的国产芯片协同工作。该技术使整体推理性价比达到 NVIDIA H 系列的 1.25 倍,同等成本下 Token 产能扩大约 2.5 倍。

值得关注:基础设施与生态建设

商汤大装置通过构建“一套模型、一座 Token 工厂、一套智能体管控系统”的核心能力体系,推动国产算力从“单点可用”走向“大规模商用”。

  • Token 工厂闭环:通过多模态模型与大装置基础设施的联合优化,将不同芯片、集群、能源和交付节点组织起来,持续生产高质量、低成本的 Token。这种双向反哺机制更好地适配了原生多模态模型的迭代需求。
  • 能效比新标尺:商汤推出算电协同 Agent,并重新定义 TPW(Tokens Per Watt)作为 AIDC 全新价值标尺,从性价比、适配性、能效比三个维度系统性解决国产算力规模化商用的卡点。
  • 供给规模增长:截至 2026 年 7 月,商汤大装置 Token Factory 日均 Token 服务量已达 2.42 万亿,预计年底突破日均 10 万亿,全年 Token 量级增长 25 倍。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。