实测GLM-5.3:后训练驱动,编程能力比肩第一梯队

2026/08/14 17:44阅读量 2

智谱发布GLM-5.3,维持约7000亿参数,靠后训练提升性能,编程能力比肩Fable 5和GPT-5.6 Sol;同时开源后训练框架Slime,并在网络安全评测中表现突出。模型已上线Zcode等应用,API和权重将陆续开放。

事件概述

智谱于近日发布新一代模型GLM-5.3。该模型沿用GLM-5.2的基座,参数量约为743B(7000亿级),官方表示此次升级主要来自后训练阶段的强化学习,并认为基座的智能上限尚未触达。

核心信息

  • 编程评测:GLM-5.3在多个基准中与Fable 5、GPT-5.6 Sol比肩,部分内测用户反馈使用体验优于Kimi K3和DeepSeek V4-Pro-0813。
  • Benchmark表现:在OpenAI提出的GDPVal评估中排名第一;AutomationBench、Agents' Last Exam等智能体相关评测也位居前列。
  • 后训练框架:智谱开源后训练框架Slime,可覆盖发布级模型后训练的完整工作流,从GLM-4.5起内部使用,目前支持GLM、Qwen、DeepSeek部分模型及Llama 3。
  • 网络安全:GLM-5.3在网络安全相关任务中与Claude Mythos 5持平;在ExploitGym测试中,6小时内完成898题中的130道。智谱同时公开网络安全披露账本,其中发现的最古老漏洞可追溯至约40年前。

测试体验

实测中,GLM-5.3能生成人体血液循环3D仿真、滑板游戏、水母湖等网页应用。人体仿真效果较粗糙,但提供多种视角和生理参数调节;水母湖场景渲染较精美。

在Claude Code中使用时,自动审批命令可能报错auto mode cannot determine the safety of Bash right now,显示第三方模型在部分工具链上仍存在适配问题。切换到智谱的ZCode后,模型可截图识屏并持续优化,但耗时更长;例如行星撞地球模拟运行超过1小时仍在检查,最终呈现地壳开裂、熔岩喷出和行星环等复杂效果。

发布信息

GLM-5.3已上线智谱官方Agent应用Zcode和效率工具AutoClaw,并向GLM Coding Plan用户全量开放。第三方平台WorkBuddy、QwenWork、TraeWork等也已开放体验。API调用预计下周二开放,完整权重将在两周内开源。

结论

在Kimi K3、Qwen3.8-Max、DeepSeek V4、Grok 4.6等密集发布的环境中,GLM-5.3以不到Kimi K3一半的参数量实现相近的智能水平,延续了同尺寸最强模型定位。随着产品迭代加快,模型间的能力差距正在收窄,大模型“最强”的有效期被进一步压缩。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。