GLM-5.3 发布:编程能力大幅跃升,安全防线成亮点,后训练技术揭秘
智谱发布 GLM-5.3,基座模型未变,但通过后训练实现了编程与安全能力的显著提升。官方称其为最强安全、编程、开源模型,编程能力在多项评测中逼近或反超顶级闭源模型,并披露了漏洞挖掘、AI 攻击防御及 IndexShare、SAO、Slime 三项后训练核心技术。
事件概述
智谱正式上线 GLM-5.3,官方给出三个标签:最强安全模型、最强编程模型、最强开源模型。此次版本未更换基座模型,主要提升来自后训练环节,编程能力体感提升约 50%,并在漏洞挖掘和 AI 攻击防御上表现突出。
编程能力:多项评测逼近或反超顶尖模型
- 在 Terminal-Bench 3.0 上,得分从 4.6 跃升至 28.3,接近 Claude Fable 5 的 33.7。
- 在长程软件工程评测 DeepSWE v1.1 中,得分从 46.2 提升到 66.9,距 Fable 5 仅差 2.8 分,与 Kimi K3 的差距缩小至 0.6 分。
- 在 Agents' Last Exam 评测中,GLM-5.3 反超 Fable 5;在 GDPval-AA v2 中拿下全球第一。
官方自建评测 Z.ai Code Bench 将模型放入真实本地开发环境模拟 Coding Agent 使用。在最高难度 High 档位下,GLM-5.3 准确率为 31.4%,高于 Claude Opus 4.8 的 29.5%;同一高难任务下平均 Token 消耗约 5 万,而 Opus 4.8 需要 12 万,算力节省约一半。
训练上,智谱将专家级工程师的完整工作流复刻进训练环境,包括计算集群、存储系统、内部文档和代码库,让模型在真实环境中端到端完成复杂任务。
安全能力:从附属功能到主打招牌
官方披露,自 GLM-5.2 发布以来,智谱联合安全团队在 269 个开源和商业项目中累计发现 2436 个漏洞,其中中高危漏洞 1097 个,部分漏洞已潜伏近 40 年。此前 Hugging Face 遭攻击时,GLM-5.2 曾成功防御,成为其安全能力的重要验证。
GLM-5.3 构建了“纵深防御”风险审查系统,分为三层:
- 最外层:轻量级分类模型,快速拦截大规模低级别滥用。
- 中间层:推理监控器,实时监测模型任务意图。
- 最内层:模型自身的“深度安全对齐”,从底层逻辑上拒绝攻击请求。
系统根据“意图和语境”做风险分级,避免对安全防护工作的一刀切封杀。
实际案例中,GLM-5.3 曾辅助分析巴西一台临时文件服务器的异常,最终揭示了一个名为“Neo”的 AI Agent 黑客组织。该组织管理着 4 台黑客服务器、7 个恶意域名、6 万个邮箱和 100 多个自动化攻击脚本,并发送了 18567 封钓鱼邮件。GLM-5.3 在海量碎片化线索中提取关键信息、自动关联跨服务器攻击行为,协助还原了完整攻击链条。
此外,GLM-5.3 还协助发现了一个潜伏在互联网 DNS 协议规则底层、长达 40 多年的设计缺陷。攻击者可通过极少量特殊请求将服务器计算压力放大近 8 万倍,影响全球超 1000 万处公网 DNS 服务。相关漏洞已进入 CNVD 国家漏洞库协同修复流程。
后训练技术:IndexShare、SAO、Slime
智谱将能力提升归因于三项技术:
IndexShare(架构优化):解决长上下文算力成本问题。传统动态稀疏注意力每层需独立索引器,IndexShare 让每 4 层共享一个轻量级 Indexer。在 1M 上下文长度下,单位 Token 的 FLOPs 降低 2.9 倍,为长程强化学习训练扫清成本障碍。
SAO(强化学习算法):解决长程训练稳定性问题。传统同步 PPO、GRPO 等方法在长任务中约 160 步就会崩溃,SAO 实现单轨迹级别异步化训练,模型每完成一条轨迹即可更新参数,解耦训练与推理,稳定支持超过 1000 步的连续训练。
Slime(分布式后训练框架):采用“训推分离”流水线,通过数据缓冲区异步衔接推理生成和分布式训练。过去千亿参数模型强化学习训练需数周,使用 Slime 后缩短至 2-3 天,使后训练成为可高频迭代的常态化流程。
官方同步开放了编程工具 ZCode、效率工具 AutoClaw,并面向所有用户开放 GLM Coding Plan 订阅。
