开源模型GLM-5.3发布:Coding接近Claude Fable 5,安全审计成为新亮点

2026/08/14 16:47阅读量 4

智谱发布开源模型GLM-5.3,在Coding与智能体能力上接近Claude Fable 5,并成为多项主流基准中排名最高的开源模型。其在CyberGym白盒代码审查中得分84.5%,超过GLM-5.2及Mythos 5、GPT-5.6 Sol,成为最强开源安全模型。发布前联合清华、南开等机构开展的红队测试累计发现2404个漏洞,最早可追溯至40年前。

核心信息

智谱发布开源模型 GLM-5.3。该模型在多项主流基准测试中成为当前排名最高的开源模型,编程与智能体能力接近 Claude Fable 5,编程体感超过其他国产模型。随着 Token 预算增加,GLM-5.3 的 Coding 准确率持续提升;在 High 档位下,可用更低 Token 消耗实现超过 Claude Opus 4.8 最高档位的准确率。

安全方面,GLM-5.3 在 CyberGym 白盒代码审查中得分 84.5%,相比 GLM-5.2 的 77.2% 继续提升,略高于 Mythos 5 和 GPT-5.6 Sol,成为最强开源安全模型。发布前,智谱联合清华、南开及多家企业和实验室开展红队测试与安全评估,累计发现经初筛去重后的漏洞 2404 个,其中 1088 个为中高危,覆盖系统内核、操作系统、浏览器引擎、开源基础组件、互联网应用与协议等 220 个项目,最早漏洞可追溯到 40 年前。

实测表现

编程与智能体能力

  • 在《指环王》基准测试中,GLM-5.3 用 28 分钟自主完成一个中文版本;相同 Prompt 和设置下明显优于 GLM-5.2。
  • 约十几分钟内完成可交互的 3D 手表解构 Demo,没有扫描或下载手表模型,且放大后空间关系仍保持正确。
  • 40 分钟完成一个可交付的模拟游戏,包括前端、后端、数据库、权限、测试和部署;实测验证了注册登录、存档恢复、多账号数据隔离,并由模型自动运行全部测试并输出验收报告,前端、后端、数据库、权限全部跑通。

安全审计与漏洞修复

  • 在埋有安全问题的真实 Node.js 应用 AegisDesk 中,GLM-5.3 约 7 分钟生成 348 行安全审计报告,对照预埋答案识别出全部 12 类漏洞,包括明文密码、Stored XSS、Mass Assignment 提权、跨用户 IDOR、路径穿越和一条跨越 req.body→用户对象→Session role 的权限链;三个散布在不同路由的 IDOR 被合并为一个根因 Finding。唯一瑕疵是某处 CSRF 被标记为 CONFIRMED,但它也在报告末尾承认实际利用依赖浏览器 Cookie 行为。
  • 将同一份审计报告交给模型修复时,GLM-5.3 用时 9 分 20 秒修改 22 个文件、新增 1463 行代码:路径穿越加目录边界校验、IDOR 把 ownerId 压入数据查询、Stored XSS 在输出端修复、明文密码迁移到带 Salt 的 scrypt,并补出回归测试。ZCode 显示 54/54 通过,独立重跑后仍全部通过。
  • 在没有 NVIDIA GPU 的 Mac 上,GLM-5.3 未被告知环境限制,仍尝试用 CPU 模拟测试算法逻辑,并借助 Docker 中的 CUDA Toolkit 真实运行 nvcc;对真实 GPU 执行、CPU/GPU 数值一致性和性能 Benchmark 明确标记为 UNVERIFIED。CPU 测试被独立重跑后全部通过。

值得关注

GLM-5.3 的安全设计不是传统的“拒答危险问题”,而是让模型进入完整代码与工程环境后,理解漏洞为何成立。安全测试重点包括白盒代码审查与漏洞推理:前者从输入一路追踪到权限校验、数据流和危险操作;后者要求模型串起漏洞成立的前因后果。对 Mass Assignment 提权的分析即从 req.body 一路追出普通用户最终获得管理员权限的完整攻击链。

Coding Agent 已开始直接读取完整仓库、修改文件、调用终端、安装依赖、运行测试甚至参与部署,安全因此从编码流程末端前移,变成“写代码→运行→测试→发现风险→修复→重新验证”的闭环。今年 Hugging Face 处理一次自主 Agent 驱动的安全事件时,需要分析超过 17000 条攻击相关操作;由于部分商业模型 API 的安全机制会阻断分析,最终把 GLM-5.2 部署在自己的基础设施中用于重建攻击时间线。这反映出 Agent 以机器速度获得系统权限后,安全能力也需要跟上同等速度。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。