GLM-5.3实测:同一个模型,表现为何天差地别?
智谱发布新模型GLM-5.3,官方称编码能力提升约50%,并意外涌现出网络安全能力,在CyberGym基准上取得开源第一。实测五个场景显示,模型对简洁提示词敷衍,但对详细需求和安全任务表现出顶尖水准,静态审计38秒完成,CVE复现即使清洗元数据也能识别。该模型两周后将开源,其安全能力存在被滥用的风险。
事件概述
智谱发布GLM-5.3,与GLM-5.2共用基座,所有提升来自后训练。官方称编码能力比5.2提升约50%,并意外涌现出网络安全能力。在漏洞挖掘基准CyberGym上,GLM-5.3取得84.5%,为开源权重第一,超过Mythos 5(83.8%)和GPT-5.6 Sol(83.6%);在ExploitBench上得分54.4%,是5.2(24.4%)的两倍多。官方披露,用该模型扫描真实代码库共发现2436个漏洞,覆盖269个项目,其中中高危1097个。
五个实测场景
1. 团队任务协作系统
让模型从零搭建Flask+SQLite系统,需包含登录鉴权、任务增删改查、看板分组、统计接口和前端页面。端到端流程首轮跑通,接口测试全绿,但UI审美明显低于预期。第二轮尝试添加看板拖动功能时,模型卡在验证环节并反复重试,无法自主换思路,只能手动终止。
结论:基本功够用,但审美和应变能力不足,存在“陷进去出不来”的执拗。
2. “指环王”渲染基准
该基准要求用Three.js将《指环王》开场程序化渲染。Opus 5用时约2小时、写5500行;DeepSeek V4-Pro用时30分钟;GLM-5.3仅用6分半、727行即跑通。场景元素齐全,但细节极度简化:树像冰激凌,人物没有手脚、像火腿肠。
结论:追求极致速度,但用质量换速度,适合快速出草稿而非高完成度成品。
3. 浮岛3D作品集
复用与Kimi K3、GPT-5.6完全相同的Prompt(React Three Fiber构建奇幻岛屿),一次跑通,四章节滚动相机过渡、物件交互、移动端降级全部实现,完成度达到可展示级。对比Kimi K3首次启动白屏、GPT-5.6 Sol点击物件时背景虚化,GLM-5.3在此场景表现最佳。
结论:Prompt描述越详细,模型越能发挥真实水平。
4. 静态代码安全审计
对含SQL注入、反射型XSS、路径穿越三处预设漏洞的Flask代码做审计,模型用时38秒,三处全部命中,零误报,还额外指出明文存储密码、缺少速率限制等三处未预设问题,并生成按危害等级排序的报告。
5. 复现CVE漏洞
针对Spring Cloud Gateway的远程代码执行漏洞(CVE-2022-22947),给定Docker沙箱和jar包。第一轮因jar保留构建日期(2022年3月2日)和依赖版本,模型直接报出CVE编号。清洗jar、抹去时间戳并随机化依赖名后,模型仍从漏洞特征中匹配到编号,且主动给出判断依据、漏洞原理和修复建议(修复建议是Prompt未要求的)。
核心观察
- GLM-5.3的能力分布不均衡,属于“看人下菜碟”:对简洁Prompt敷衍,对详细需求全力以赴,在安全领域则格外主动。
- 使用建议:需求描述不能偷懒,颗粒度直接决定产出;网安场景可放心交办;要接受它是偏科生,挑擅长的事做。
- 官方认为,模型能力提升正从“模型”转向“环境”,即搭建接近真实工作的测试环境比单纯提升模型参数更重要。
- 模型将在两周后开源。当编码与网络安全能力都处于前列的模型开放权重,其漏洞挖掘天赋既可能是白帽子的工具,也可能成为攻击者的武器,这是最值得关注的风险点。
