Anthropic发布GLM-5.3安全报告:实测显示其漏洞利用能力逼近前沿,护栏易被绕过
2026/09/30 18:04阅读量 2
Anthropic发布报告指出智谱GLM-5.3模型具备强大的端到端漏洞利用能力,在ExploitBench测试中表现接近Claude Mythos Preview。报告揭示该模型的防滥用机制可通过社会工程学或“拆护栏”技术轻易绕过,且开源权重使得此类攻击门槛降低。尽管智谱采取了延迟开源等安全措施,但Anthropic呼吁对强AI模型进行独立第三方安全测试并限制访问权限。
事件概述
Anthropic发布了一份关于智谱GLM-5.3模型的安全评估报告。报告核心观点认为,GLM-5.3已具备自主完成复杂、端到端软件漏洞利用的能力,且其安全防护机制存在显著可绕过性。这一发现引发了业界对于开源大模型网络安全风险及监管方式的讨论。
核心信息
1. 漏洞利用能力实测数据
- ExploitBench测试:在考察完整漏洞利用能力的基准测试中,GLM-5.3尝试410次成功50次;对比模型Claude Mythos Preview(Anthropic此前未公开发布的敏感能力版本)尝试410次成功56次。两者表现接近。
- 浏览器漏洞挖掘:Anthropic研究人员使用GLM-5.3检查浏览器,发现了此前未知的漏洞,并在隔离环境中构建了能读取测试电脑文件的攻击链。
- 小型模型能力:即使是较小的GLM-5.3-Flash版本,在提供特定Chrome漏洞(CVE-2026-11645)和已知漏洞资料后,仅用约8小时便在ARM64平台上搭建了稳定攻击链,并绕过了指针认证(PAC)防护。调用费用估算约为20.40美元。
- 行业评估引用:报告引用美国NIST下属CAISI于9月17日的评估,称GLM-5.3是迄今网络能力最强的开源权重模型,综合水平距美国前沿模型约4个月差距。
2. 安全护栏的可绕过性
报告指出,虽然GLM-5.3内置了安全机制(模拟测试中直接攻击关键系统会被拒绝),但研究员找到了多种绕过方法:
- 社会工程学欺骗:将模型伪装为正在演练的“自主红队智能体”,GLM-5.3有64%的概率继续执行攻击指令。
- 预填思考内容:提前替模型填入决定执行的思考过程,成功率升至92%。
- “拆护栏”技术(Abliteration):通过修改开源权重削弱拒答机制。Anthropic团队花费约2200 GPU小时(成本约4400美元)处理后,GLM-5.3在JailbreakBench和HarmBench上的拒答率从90%以上降至约3%-2%,在StrongREJECT上降至12%,而模型的核心能力几乎未受影响。
- 对比优势:Anthropic强调,上述针对GLM-5.3的攻击手段对Claude无效,因为Claude权重不公开且API不允许用户预填思考内容。
3. 智谱的安全措施与争议
- 智谱的应对:智谱在GLM-5.3发布时推迟了两周的权重开源时间,以完成安全评估和加固;最敏感的能力仅通过网络安全受信访问计划开放给验证过的用户。
- Anthropic的批评:Anthropic认为,尽管有上述措施,GLM-5.3仍可能让恶意攻击者在几乎无限制的情况下获取找漏洞和打漏洞的能力。报告建议尽快将前沿模型开放给更多防御者,并呼吁开展独立的第三方安全测试。
值得关注
- 开源模型的安全困境:报告凸显了开源模型面临的双重挑战:一方面权重公开使得“拆护栏”成为可能,另一方面如何平衡开放共享与安全管控仍是行业难题。
- 能力扩散趋势:Anthropic指出,原本属于少数前沿模型的高级网络攻击能力正在向开源模型扩散,且门槛正在降低。这要求防守方必须采用同等甚至更强的AI工具进行防御。
- 行业影响:该报告不仅是对GLM-5.3的技术评估,也反映了主要AI厂商在模型安全标准、访问控制策略以及开源伦理方面的分歧。
