深信服AI安全智能体CyberGym评测全球第四,超越OpenAI和Anthropic
7月29日,深信服公布其AI安全智能体Sangfor AI在AI安全评测平台CyberGym中的最新成绩。在基于国产大模型GLM-5.2的配置下,Sangfor AI完成了1507项漏洞挑战中的1301项,成功率达86.3%,排名全球第四、国内第一,超越OpenAI和Anthropic的同类产品。该智能体采用“智能体群体协同”架构和“证据管治”机制,具备自主源码分析、多阶段漏洞推演和PoC验证能力。
事件概述
2026年7月29日,深信服宣布其AI安全智能体Sangfor AI在国际权威AI安全评测平台CyberGym中取得全球第四、国内参评团队第一的成绩。在固定使用国产大模型GLM-5.2的配置下,Sangfor AI面对涵盖ARVO与OSS-Fuzz的1507项漏洞挑战任务,成功完成1301项,整体成功率达86.3%,超越了OpenAI和Anthropic的同类产品。
评测背景
CyberGym是全球高含金量的代码安全大模型实战靶场,评测基于真实工业场景,以海量开源软件历史高危漏洞为考题,考核AI智能体自主源码分析、多阶段漏洞推演、漏洞复现与PoC验证的全链路能力。Sangfor AI在ARVO相关任务中成功率为87.2%,OSS-Fuzz任务成功率为77.7%,验证了国产大模型在复杂代码对抗中的稳定性。
核心技术与机制
Sangfor AI采用“智能体群体(Agent Swarm)协同作战”架构,并引入“证据管治”机制,技术框架包含四大核心逻辑:
- 有界探索:围绕不同安全假设开启独立调查分支,并行推进,避免假设污染。
- 证据持久化:各分支通过“证据”而非完整对话历史协同,保留已验证和已证伪的路径。
- 动态假设裁决:协调层基于不断演化的证据状态,判断假设是否成立、问题是否解决、是否继续投入。
- 对抗式候选评审:候选输入提交后需同时挑战“崩溃是否可复现”和“是否对应目标漏洞”,未通过则打回修正。
这套机制被总结为“以假设拓展探索,以证据裁定结论”,保证大范围排查的同时压低误判概率。
企业应用价值
深信服表示,相关技术已用于企业代码安全场景,推动传统静态应用安全测试(SAST)向具备自主推理和业务理解能力的安全Agent升级。相比传统规则匹配,新一代安全Agent可识别SQL注入、命令执行、越权访问、认证绕过等复杂风险。具体价值包括:
- 提升漏洞检出能力,覆盖传统SAST盲区。
- 降低人工审计成本,自动化代码理解与攻击路径推理。
- 减少误报,依靠多阶段推理与证据验证机制。
- 缩短研发交付周期,将安全检测前移至CI/CD流程。
- 提升企业整体安全能力,早期遏制数据泄露与合规风险。
深信服表示将持续迭代安全Agent能力,将国际评测验证的前沿技术转化为企业可落地的安全方案。
