深信服AI安全智能体CyberGym评测全球第四,超越OpenAI和Anthropic

2026/07/29 16:13阅读量 4

7月29日,深信服公布其AI安全智能体Sangfor AI在AI安全评测平台CyberGym中的最新成绩。在基于国产大模型GLM-5.2的配置下,Sangfor AI完成了1507项漏洞挑战中的1301项,成功率达86.3%,排名全球第四、国内第一,超越OpenAI和Anthropic的同类产品。该智能体采用“智能体群体协同”架构和“证据管治”机制,具备自主源码分析、多阶段漏洞推演和PoC验证能力。

事件概述

2026年7月29日,深信服宣布其AI安全智能体Sangfor AI在国际权威AI安全评测平台CyberGym中取得全球第四、国内参评团队第一的成绩。在固定使用国产大模型GLM-5.2的配置下,Sangfor AI面对涵盖ARVO与OSS-Fuzz的1507项漏洞挑战任务,成功完成1301项,整体成功率达86.3%,超越了OpenAI和Anthropic的同类产品。

评测背景

CyberGym是全球高含金量的代码安全大模型实战靶场,评测基于真实工业场景,以海量开源软件历史高危漏洞为考题,考核AI智能体自主源码分析、多阶段漏洞推演、漏洞复现与PoC验证的全链路能力。Sangfor AI在ARVO相关任务中成功率为87.2%,OSS-Fuzz任务成功率为77.7%,验证了国产大模型在复杂代码对抗中的稳定性。

核心技术与机制

Sangfor AI采用“智能体群体(Agent Swarm)协同作战”架构,并引入“证据管治”机制,技术框架包含四大核心逻辑:

  • 有界探索:围绕不同安全假设开启独立调查分支,并行推进,避免假设污染。
  • 证据持久化:各分支通过“证据”而非完整对话历史协同,保留已验证和已证伪的路径。
  • 动态假设裁决:协调层基于不断演化的证据状态,判断假设是否成立、问题是否解决、是否继续投入。
  • 对抗式候选评审:候选输入提交后需同时挑战“崩溃是否可复现”和“是否对应目标漏洞”,未通过则打回修正。

这套机制被总结为“以假设拓展探索,以证据裁定结论”,保证大范围排查的同时压低误判概率。

企业应用价值

深信服表示,相关技术已用于企业代码安全场景,推动传统静态应用安全测试(SAST)向具备自主推理和业务理解能力的安全Agent升级。相比传统规则匹配,新一代安全Agent可识别SQL注入、命令执行、越权访问、认证绕过等复杂风险。具体价值包括:

  • 提升漏洞检出能力,覆盖传统SAST盲区。
  • 降低人工审计成本,自动化代码理解与攻击路径推理。
  • 减少误报,依靠多阶段推理与证据验证机制。
  • 缩短研发交付周期,将安全检测前移至CI/CD流程。
  • 提升企业整体安全能力,早期遏制数据泄露与合规风险。

深信服表示将持续迭代安全Agent能力,将国际评测验证的前沿技术转化为企业可落地的安全方案。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。