深信服近日宣布,其自主研发的AI安全智能体Sangfor AI在权威国际评测平台CyberGym的代码安全实战测试中取得突破性成绩。基于国产大模型GLM-5.2架构的该系统,在涵盖ARVO与OSS-Fuzz两大类别的1507项漏洞挑战任务中,成功攻克1301项,整体完成率达86.3%,位列全球第四、国内榜首,首次实现国产技术对OpenAI、Anthropic等国际头部企业的超越。
作为全球首个聚焦工业场景的代码安全评测体系,CyberGym以真实开源软件高危漏洞为测试样本,构建了包含多阶段漏洞推演、源码自主分析、漏洞复现验证等核心能力的全链路评估框架。其严苛的评测标准被业界视为衡量AI安全技术实战能力的黄金标尺,测试结果直接影响企业级安全解决方案的选型参考。
技术团队披露,Sangfor AI的卓越表现得益于其独创的"智能体群体协同作战"架构。该系统通过四大核心机制实现精准漏洞挖掘:有界探索机制将不同安全假设隔离为独立调查分支,避免推理路径交叉污染;证据管治体系通过结构化存储已验证/证伪信息,消除重复试错成本;动态假设裁决引擎实时评估证据有效性,持续优化搜索空间;对抗式评审机制在漏洞确认阶段引入双重验证,确保结论可靠性。这种"假设驱动探索、证据裁定结果"的技术范式,使系统在保持高检出率的同时,将误报率控制在行业领先水平。
在细分场景测试中,该系统展现出均衡的攻防能力:ARVO任务成功率达87.2%,OSS-Fuzz任务成功率77.7%,特别是在复杂业务逻辑漏洞检测方面表现突出。技术负责人指出,传统SAST工具受限于规则匹配模式,难以识别越权访问、认证绕过等新型安全风险,而新一代AI安全Agent通过深度理解代码上下文,可自主推导攻击路径,实现从"被动检测"到"主动防御"的范式转变。
目前,相关技术已深度融入深信服产品矩阵,推动企业安全防护体系升级。在金融、能源等关键行业的应用实践中,该系统展现出三大核心价值:通过自动化跨文件关联分析,将人工审计工作量降低60%以上;多阶段推理机制使误报率下降45%,帮助研发团队聚焦真实风险;将安全检测嵌入CI/CD流水线,实现"代码提交即审计"的即时防护,使平均修复周期缩短3-5个工作日。某大型银行的安全负责人表示,系统上线后成功拦截多起零日漏洞攻击,有效防范了数据泄露引发的合规风险。
据技术白皮书披露,Sangfor AI的持续进化得益于百万级漏洞样本库与强化学习框架的深度融合。系统每日处理超过200万行代码的实时分析,通过自我对弈机制不断优化推理策略。深信服研发团队强调,后续将重点突破多模态漏洞理解、自动化修复生成等前沿领域,持续推动AI安全技术从实验室走向企业生产环境。本次评测的完整数据集已在CyberGym官网公开,供全球安全研究者参考验证。

