国际主流 AI 安全基准 CyberGym 最新发榜,复旦大学杨珉教授团队研制的白泽智能体 Whitzard 以 91.2% 的成功率位列全球第二、高校第一。这标志着我国高校自主研发的智能攻防技术已经进入全球第一阵营。
最新榜单中,中国团队占据全球前两名。深信服 Sangfor AI 以 93.1% 位列第一,复旦白泽紧随其后,第三、四名分别为美国微软 MDASH 和美国 Wiz 公司(Google 320 亿美元收购的网安巨头)。
CyberGym 由加州大学伯克利分校发起,收录了 188 个大型开源项目的 1507 个真实漏洞的基准测试,要求智能体在数百万行代码的完整仓库中,自主完成漏洞定位、路径分析、攻击构造与沙箱验证,是衡量 AI 实战攻防能力的国际竞技场。
此前,白泽智能体曾取得 68.9% 的阶段性成绩。经过对长程推理与动态验证机制的持续迭代,结合 DeepSeek-v4-Flash,最新版本成功攻克 1374 个真实漏洞,成功率提升至 91.2%,相比 DeepSeek 官方成绩提升 14.5%。这也进一步表明:真正面向复杂真实任务时,模型本身与智能体机制如何协同设计,正成为新的技术突破口。
面对国内头部安全企业以及微软、Wiz 等国际工业团队的同场竞争,复旦白泽以高校科研团队身份取得全球第二、高校第一。

微软 MDASH 与 Wiz Atlas 均采用多模型、多智能体集群架构,调度超 100 个专业 Agent 并行探索与协同,以高密度的计算投入扩充搜索边界,通过闭源模型矩阵与规模算力展现 " 算力美学 "。
复旦白泽则深耕 "AI for Security",采用自主研发的 WhitzardOS 模块化框架,专注于提升单次调用的有效推理密度,展现以学术创新释放模型潜能的 " 效能美学 "。
特别是白泽智能体全程仅调用 DeepSeek-v4-Flash 单个基础模型,1507 全量漏洞测试的模型调用总成本不足 5000 元人民币,极致的性价比打破了 "AI 安全必须依赖高额算力 " 的常态,展现出国产技术路线的硬核优势。
这一成绩表明,基础模型决定能力起点,而领域知识、算法机制与系统架构的创新,能够持续拓宽攻防智能体的能力上限。
据项目团队相关负责人介绍,白泽智能体的核心目的是以攻促防,打造智能时代的安全守门人。通过已开源的技术框架(AgentGuard)和开放评测基准(AgentCyberRange)等,与全球研究人员共同构建智能体防护屏障,确保 AI 网络安全能力可控、可信、向善。
作为国内唯一实现网络安全四大顶会杰出论文奖 " 大满贯 " 的团队,团队青年教师戴嘉润和潘旭东表示,未来,团队将继续深化理论突破,以具备安全边界的硬核科技,护航国家数字经济社会安全。