GCSA智能体在CyberGym上取得91.3%得分,跻身顶级AI安全智能体之列

GCSA智能体在CyberGym基准测试中取得91.3%的得分,跻身全球顶级AI网络安全智能体之列。

2026-08-31 08:41约 6 分钟阅读

GCSA智能体展示了在要求严苛的真实世界基准测试中自主分析漏洞并生成概念验证利用代码的能力。

全球网络安全联盟(GCSA)今日公布其GCSA智能体在CyberGym基准测试中取得91.3%的成功率,使其进入CyberGym的“90%以上领先系统”类别。

CyberGym由加州大学伯克利分校的一个研究团队开发,CyberGym是一个使用真实世界案例的大规模网络安全评估框架。它包括涵盖188个主要软件项目的1,507个历史漏洞测试用例,旨在评估AI智能体在实际漏洞分析中的表现。

CyberGym不同于那些专注于代码理解、基于知识的问答或静态分析的典型AI基准测试;它要求AI智能体直接在真实的易受攻击代码环境中运行。

在核心的Level 1测试中,AI智能体仅获得一份漏洞描述和一个未修补的代码库。然后,它必须独立分析代码、定位漏洞、推理潜在的攻击路径、构建概念验证(PoC)并执行它进行验证。只有当PoC在未修补版本中触发漏洞,而在已修补版本中无法复现时,任务才算成功。

因此,CyberGym评估的不仅仅是代码理解能力;它测试的是AI能否完成从安全分析到漏洞复现和验证的整个工作流程。

从大型语言模型到安全智能体

在CyberGym评估中,GCSA智能体运行在Grok 4.5和Grok 4.6模型上,最终成功率达到91.3%

这一结果凸显了AI网络安全领域的重大转变:

底层大型语言模型本身不再决定系统的最终安全能力。

真实世界的漏洞研究通常需要一系列连续任务:理解漏洞描述、搜索大型代码库、识别攻击面、形成漏洞假设、生成测试输入、执行程序、分析反馈,并反复迭代PoC。

GCSA智能体围绕一个智能体安全工作流构建,旨在从头到尾支持这一整个过程。

其目标不仅仅是使用大型语言模型进行代码分析,而是让AI能够在真实执行环境中工作,自主形成关于安全问题的假设、收集运行时证据、运行测试,并最终通过可复现的结果验证安全发现。

CyberGym为这些能力提供了一个外部量化基准。

面向真实世界的漏洞研究能力

CyberGym的一个核心优势在于缩小传统AI测试与真实世界网络安全研究之间的差距。

其评估环境将软件项目还原到修补前的易受攻击状态。AI智能体可能需要在包含数千个文件和数百万行代码的大型代码库中独立识别问题,并最终生成一个能够真正触发漏洞的PoC。

更重要的是,进一步的CyberGym研究表明,这种智能体安全能力并不仅限于复现已知漏洞。

在开放式漏洞研究实验中,AI智能体已识别出多个此前未知的零日漏洞,以及一些未能完全解决根本问题的历史安全补丁。这些发现表明,自主漏洞分析技术有潜力从复现已知漏洞向发现真实世界安全缺陷演进。

对GCSA而言,这是一个更为重要的发展方向。

基准测试成绩并非最终目标。

GCSA旨在进一步开发能够在真实世界网络安全环境中运行、并逐步参与从漏洞发现、分析到验证及后续修复的完整安全生命周期的AI安全智能体。

构建AI原生的网络安全能力

随着人工智能加速软件开发,它也在改变漏洞的研究方式和网络威胁的应对方式。

随着软件系统规模和复杂性的增长,下一代网络安全将越来越依赖于人类安全专家与自主AI智能体之间的协作。

AI安全智能体有潜力帮助安全团队:

  • 在更早阶段识别具有真正利用潜力的软件漏洞;
  • 自动分析大型代码库中的复杂攻击路径;
  • 自动生成PoC并执行执行级别的漏洞验证;
  • 通过真实执行结果减少传统安全检测中的误报;
  • 加速漏洞评估、验证和修复;
  • 扩大专业安全团队能够覆盖的软件和系统规模。

GCSA智能体的91.3% CyberGym得分标志着GCSA在构建AI原生网络安全能力方面的一个重要里程碑。

未来,GCSA将继续推进自主漏洞分析、AI安全智能体和智能网络安全技术的研究,进一步将前沿AI能力转化为真实世界的安全能力,并为更安全、更可信、更具韧性的数字环境提供技术支持。

来源: GCSA全球网络安全联盟
网站: www.gcsa.org

分享至

免责声明:本文内容来源于第三方媒体,仅供参考,不构成任何投资建议。加密货币及其他金融产品存在较大价格波动风险,请谨慎决策。

相关文章