GCSA 代理在 CyberGym 上取得 91.3% 的成績,躋身頂尖 AI 安全代理之列

GCSA 代理在 CyberGym 基準測試中獲得 91.3% 的成績,位居全球頂尖 AI 網路安全代理之列。

2026-08-31 08:41約 6 分鐘閱讀

GCSA 代理展現了在嚴苛的真實世界基準測試中,自主分析漏洞並生成概念驗證利用程式的能力。

全球網路安全聯盟 (GCSA) 今日通報其 GCSA 代理在 CyberGym 基準測試中取得了 91.3% 的成功率,使其躋身 CyberGym 的 「領先系統超過 90%」 類別。

由 University of California, Berkeley 研究團隊開發的 CyberGym 是一個利用真實案例的大規模網路安全評估框架。它包含 1,507 個橫跨 188 個主要軟體專案的歷史漏洞測試案例,旨在評估 AI 代理在實際漏洞分析中的表現。

CyberGym 不同於典型的 AI 基準測試,後者側重於程式碼理解、基於知識的問答或靜態分析;CyberGym 要求 AI 代理直接在有漏洞的實際程式碼環境中運作。

在核心的 Level 1 測試中,AI 代理僅會收到漏洞描述和未修補的程式碼庫。接著它必須獨立分析程式碼、定位漏洞、推理潛在的攻擊路徑、建立概念驗證 (PoC),並執行以進行驗證。只有在 PoC 觸發未修補版本中的漏洞,而無法在已修補版本中重現時,該任務才算成功。

因此,CyberGym 評估的不僅是程式碼理解;它測試 AI 是否能完成從安全分析到漏洞重現與驗證的整個工作流程。

從大型語言模型到安全代理

在 CyberGym 評估中,GCSA 代理在 Grok 4.5 和 Grok 4.6 模型上運作,並達到了 91.3% 的最終成功率。

這項結果凸顯了 AI 網路安全的重大轉變:

底層的大型語言模型已不再是決定系統最終安全能力的唯一因素。

真實世界的漏洞研究通常需要一連串連續的任務:理解漏洞描述、搜尋大型程式碼庫、識別攻擊面、形成漏洞假設、生成測試輸入、執行程式、分析回饋,以及反覆疊代 PoC。

GCSA 代理是圍繞著一個代理式安全工作流程而建構,旨在從頭到尾支援整個過程。

其目標不只是使用大型語言模型進行程式碼分析,而是讓 AI 能在真實的執行環境中運作,自主形成關於安全問題的假設、收集執行時證據、執行測試,並最終透過可重現的結果來驗證安全發現。

CyberGym 為這些能力提供了一個外部量化基準。

適用於真實世界的漏洞研究能力

CyberGym 的核心優勢在於縮小傳統 AI 測試與真實世界網路安全研究之間的差距。

其評估環境將軟體專案恢復到修補前的漏洞狀態。AI 代理可能需要獨立地在一個包含數千個檔案和數百萬行程式碼的大型程式碼庫中找出問題,並最終產生一個能實際觸發漏洞的 PoC。

更重要的是,進一步的 CyberGym 研究顯示,這種代理式安全能力並不限於重現已知漏洞。

在開放式的漏洞研究實驗中,AI 代理已識別出多個先前未知的 零日漏洞,以及未完全解決根本問題的歷史安全修補程式。這些發現證明了自主漏洞分析技術從重現已知漏洞,發展到發現真實世界安全缺陷的潛力。

對 GCSA 而言,這是一個更為重要的發展方向。

基準測試的表現並非最終目標。

GCSA 旨在進一步開發能夠在真實世界網路安全環境中運作,並逐步參與從漏洞發現與分析,到驗證及後續修復等完整安全生命週期的 AI 安全代理。

建構 AI 原生網路安全能力

隨著人工智慧加速軟體開發,它也在改變漏洞研究與網路威脅應對的方式。

隨著軟體系統規模與複雜度的增長,下一代網路安全將越來越依賴人類安全專家與自主 AI 代理之間的合作。

AI 安全代理有潛力幫助安全團隊:

  • 在更早期階段識別具有真正利用潛力的軟體漏洞;
  • 自動分析跨大型程式碼庫的複雜攻擊路徑;
  • 自動生成 PoC 並執行執行層級的漏洞驗證;
  • 透過實際執行結果減少傳統安全檢測中的誤報;
  • 加速漏洞評估、驗證與修復;
  • 擴大專業安全團隊所能涵蓋的軟體與系統規模。

GCSA 代理的 91.3% CyberGym 分數 標誌著 GCSA 在開發 AI 原生網路安全能力方面的一個重要里程碑。

展望未來,GCSA 將持續推進自主漏洞分析、AI 安全代理與智慧網路安全技術的研究,進一步將前沿 AI 能力轉化為真實世界的安全能力,為一個更安全、更可信賴、更具韌性的數位環境提供技術支援。

來源:GCSA Global Cybersecurity Alliance
網站:www.gcsa.org

分享至

免責聲明:本文內容來源於第三方媒體,僅供參考,不構成任何投資建議。加密貨幣及其他金融產品存在較大價格波動風險,請謹慎決策。

相關文章