GCSA Agent、CyberGymで91.3%を達成、主要AIセキュリティエージェントにランクイン

GCSA AgentはCyberGymベンチマークで91.3%を記録し、世界トップクラスのAIサイバーセキュリティエージェントにランクインしました。

31/08/2026 08:41約 9 分で読めます

GCSA Agentは、要求の厳しい現実世界のベンチマークにおいて、脆弱性を自律的に分析し、概念実証エクスプロイトを生成する能力を示しています。

Global Cybersecurity Alliance(GCSA)は本日、同団体のGCSA AgentがCyberGymベンチマークで91.3%の成功率を達成し、CyberGymの「90%以上のリーディングシステム」カテゴリーに位置づけられたと発表しました。

カリフォルニア大学バークレー校の研究チームによって開発されたCyberGymは、現実世界の事例を用いた大規模なサイバーセキュリティ評価フレームワークです。188の主要ソフトウェアプロジェクトにわたる1,507件の過去の脆弱性テストケースを含み、AIエージェントが実際の脆弱性分析においてどのように機能するかを評価することを目的としています。

CyberGymは、コード理解、知識ベースのQ&A、静的解析に焦点を当てた典型的なAIベンチマークとは異なり、AIエージェントが実際の脆弱なコード環境内で直接動作することを要求します。

中核となるレベル1テストでは、AIエージェントは脆弱性の説明と未パッチのコードベースのみを受け取ります。その後、コードを自律的に分析し、脆弱性を特定し、潜在的な攻撃経路を推論し、概念実証(PoC)を構築し、検証のために実行しなければなりません。タスクは、PoCが未パッチバージョンで脆弱性を引き起こし、パッチ適用済みバージョンでは再現できない場合にのみ成功と見なされます。

したがって、CyberGymは単なるコード理解以上を評価します。AIがセキュリティ分析から脆弱性の再現、検証に至るまでのワークフロー全体を完了できるかどうかをテストします。

大規模言語モデルからセキュリティエージェントへ

CyberGym評価において、GCSA AgentはGrok 4.5およびGrok 4.6モデル上で動作し、最終的な成功率91.3%を達成しました。

この結果は、AIサイバーセキュリティにおける重要な転換を浮き彫りにしています。

基礎となる大規模言語モデルだけでは、システムの最終的なセキュリティ能力はもはや決まりません。

現実世界の脆弱性研究では、通常、脆弱性の説明を理解し、大規模なコードベースを検索し、攻撃対象領域を特定し、脆弱性仮説を形成し、テスト入力を生成し、プログラムを実行し、フィードバックを分析し、PoCを繰り返し改良するという連続的な一連のタスクが必要です。

GCSA Agentは、このプロセス全体を最初から最後までサポートするように設計されたエージェント型セキュリティワークフローを中心に構築されています。

その目的は、単に大規模言語モデルを使用してコード分析を行うことではなく、AIが実際の実行環境内で動作し、セキュリティ問題について自律的に仮説を形成し、実行時の証拠を収集し、テストを実行し、最終的に再現可能な結果を通じてセキュリティの発見事項を検証できるようにすることです。

CyberGymは、これらの能力に対する外部の定量的ベンチマークを提供します。

現実世界のための脆弱性研究能力

CyberGymの核となる強みは、従来のAIテストと現実世界のサイバーセキュリティ研究との間のギャップを縮小することにあります。

その評価環境は、ソフトウェアプロジェクトをパッチ適用前の脆弱な状態に復元します。AIエージェントは、数千のファイルと数百万行のコードを含む大規模なコードベース内で問題を自律的に特定し、最終的に脆弱性を実際に引き起こすPoCを生成する必要があるかもしれません。

さらに重要なことに、CyberGymのさらなる研究は、このようなエージェント型セキュリティ能力が既知の脆弱性の再現に限定されないことを示しています。

オープンエンドの脆弱性研究実験では、AIエージェントがこれまで未知のゼロデイ脆弱性や、根本的な問題を完全に解決していなかった過去のセキュリティパッチを複数特定しました。これらの発見は、自律的な脆弱性分析技術が既知の脆弱性の再現から現実世界のセキュリティ欠陥の発見へと進化する可能性を示しています。

GCSAにとって、これはさらに重要な開発方向です。

ベンチマークのパフォーマンスは最終目標ではありません。

GCSAは、現実世界のサイバーセキュリティ環境で動作し、脆弱性の発見と分析から検証、その後の修復に至るまで、セキュリティライフサイクル全体に段階的に関与できるAIセキュリティエージェントをさらに開発することを目指しています。

AIネイティブなサイバーセキュリティ能力の構築

人工知能がソフトウェア開発を加速させるにつれて、脆弱性の研究方法やサイバー脅威への対処方法も変革されています。

ソフトウェアシステムの規模と複雑さが増す中、次世代のサイバーセキュリティは、人間のセキュリティ専門家と自律型AIエージェントの協力にますます依存するようになるでしょう。

AIセキュリティエージェントは、セキュリティチームを支援する可能性を秘めています。

  • 実際に悪用される可能性のあるソフトウェア脆弱性をより早期に特定する。
  • 大規模なコードベース全体にわたる複雑な攻撃経路を自動的に分析する。
  • PoCを自動生成し、実行レベルの脆弱性検証を実行する。
  • 実際の実行結果を通じて従来のセキュリティ検出における誤検出を削減する。
  • 脆弱性の評価、検証、修復を加速する。
  • 専門のセキュリティチームがカバーできるソフトウェアとシステムの規模を拡大する。

GCSA Agentの91.3%のCyberGymスコアは、GCSAのAIネイティブなサイバーセキュリティ能力開発における重要なマイルストーンです。

今後、GCSAは自律型脆弱性分析、AIセキュリティエージェント、インテリジェントサイバーセキュリティ技術の研究を継続的に推進し、最先端のAI能力を現実世界のセキュリティ能力にさらに転換し、より安全で信頼性が高く、回復力のあるデジタル環境のための技術的サポートを提供していきます。

出典: GCSA Global Cybersecurity Alliance
サイト: www.gcsa.org

共有先

X (Twitter)Telegram

免責事項:本記事の内容は第三者メディアからの引用であり、参考情報としてのみ提供されます。投資助言を構成するものではありません。暗号資産およびその他の金融商品には大きな価格変動リスクがありますので、ご自身で慎重にご判断ください。

関連記事