GCSA Agent đạt 91.3% trên CyberGym, nằm trong số các Agent An ninh AI hàng đầu

GCSA Agent đạt 91.3% trên chuẩn CyberGym, xếp hạng trong số các agent an ninh mạng AI hàng đầu thế giới.

31/08/2026 08:41Đọc khoảng 18 phút

GCSA Agent thể hiện khả năng tự động phân tích lỗ hổng và tạo ra các khai thác proof-of-concept trên một chuẩn đánh giá thực tế khó khăn.

Hôm nay, Liên minh An ninh mạng Toàn cầu (GCSA) đã báo cáo tỷ lệ thành công 91.3% trên chuẩn CyberGym cho GCSA Agent, đưa nó vào danh mục "Hệ thống hàng đầu trên 90%" của CyberGym.

Được phát triển bởi nhóm nghiên cứu Đại học California, Berkeley, CyberGym là một khung đánh giá an ninh mạng quy mô lớn sử dụng các trường hợp thực tế. Nó bao gồm 1,507 trường hợp kiểm thử lỗ hổng lịch sử trải dài 188 dự án phần mềm lớn và nhằm đánh giá cách các agent AI thực hiện trong phân tích lỗ hổng thực tế.

CyberGym khác biệt so với các chuẩn AI điển hình tập trung vào hiểu mã, Q&A dựa trên kiến thức hoặc phân tích tĩnh; nó yêu cầu các agent AI hoạt động trực tiếp trong môi trường mã có lỗ hổng thực tế.

Đối với bài kiểm tra cốt lõi Level 1, một agent AI chỉ nhận được mô tả lỗ hổng và một cơ sở mã chưa vá. Sau đó, nó phải độc lập phân tích mã, xác định vị trí lỗ hổng, suy luận về các đường tấn công tiềm năng, xây dựng proof-of-concept (PoC) và thực thi nó để xác minh. Một nhiệm vụ được coi là thành công chỉ khi PoC kích hoạt lỗ hổng trong phiên bản chưa vá trong khi không thể tái tạo nó trong phiên bản đã vá.

Do đó, CyberGym đánh giá nhiều hơn chỉ hiểu mã; nó kiểm tra liệu AI có thể hoàn thành toàn bộ quy trình từ phân tích bảo mật đến tái tạo và xác thực lỗ hổng hay không.

Từ Mô hình Ngôn ngữ Lớn đến Agent Bảo mật

Đối với đánh giá CyberGym, GCSA Agent hoạt động trên các mô hình Grok 4.5 và Grok 4.6 và đạt tỷ lệ thành công cuối cùng là 91.3%.

Kết quả này nhấn mạnh một sự thay đổi đáng kể trong an ninh mạng AI:

Mô hình ngôn ngữ lớn cơ bản không còn là yếu tố duy nhất quyết định khả năng bảo mật cuối cùng của hệ thống.

Nghiên cứu lỗ hổng thực tế thường yêu cầu một chuỗi nhiệm vụ liên tục: hiểu mô tả lỗ hổng, tìm kiếm các cơ sở mã lớn, xác định bề mặt tấn công, hình thành giả thuyết lỗ hổng, tạo đầu vào kiểm thử, thực thi chương trình, phân tích phản hồi và lặp lại nhiều lần trên các PoC.

GCSA Agent được xây dựng xung quanh một quy trình bảo mật dạng agent được thiết kế để hỗ trợ toàn bộ quá trình này từ đầu đến cuối.

Mục tiêu của nó không chỉ đơn thuần là sử dụng mô hình ngôn ngữ lớn để phân tích mã, mà là cho phép AI làm việc bên trong các môi trường thực thi thực tế, tự động hình thành giả thuyết về các vấn đề bảo mật, thu thập bằng chứng runtime, chạy thử nghiệm và cuối cùng xác thực các phát hiện bảo mật thông qua các kết quả có thể tái tạo.

CyberGym cung cấp một chuẩn định lượng bên ngoài cho các khả năng này.

Khả năng Nghiên cứu Lỗ hổng cho Thế giới Thực

Một điểm mạnh cốt lõi của CyberGym nằm ở việc thu hẹp khoảng cách giữa kiểm thử AI truyền thống và nghiên cứu an ninh mạng thực tế.

Môi trường đánh giá của nó khôi phục các dự án phần mềm về trạng thái dễ bị tấn công trước khi vá. Một agent AI có thể cần tự xác định vấn đề trong một cơ sở mã lớn chứa hàng nghìn tệp và hàng triệu dòng mã, và cuối cùng tạo ra một PoC thực sự có thể kích hoạt lỗ hổng.

Quan trọng hơn, nghiên cứu sâu hơn của CyberGym đã chỉ ra rằng các khả năng bảo mật dạng agent như vậy không bị giới hạn trong việc tái tạo các lỗ hổng đã biết.

Trong các thí nghiệm nghiên cứu lỗ hổng mở, các agent AI đã xác định nhiều lỗ hổng zero-day chưa từng biết trước đây cũng như các bản vá bảo mật trong quá khứ không giải quyết triệt để các vấn đề cơ bản. Những phát hiện này cho thấy tiềm năng của các công nghệ phân tích lỗ hổng tự động phát triển từ việc tái tạo các lỗ hổng đã biết sang phát hiện các lỗ hổng bảo mật thực tế.

Đối với GCSA, đây là một hướng phát triển thậm chí còn quan trọng hơn.

Hiệu suất chuẩn không phải là mục tiêu cuối cùng.

GCSA nhằm phát triển thêm các AI Security Agent có khả năng hoạt động trong môi trường an ninh mạng thực tế và dần dần tham gia vào toàn bộ vòng đời bảo mật, từ phát hiện và phân tích lỗ hổng đến xác thực và khắc phục sau đó.

Xây dựng Khả năng An ninh mạng AI-Native

Khi trí tuệ nhân tạo thúc đẩy phát triển phần mềm, nó cũng đang biến đổi cách nghiên cứu lỗ hổng và giải quyết các mối đe dọa mạng.

Với các hệ thống phần mềm ngày càng lớn và phức tạp, thế hệ an ninh mạng tiếp theo sẽ ngày càng phụ thuộc vào sự hợp tác giữa các chuyên gia bảo mật con người và các agent AI tự động.

AI Security Agent có tiềm năng giúp các đội bảo mật:

  • Xác định các lỗ hổng phần mềm có tiềm năng khai thác thực sự ở giai đoạn sớm hơn;
  • Tự động phân tích các đường tấn công phức tạp trên các cơ sở mã lớn;
  • Tự động tạo PoC và thực hiện xác thực lỗ hổng ở mức thực thi;
  • Giảm các dương tính giả trong phát hiện bảo mật truyền thống thông qua kết quả thực thi thực tế;
  • Tăng tốc đánh giá, xác thực và khắc phục lỗ hổng;
  • Mở rộng quy mô phần mềm và hệ thống mà các đội bảo mật chuyên trách có thể bao phủ.

Điểm 91.3% trên CyberGym của GCSA Agent đánh dấu một cột mốc quan trọng trong quá trình phát triển năng lực an ninh mạng AI-native của GCSA.

Trong tương lai, GCSA sẽ tiếp tục thúc đẩy nghiên cứu về phân tích lỗ hổng tự động, AI Security Agent và các công nghệ an ninh mạng thông minh, tiếp tục chuyển đổi các khả năng AI tiên tiến thành các khả năng bảo mật thực tế và cung cấp hỗ trợ kỹ thuật cho một môi trường số an toàn hơn, đáng tin cậy hơn và kiên cường hơn.

Nguồn: GCSA Global Cybersecurity Alliance
Trang web: www.gcsa.org

Chia sẻ tới

X (Twitter)Telegram

Tuyên bố miễn trừ trách nhiệm: Nội dung bài viết đến từ bên thứ ba, chỉ mang tính tham khảo và không phải lời khuyên đầu tư. Tiền mã hóa và các sản phẩm tài chính khác có rủi ro biến động giá lớn, vui lòng cân nhắc kỹ trước khi quyết định.

Bài viết liên quan