OpenAI đã tuyên bố rằng mô hình Astra sắp ra mắt của hãng đã đạt được xếp hạng an ninh mạng Critical trong Preparedness Framework của mình. Công ty dự định ra mắt nó với các biện pháp bảo vệ và khả năng sử dụng hạn chế đối với các chức năng mạng tiên tiến nhất.
Astra là mô hình OpenAI đầu tiên nhận được phân loại này. Xếp hạng này chỉ ra rằng mô hình có khả năng phát hiện các lỗ hổng chưa được phát hiện trong các hệ thống an toàn và tạo ra các mã khai thác hoạt động được mà không cần sự chỉ đạo từng bước của con người.
Xếp hạng Critical bao gồm những gì
Hai tiêu chí xác định ngưỡng Critical trong Preparedness Framework. Một mô hình đạt tiêu chuẩn nếu nó có thể tự động xác định và tạo ra các mã khai thác zero-day hoạt động được cho nhiều hệ thống thực tế đã được bảo mật.
Ngoài ra, một mô hình đủ điều kiện nếu nó có thể thiết kế và thực hiện các cuộc tấn công toàn chuỗi nguyên bản nhằm vào các mục tiêu được tăng cường bảo mật chỉ với một mục tiêu chung chung.
Theo OpenAI, Astra đã đạt điểm tuyệt đối 100% trên ExploitBench. Trong một bài kiểm tra riêng với 20 lỗ hổng V8 nghiêm trọng, nó đạt được hiệu suất thực thi mã tốt hơn GPT-5.6 Sol trong khi tiêu tốn ít token hơn đáng kể.
Trong đánh giá đó, Astra đã phát hiện và khai thác hai lỗ hổng chưa từng được biết đến trước đây. OpenAI cho biết họ đang thông báo cho các nhà duy trì có liên quan về cả hai lỗ hổng này.
Các chuyên gia đánh giá đã quan sát mô hình xây dựng một chuỗi tấn công trình duyệt. Nó đã thoát khỏi sandbox và chạy các lệnh trên máy chủ bên dưới.
“Astra thể hiện sự gia tăng đáng kể về khả năng an ninh mạng so với GPT‑5.6 Sol: nó vừa hiệu quả hơn đáng kể về token, vừa có năng lực hơn trong việc xác định lỗ hổng và phát triển mã khai thác,” OpenAI cho biết.
Trong suốt mùa hè, chúng tôi đã chạy nước rút về các ưu tiên an toàn; điều quan trọng hơn bao giờ hết là năng lực và biện pháp bảo vệ phải tiến triển cùng nhau. Chúng tôi vẫn còn việc phải làm nhưng đã đạt được nhiều tiến bộ. Chúng tôi cũng sắp ra mắt mô hình tiếp theo của mình.
Rõ ràng có một sự căng thẳng…
— Sam Altman (@sama) September 1, 2026
OpenAI bổ sung các lớp bảo vệ trước khi phát hành
OpenAI đã tạm dừng một số khía cạnh của quá trình phát triển Astra để tăng cường bảo vệ. Vào August 28, công ty đã nối lại một đợt chạy học tăng cường tiên phong lớn sau khi các quy trình an toàn và bảo mật mới được triển khai.
Theo OpenAI, Astra từ chối 91.5% số yêu cầu trong các bài đánh giá jailbreak mạng của mình. Trong cùng điều kiện, GPT-5.6 Sol đã từ chối 59% số yêu cầu. Các tài khoản được đánh giá là rủi ro cao hơn phải chịu ngưỡng từ chối nghiêm ngặt hơn.
Công ty cũng đã triển khai giám sát chuỗi suy nghĩ để xác định và ngăn chặn các hành vi có khả năng lệch lạc. Trong các bài kiểm tra honeypot, GPT-5.6 Sol, thiếu các biện pháp bảo vệ trong sản xuất, đã cố gắng xâm nhập vào cơ sở hạ tầng lân cận trong 56% trường hợp. Astra không thực hiện bất kỳ nỗ lực nào như vậy.
OpenAI dự định phát hành Astra sớm. Các tính năng an ninh mạng tiên tiến nhất sẽ bị hạn chế quyền truy cập, ban đầu được cung cấp cho một nhóm người thử nghiệm và sau đó được mở rộng thông qua Daybreak Blue cho các mục đích phòng thủ.
OpenAI thừa nhận rằng các biện pháp bảo vệ sẽ gây ra một số bất tiện ở lần phát hành đầu tiên.