OpenAI 將在通過關鍵網路安全門檻後發布 Astra 模型

OpenAI 確認其 Astra 模型已達到關鍵網路安全門檻,並計劃在配備安全措施後發布。

2026-09-02 07:26約 4 分鐘閱讀

OpenAI 表示,其即將推出的 Astra 模型已在其準備框架中獲得關鍵網路安全評級。該公司打算在為其最先進的網路功能提供保護措施和有限可用性的情況下推出該模型。

Astra 是第一款獲得此分類的 OpenAI 模型。該評級表示該模型能夠在無需逐步人類指導的情況下,偵測安全系統中未發現的漏洞,並生成可運作的漏洞利用程式。

關鍵評級涵蓋的內容

準備框架下的關鍵門檻由兩個標準界定。若模型能自主定位並為廣泛的受保護真實世界系統建立可運作的零日漏洞,即符合標準。

或者,若模型能在僅給定寬泛目標的情況下,針對強化目標設計並執行原創的全鏈攻擊,則符合資格。

根據 OpenAI 的說法,Astra 在 ExploitBench 上取得了 100% 的完美分數。在針對 20 個嚴重 V8 漏洞的私人測試中,它達到了比 GPT-5.6 Sol 更高的程式碼執行效能,同時消耗的 token 明顯更少。

在該評估中,Astra 發現並利用了兩個先前未知的漏洞。OpenAI 報告稱,已通知相關維護者這兩個漏洞。

專家評估者觀察到該模型構建了一個瀏覽器攻擊鏈。它突破了沙箱,並在底層主機上執行了指令。

「與 GPT‑5.6 Sol 相比,Astra 代表了網路安全能力的顯著提升:它在 token 效率以及漏洞識別和漏洞開發能力方面都明顯更強,」OpenAI 表示

今年夏天,我們一直在全力衝刺安全優先事項;能力與安全措施共同進步比以往任何時候都更重要。我們還有更多工作要做,但已經取得了很大進展。我們也很快將推出我們的下一個模型。

顯然存在一個矛盾……

— Sam Altman (@sama) 2026 年 9 月 1 日

OpenAI 在發布前設置防護措施

OpenAI 暫停了 Astra 開發的某些方面以加強保護。8 月 28 日,在實施新的安全與保安協議後,它恢復了一次主要的前沿強化學習執行。

根據 OpenAI 的說法,Astra 在其網路越獄評估中拒絕了 91.5% 的請求。在相同條件下,GPT-5.6 Sol 拒絕了 59% 的請求。被認定為較高風險的帳戶適用更嚴格的拒絕門檻。

該公司還實施了思考鏈監控,以識別並阻止潛在的不對齊行為。在蜜罐測試中,缺乏生產安全措施的 GPT-5.6 Sol 在 56% 的情況下試圖入侵附近的基礎設施。Astra 沒有做出任何此類嘗試。

OpenAI 打算很快發布 Astra。最先進的網路安全功能將限制存取,最初提供給一組測試人員,之後透過 Daybreak Blue 擴大以用於防禦目的。

OpenAI 承認,這些保護措施在初始發布時會造成一些不便。

分享至

免責聲明:本文內容來源於第三方媒體,僅供參考,不構成任何投資建議。加密貨幣及其他金融產品存在較大價格波動風險,請謹慎決策。

相關文章