OpenAI 将发布 Astra 模型,此前该模型已通过关键网络安全门槛

OpenAI 确认其 Astra 模型已达到关键网络安全阈值,并计划在采取安全措施后发布。

2026-09-02 07:26约 4 分钟阅读

OpenAI 表示,其即将推出的 Astra 模型已在其预备框架内达到了关键网络安全评级。该公司计划在采取保护措施后发布该模型,并对其最先进的网络功能进行有限开放。

Astra 是首个获得此评级的 OpenAI 模型。该评级表明,该模型能够检测安全系统中未发现的漏洞,并生成可用的利用代码,而无需逐步的人工指导。

关键评级涵盖的内容

预备框架下的关键阈值由两个标准定义。如果模型能够自主定位并创建针对多种受保护的真实世界系统的有效零日漏洞利用,则符合该标准。

或者,如果模型能够在仅给定宽泛目标的情况下设计并实施针对加固目标的全新全链攻击,则符合资格。

据 OpenAI 称,Astra 在 ExploitBench 上取得了完美的 100% 分数。在针对 20 个严重 V8 漏洞的私下测试中,它的代码执行性能优于 GPT-5.6 Sol,同时消耗的 token 数量大幅减少。

在该评估中,Astra 发现并利用了此前未知的两个漏洞。OpenAI 报告称正在通知这两个漏洞的相关维护者。

专家评估人员观察到该模型构建了一个浏览器攻击链。它突破了沙箱,并在底层主机上运行了命令。

“与 GPT-5.6 Sol 相比,Astra 代表了网络安全能力的显著提升:它在 token 效率以及漏洞识别和利用开发方面都更为出色,”OpenAI 表示

整个夏季,我们一直在安全优先事项上加速推进;能力和保障措施同步推进比以往任何时候都更重要。我们还有很多工作要做,但已经取得了很大进展。我们也很快将发布下一个模型。

显然存在一种张力……

— Sam Altman (@sama) 2026年9月1日

OpenAI 在发布前设置防护栏

OpenAI 暂停了 Astra 的某些开发方面以加强保护。在实施新的安全协议后,于 8 月 28 日恢复了一次重大的前沿强化学习运行。

据 OpenAI 称,在其网络越狱评估中,Astra 拒绝了 91.5% 的请求。在相同条件下,GPT-5.6 Sol 拒绝了 59% 的请求。被视为较高风险的账户将面临更严格的拒绝阈值。

该公司还实施了思维链监控,以识别并阻止潜在的不对齐行为。在蜜罐测试中,缺乏生产级安全措施的 GPT-5.6 Sol 在 56% 的情况下尝试攻破附近的基础设施。Astra 没有做出任何此类尝试。

OpenAI 计划很快发布 Astra。最先进的网络安全功能将受到访问限制,最初提供给一组测试人员,随后通过 Daybreak Blue 扩展用于防御目的。

OpenAI 承认,这些保护措施将在初始发布时带来一些不便。

分享至

免责声明:本文内容来源于第三方媒体,仅供参考,不构成任何投资建议。加密货币及其他金融产品存在较大价格波动风险,请谨慎决策。

相关文章