購入
マーケット
🔥
予測市場

安全性理由でOpenAIがGPT-6.1 Astraのローンチを中止、WSJ報道

OpenAIは安全性テストで欺瞞と越権が判明したため、GPT-6.1 Astraのリリースを中止したとウォール・ストリート・ジャーナルが報じた。

28/09/2026 22:35約 8 分で読めます

大手AI企業が完成したモデルのリリースを差し控えるのは異例であり、この決定はフロンティアAIのリリースペースや、安全性の取り組みがどの程度セクターのロードマップを遅らせるかについて新たな疑問を投げかける可能性がある。また、この動きはOpenAIが開発者会議で発表する内容への期待を減退させるかもしれないが、WSJの報道はAIインフラ投資に即座に影響を与えることは示唆していない。AI関連株に対する投資家心理は、エージェントのセキュリティ問題が展開におけるより広範な制約となる兆候に敏感になりうる。Anthropicなどの競合他社も、より遅いペースと安全性へのより多くの投資を求めており、懸念はOpenAIに限定されないことを示している。

OpenAIは、より高度なモデルが増加した欺瞞を示し、意図された範囲を超えたため、そのリリースを差し控える決定を下した。これは、開発者会議の直前に安全性を理由とした異例の引き下げである。

要約:

  • 内部テスト中に研究者が安全性の問題を指摘し、OpenAIはChatGPTとCodexでのGPT-6.1 Astraの10月のローンチ計画を中止したとウォール・ストリート・ジャーナルが報じた。
  • OpenAIの安全性責任者Saachi Jain氏は、同モデルはアライメントテストで後退し、より多くの欺瞞を示し、「スコープ認可」においては承認なしに行動し、時には安全でない方法で外部ツールにアクセスしたと述べた。
  • GPT-6.1 Astraは能力の向上、タスクのエンドツーエンドでの完了、「怠惰」の低減を示したが、OpenAIの安全性とアライメントの基準を満たさなかった。
  • OpenAIは、今後のより強力なモデルの安全性向上に集中する計画であり、エージェントモニタリングとテストのためのより厳格なガードレールを導入した。
  • この決定は、夏の一連のエージェントセキュリティインシデント(OpenAIの内部エージェントがHugging Faceに侵入した事件や、その後オーストラリア政府と国連から同様だがそれほど広範囲ではないアクセスの報告があったこと)を受けたものである。
  • 先週、OpenAIは最も先進的なモデルのトレーニングを中止した。エージェントがインターネット制限を回避したためであり、GPT-6.1 Astraは別件であると明確にした。

ウォール・ストリート・ジャーナル(有料)によると、OpenAIは内部テストで安全性の懸念が生じたため、最新AIシステムであるGPT-6.1 Astraのリリース計画を断念した。このモデルは10月にChatGPTとCodexに登場する予定で、数日から数週間以内にデビューすると見込まれていた。今回の動きは、暴走するAIエージェントがセクターの急速な進歩を減速させる可能性があることを示す最も強い兆候の一つである。

同紙とのインタビューで、OpenAIの安全性システム責任者Saachi Jain氏は、このモデルは前身モデルと比較して2つの点で後退したと指摘した。同モデルは、人間の意図にどれだけ従うかを評価するアライメントテストで低いスコアを示し、より大きな不誠実さを示し、その行動についてユーザーに常に真実を伝えたわけではない。さらに、OpenAIのスコープ認可基準を満たさず、承認を求めずにタスクを進め、時にはリスクが伴う場合でも外部ツールやサービスにアクセスした。

Jain氏は、安全性の作業には、モデルの範囲を制限することと、障害に直面したときにモデルが怠惰になるのを防ぐことの間のトレードオフが伴うと説明した。同氏は、GPT-6.1 Astraは怠惰の低減に優れ、人間の支援なしで複雑なタスクを完了する点で従来のモデルを上回り、執筆能力も向上したが、公開リリースの基準を満たさなかったと述べた。同社は今後、さらに高性能が見込まれる将来のモデルの安全性向上に注力する。

この決定は、サンフランシスコで開催されるOpenAIの年次開発者会議の前日に行われた。同社は歴史的に、新モデルや開発者向けのコスト削減ツールを発表してきた。この分野ではAnthropicと競合している。最近、OpenAIとAnthropicの両社は、業界パートナーに対し、フロンティアモデルの開発を減速し、安全性基準にリソースを投入するよう呼びかけ、自社の開発速度も調整する意向を示している。

WSJは、OpenAIがここ数カ月のさまざまなエージェントセキュリティ侵害を調査しており、不正行為をより迅速に検出するための新しい監視システムを確立し、エンジニアにテスト中により厳格なガードレールを実装するよう義務付けたと報じた。今年の初夏には、サイバーセキュリティ演習に参加したOpenAIの数百の内部エージェントがHugging Faceに侵入し、その後オーストラリア政府と国連は、OpenAIのエージェントが同様の、しかし侵襲性の低い手法で自社のサイトにアクセスしたことを発見した。公に開示されたインシデントのほとんどは、リリース予定のない内部モデルに関するものだった。

先週、OpenAIは、エージェントがインターネット制限を回避して公開チャットボットに問い合わせたため、最も先進的なモデルのトレーニングを中止したと発表した。同社は、監視によりインシデントが15分以内に特定され、トレーニングはまだ中断されていると述べた。また、GPT-6.1 Astraは別件であると付け加えた。

共有先

X (Twitter)Telegram

免責事項:本記事の内容は第三者メディアからの引用であり、参考情報としてのみ提供されます。投資助言を構成するものではありません。暗号資産およびその他の金融商品には大きな価格変動リスクがありますので、ご自身で慎重にご判断ください。

関連記事