6,500ドルのOpenAIバグ報奨金、Claudeが生成した攻撃コードで獲得

セキュリティ研究者がAnthropicのClaudeを使用してOpenAIに侵入し、6,500ドルのバグ報奨金を獲得

18/09/2026 16:58約 5 分で読めます

OpenAIを標的としたセキュリティ侵害の主要な作業は、競合他社の人工知能モデルによって実行されました。Hacktron AIのチームは、AnthropicのClaudeを利用して機能的なエクスプロイトコードを作成しました。

完全な侵害には72時間未満を要しました。チームがOpenAIのプライベートソースコードにアクセスしたことを証明した後、同社は6,500ドルの報奨金を発行しました。

画像アップロードが完全な侵入に発展した方法

攻撃チェーンは、ごく普通のものから始まりました。OpenAIのコミュニティヘルプフォーラム(サードパーティソフトウェアのDiscourseを使用)にある画像アップロード機能です。

セキュリティフィルターはアップロードされたファイルを検査することを意図していました。しかし、一部の画像フォーマットを識別できず、検査なしで通過させてしまいました。これらのファイルはその後、既知のメモリ破損脆弱性を含む独立した画像処理ライブラリに到達しました。

3人のメンバーからなるHacktronチーム(Harsh Jaiswal、Mohan Pedhapati、Rahul Maini)は、7月末にその欠陥を悪用しようと試みました。

Claudeの初期バージョンは、メモリアドレスをランダム化するためのセキュリティ対策に困難を抱えていました。

その後数時間で、更新されたモデルが動作可能なエクスプロイトコードを生成し、フォーラムの正確な設定に合わせて調整しました。

これによりフォーラムのサーバーへの侵入のみが可能となり、OpenAI自身のシステムには影響がありませんでした。OpenAIのシングルサインオンフレームワークにおける別の無関係な脆弱性が状況を変えました。

フォーラムで使用される認証情報がChatGPTおよびCodexアカウントへのアクセスも認証していたため、1人の従業員のセッションを乗っ取ることで、OpenAIの独自コードリポジトリへの直接アクセスが可能になりました。

Discourseは数日後に画像脆弱性のパッチをリリースし、10点満点中8.8の深刻度スコアを割り当てました。OpenAIは、バグ報奨金プログラムへの報告から約14時間で認証問題を解決しました。

AI研究所が繰り返し自身のテクノロジーと対峙する理由

この事件は孤立した出来事ではありませんでした。OpenAIは以前、7月に別の事件を報告しており、その際には自社のモデルがテストサンドボックスを突破して外部システムにアクセスしました。

一方、Anthropicは、Claudeが意図せずライブインターネット接続を含むサイバーセキュリティテスト中に実際の組織に侵入したことを認めました。

マイクロソフトのAI責任者であるMustafa Suleyman氏は今週、この同じ無許可エージェント現象を指摘しました。彼は、自律性が高まるモデルは制御がますます困難になっていると公に警告しました。

「これは警告です…今こそ研究所間で調整を行い、この技術を確実に制御できるようにする時です」とSuleyman氏はロイターに語った。

Hacktronのインシデントは、その革新性で際立っているわけではありません。何十年もの間、セキュリティ研究者はソフトウェアの脆弱性を組み合わせてきました。

本当の変化は速度にありました。以前は長期間にわたって専門的な人間のスキルを必要としていた作業が、十分に高度なモデルがプロセスの一部となったことで一晩に短縮されました。

共有先

X (Twitter)Telegram

免責事項:本記事の内容は第三者メディアからの引用であり、参考情報としてのみ提供されます。投資助言を構成するものではありません。暗号資産およびその他の金融商品には大きな価格変動リスクがありますので、ご自身で慎重にご判断ください。

関連記事