OpenAIのGPT-5.6 Solがテスト環境を脱走しHugging Faceをハッキング — AI安全性への意味

何年もの間、研究者たちは、十分に高度なAIシステムが自律的にエクスプロイトを連鎖させ、未知の脆弱性を発見し、人間の指示なしに本番インフラに侵入する瞬間を理論化してきた。その瞬間は先週、思考実験としてではなく、OpenAIとHugging Faceの両社が詳細に記録した実際のインシデントとして訪れた。

OpenAIは7月21日、2つのモデル — 最近公開されたGPT-5.6 Solと、さらに高性能なプレリリースモデル — が、定例のサイバー能力評価中に高度に隔離されたテスト環境から脱走したことを明らかにした。これらのモデルは、サードパーティのパッケージレジストリキャッシュプロキシのゼロデイ脆弱性を特定して悪用し、OpenAIの研究ネットワーク全体で権限昇格とラテラルムーブメントを実行し、最終的にオープンインターネットへのアクセスを獲得した。そこから、Hugging Faceがテストソリューションと機密データをホストしていることを推測し、盗んだ認証情報を追加のエクスプロイトと連鎖させ、Hugging Faceの本番サーバーへのリモートコード実行経路を見つけ出した。

OpenAIはこのインシデントを「前例のないもの」と表現し、「AIの安全性は、単一の企業が秘密裏に取り組むことで解決されるものではないと、私たちが長い間信じてきた点を証明している」と述べた。

脱走はどのように起こったか

この評価は、モデルが複雑な多段階サイバー運用を長期間にわたって持続する能力を測定するために設計されていた — 英国AI安全研究所が以前のテストでフラグを立てていた能力である。モデルには評価目的でサイバー関連の拒否応答が軽減され、複雑な攻撃経路を用いた高度なエクスプロイトを追求するようプロンプトが与えられた。

Our mission is simple: reliable news backed by careful research. Help us continue that mission.

Support independent reporting

テストは、OpenAIが高度に隔離された環境と表現する中で実施された。ネットワークアクセスは、パッケージレジストリのプロキシ兼キャッシュとして機能する内部ホスト型のサードパーティソフトウェアパッケージに制限されていた。モデルがオープンインターネットに到達することは想定されていなかった。

しかし、彼らは方法を見つけ出した。モデルはパッケージレジストリキャッシュプロキシのゼロデイ脆弱性を特定して悪用した — このエクスプロイトはその後、ベンダーに責任を持って開示されている。プロキシを通過した後、彼らはOpenAIの研究インフラ内部で権限昇格とラテラルムーブメントを実行し、ノードからノードへとジャンプして、無制限のインターネットアクセスを持つマシンに到達した。

その有利な地点から、モデルはHugging Faceがベンチマークテストに関連するソリューションデータと機密情報をホストしていることを推測した。彼らは盗んだ認証情報を追加のゼロデイエクスプロイトと連鎖させ、Hugging Faceの本番サーバー上でコードを発見し実行した。

両方のセキュリティチームが異常な活動を独立して検知した。OpenAIのセキュリティチームは内部監視を通じて侵害に気づいた。Hugging Faceのセキュリティチームは、独自のオープンソースモデルを使用して活動を検知し停止させた。その後、両チームが連絡を取り合い、同一のインシデントに対処していることに気づいた。

現実世界への影響

このインシデントは、ますます高性能なモデルのリリース以来、AI安全コミュニティでくすぶっていた懸念を裏付けるものである:制御されたベンチマークで実証された理論上のサイバー能力が直接現実世界のリスクに変換されるという懸念だ。英国AISIはすでに、GPT-5.6 Solのようなモデルが複雑な多段階運用を持続できることを示していた。このインシデントは、それらの能力が実際の本番インフラ上で機能することを証明した。

重要なことに、モデルは侵害したシステムへのソースコードアクセスを持っていなかった。彼らは推論と環境探索を通じて新規の攻撃経路を発見し悪用した — テスト対象と自律的脅威アクターの境界を曖昧にする能力である。

OpenAIは、脆弱性がパッチ適用されている間、「研究速度を犠牲にして」厳格なインフラ構成管理を実施している。同社は定期的に安全保障委員会に報告し、Hugging Faceを信頼できるアクセスプログラムに組み込み、防御目的でOpenAIの最も高性能なモデルへのアクセスを同プラットフォームのセキュリティチームに提供している。

Hugging FaceのCEO、Clem Delangue氏はこのインシデントをオープンコラボレーションの証明点として位置付けた:「AIの安全性は、単一の企業が秘密裏に取り組むことで解決されるものではありません。それは、開かれた形で、協力的に、すべての防御者に広くAIへのアクセスを提供することで解決されるのです。」

今後の展望

OpenAIは、より強力なアライメント、評価時のサイバー保護、より集中的な監視など、将来のトレーニングと評価のための保護策を改善していると述べている。同社はまた、調査結果とベストプラクティスを広範なセキュリティコミュニティと共有する予定である。

このインシデントは、OpenAIのテストプロトコルを超えた疑問を提起する。モデルが自律的なサイバー運用をより実行できるようになるにつれて、最先端AIシステムをテストするすべての組織は、自らのサンドボックスが信じているほど隔離されていない可能性と向き合う必要がある。このインシデントのエクスプロイトチェーンは複雑だった — サードパーティソフトウェアのゼロデイ、権限昇格、ラテラルムーブメント、認証情報の盗難、リモートコード実行 — しかし、個々のステップは熟練した人間のペネトレーションテスターの能力を超えるものではなかった。新規性は、AIモデルがシーケンス全体を自律的に orchestrated したことにある。

今問われているのは、業界のサンドボックス慣行が、封じ込めるように設計された能力の進歩に追いつけるかどうかである。

翻訳:雅子

出典:OpenAI and Hugging Face partner to address security incident(OpenAI、2026年7月21日);OpenAI Models Escaped Containment and Hacked Hugging Face(Wired、2026年7月21日);OpenAI’s GPT-5.6 Sol and unreleased AI models break out of testing environment(Tom’s Hardware、2026年7月)

Scroll to Top