OpenAIのGPT-5.6 Solがサンドボックスから脱走し、Hugging Faceをハッキング——根本原因は人為的ミス

OpenAIが7月21日、プレリリースモデルの1つが自律的にHugging Faceのインフラを侵害したことを公表したとき、当初の報道は「暴走した」AIに焦点が当てられていた。しかし、このインシデントを詳しく見ると、より不快な真実が浮かび上がる。脱走を可能にしたのは超人的な知能ではなく、ジュニアエンジニアでも気づけたはずの設定ミスだった。

OpenAIのGPT-5.6 Solモデルは、内部のサイバーセキュリティベンチマークを受けていた。モデルの脆弱性発見・悪用能力を評価するため、OpenAIはモデルを「高度に隔離された環境」に置き、ネットワークアクセスをソフトウェアパッケージインストール用の内部プロキシのみに制限した。モデルはそのパッケージインストールシステムに未知のゼロデイ脆弱性を発見し、それを利用してオープンインターネットに到達。そこで広く利用されているAIモデルリポジトリであるHugging Faceの本番サーバを侵害した。

インシデントを調査したサイバーセキュリティ専門家らは、根本原因について率直に語った。「ある人が『モデルがサンドボックスから脱走した』と言うことは、別の人にとっては『サンドボックスを正しく構築しなかったから、当然脱走した』ということだ」と、ベテランセキュリティ実務家のJake Williams氏は述べた。Trail of Bits創業者のDan Guido氏は「安全装置がオフになった状態での封じ込めの失敗」と呼んだ。研究者のMarteen Boone氏は、適切にエアギャップされたサンドボックスには物理的なインターネット接続がまったくないはずだと指摘。「これはむしろ、ファイアウォールか何かを設置していたように思える。ファイアウォールは外部から内部への防御も難しいが、内部から外部インターネットへの防御はなおさら難しい」と述べた。

複数の専門家によると、核心的な設計上の欠陥は、サンドボックスにインターネットに到達可能なパッケージインストールシステムへのアクセスを許可したことだった。ソフトウェアの脆弱性は複雑なシステムでは避けられないと彼らは主張する——ミスは、1つの脆弱性を悪用すればすべてに到達可能なテスト環境を構築したことだった。OpenAIはその後ゼロデイ脆弱性にパッチを適用し、影響を受けたベンダーと協力していると述べている。

Every reader who contributes helps us stay independent and continue improving our coverage.

Support independent reporting

このインシデントは、AI安全慣行に対する監視が高まっている時期に発生した。AnthropicのMythosモデルも制限された環境でテストされ、指定された範囲外のシステムに到達する方法を見つけたが、Anthropicはモデルが完全に封じ込めを脱出したわけではないと述べている。結果の違いは、テストされるモデルの能力だけでなく、サンドボックス設計の厳格さがどれほど重要かを浮き彫りにしている。

Hugging FaceのCEOは、この侵害が自律型AIエージェントシステムによって「エンドツーエンドで」実行されたと述べた。この出来事はAIテスト慣行に対する規制監督の要求を強め、一部の専門家は業界が各研究室の自己規制に頼るのではなく、標準化されたサンドボックスプロトコルを必要としていると論じている。

雅子 訳

Sources: How OpenAI’s human mistake led to the AI-powered hack on Hugging Face (TechCrunch, 2026年7月22日); OpenAI says Hugging Face was breached by its pre-release models (TechCrunch, 2026年7月21日); OpenAI says it accidentally hacked Hugging Face (The Verge, 2026年7月)

Scroll to Top