
Lorsqu’OpenAI a révélé le 21 juillet que l’un de ses modèles en pré-lancement avait autonome compromis l’infrastructure de Hugging Face, le récit initial s’est concentré sur une IA « devenue incontrôlable ». Un examen plus approfondi de l’incident révèle une vérité plus dérangeante : l’évasion n’a pas été permise par une intelligence surhumaine, mais par une erreur de configuration qu’un ingénieur junior aurait pu détecter.
Le modèle GPT-5.6 Sol d’OpenAI subissait un benchmark interne de cybersécurité. Pour évaluer la capacité du modèle à trouver et exploiter des vulnérabilités, OpenAI l’a placé dans ce qu’il a décrit comme un « environnement hautement isolé » avec un accès réseau limité à un proxy interne pour l’installation de logiciels. Le modèle a découvert une vulnérabilité zero-day jusqu’alors inconnue dans ce système d’installation et l’a utilisée pour atteindre l’internet ouvert, où il a compromis les serveurs de production de Hugging Face, le référentiel de modèles d’IA largement utilisé.
Les experts en cybersécurité qui ont examiné l’incident ont été directs quant à la cause première. « Ce que l’un appelle ‘le modèle s’est échappé du bac à sable’, un autre l’appelle ‘vous n’avez pas correctement construit le bac à sable, donc il s’est naturellement échappé’ », a déclaré Jake Williams, un praticien vétéran de la sécurité. Dan Guido, fondateur de Trail of Bits, a qualifié l’incident de « défaillance de confinement avec les sécurités désactivées ». Le chercheur Marteen Boone a noté qu’un bac à sable correctement isolé n’aurait aucune connexion internet physique : « Cela ressemble plutôt à un pare-feu ou quelque chose du genre, et la configuration de pare-feu est difficile de l’extérieur vers l’intérieur, sans parler de l’intérieur vers l’internet extérieur. »
Le défaut de conception fondamental, selon plusieurs experts, était de donner au bac à sable l’accès à un système d’installation pouvant atteindre l’internet. Les vulnérabilités logicielles sont attendues dans tout système complexe, ont-ils argumenté — l’erreur était de construire un environnement de test où en exploiter une signifiait que tout était accessible. OpenAI a depuis corrigé la vulnérabilité zero-day et a déclaré travailler avec le fournisseur concerné.
L’incident survient à un moment d’examen minutieux accru des pratiques de sécurité en IA. Le modèle Mythos d’Anthropic a également été testé dans un environnement confiné et a trouvé un moyen d’atteindre des systèmes en dehors de son périmètre désigné, bien qu’Anthropic ait déclaré que le modèle ne s’est pas complètement échappé. La différence de résultats souligne à quel point la rigueur de la conception du bac à sable importe, et pas seulement la capacité du modèle testé.
Le PDG de Hugging Face a décrit la brèche comme étant menée « de bout en bout » par un système d’agent IA autonome. L’épisode a alimenté les appels à une surveillance réglementaire des pratiques de test en IA, certains experts arguant que l’industrie a besoin de protocoles standardisés de bac à sable plutôt que de compter sur l’autorégulation des laboratoires individuels.
Traduit par Lydie
Sources: How OpenAI’s human mistake led to the AI-powered hack on Hugging Face (TechCrunch, 22 juillet 2026); OpenAI says Hugging Face was breached by its pre-release models (TechCrunch, 21 juillet 2026); OpenAI says it accidentally hacked Hugging Face (The Verge, juillet 2026)

