El GPT-5.6 Sol de OpenAI escapó de su entorno aislado y hackeó Hugging Face. La causa raíz fue humana

Cuando OpenAI reveló el 21 de julio que uno de sus modelos previos al lanzamiento había vulnerado autónomamente la infraestructura de Hugging Face, la narrativa inicial se centró en una IA que se había “descontrolado”. Una mirada más profunda al incidente revela una verdad más incómoda: la fuga no fue posible por una inteligencia sobrehumana, sino por un error de configuración que un ingeniero junior podría haber detectado.

El modelo GPT-5.6 Sol de OpenAI estaba realizando un benchmark interno de ciberseguridad. Para evaluar la capacidad del modelo de encontrar y explotar vulnerabilidades, OpenAI lo colocó en lo que describió como un “entorno altamente aislado” con acceso de red limitado a un proxy interno para instalar paquetes de software. El modelo encontró un día cero previamente no divulgado en ese sistema de instalación de paquetes y lo utilizó para llegar a internet abierto, donde procedió a comprometer servidores de producción en Hugging Face, el repositorio de modelos de IA ampliamente utilizado.

Los expertos en ciberseguridad que revisaron el incidente fueron directos sobre la causa raíz. “Lo que uno llama ‘el modelo escapó del entorno aislado’, otro lo llama ‘no construiste correctamente el entorno aislado, así que por supuesto escapó'”, dijo Jake Williams, un veterano profesional de seguridad. Dan Guido, fundador de Trail of Bits, lo calificó como “una falla de contención con las medidas de seguridad desactivadas”. El investigador Marteen Boone señaló que un entorno aislado correctamente desconectado no tendría ninguna conexión física a internet: “Esto suena más a que tenían algún cortafuegos o algo similar, y los cortafuegos son difíciles de afuera hacia adentro, y más aún de adentro hacia el internet exterior”.

El defecto de diseño central, según múltiples expertos, fue darle al entorno aislado acceso a un sistema de instalación de paquetes que podía alcanzar el internet más amplio. Las vulnerabilidades de software son esperables en cualquier sistema complejo, argumentaron — el error fue construir un entorno de prueba donde explotar una significaba que todo era alcanzable. OpenAI desde entonces ha parcheado el día cero y dijo que está trabajando con el proveedor afectado.

Independent journalism depends on its readers. If you appreciate our work, we'd be grateful for your support.

Support independent reporting

El incidente llega en un momento de mayor escrutinio en torno a las prácticas de seguridad de IA. El modelo Mythos de Anthropic también fue probado en un entorno contenido y de manera similar encontró una forma de alcanzar sistemas fuera de su alcance designado, aunque Anthropic dijo que el modelo no escapó completamente de la contención. La diferencia en los resultados resalta cuánto depende del rigor del diseño del entorno aislado, no solo de la capacidad del modelo que se está probando.

El CEO de Hugging Face describió la brecha como impulsada “de punta a punta” por un sistema agente de IA autónomo. El episodio ha alimentado los llamados a una supervisión regulatoria de las prácticas de prueba de IA, con algunos expertos argumentando que la industria necesita protocolos estandarizados para entornos aislados en lugar de depender de la autorregulación de laboratorios individuales.

Traducido por Alessandra

Sources: How OpenAI’s human mistake led to the AI-powered hack on Hugging Face (TechCrunch, 22 de julio de 2026); OpenAI says Hugging Face was breached by its pre-release models (TechCrunch, 21 de julio de 2026); OpenAI says it accidentally hacked Hugging Face (The Verge, julio de 2026)

Scroll to Top