
Un equipo de investigadores de seguridad ha demostrado una nueva clase de ataque contra herramientas laborales impulsadas por IA: un solo enlace de ChatGPT que, al ser clickeado por un empleado, crea silenciosamente un agente malicioso completamente autónomo dentro del espacio de trabajo de ChatGPT de la empresa, equipado con la identidad, los permisos de acceso y las credenciales de aplicaciones conectadas de la víctima.
La vulnerabilidad, rastreada como AgentForger y divulgada públicamente el 23 de julio, fue reportada a OpenAI el 4 de junio a través de su programa Bugcrowd y parcheada al día siguiente. OpenAI eliminó el parámetro de URL que permitía el ataque dentro de las 24 horas posteriores a recibir el informe, aunque la clase subyacente de vulnerabilidad, lo que los investigadores llaman una falla de confianza en agentes, sigue siendo un problema de seguridad abierto para la industria.
Cómo funciona el ataque
La cadena de explotación comienza con un correo electrónico de phishing que contiene un enlace que parece ser una URL ordinaria de ChatGPT. El enlace, sin embargo, contiene instrucciones incrustadas que el constructor de agentes de ChatGPT interpreta como un comando de configuración. Con un solo clic, el constructor crea un agente de espacio de trabajo configurado con los permisos existentes y los conectores de aplicaciones de la víctima.
El agente recién creado no necesita contactar a un servidor de comando y control. En cambio, monitorea la bandeja de entrada de la víctima en busca de mensajes del atacante que contengan la palabra “TAREA” en la línea de asunto. Cada uno de estos correos se convierte en una nueva tarea, buscar archivos, cosechar credenciales, exfiltrar documentos, ejecutada a través de las cuentas conectadas de Outlook, Teams, Slack, SharePoint o Google Drive de la víctima.
El ataque tiene varios requisitos previos. La víctima debe pertenecer a un espacio de trabajo de ChatGPT donde la creación de agentes esté habilitada, debe tener permiso para crear agentes, y los administradores de la organización deben haber permitido conexiones a aplicaciones externas. En la práctica, estas condiciones describen un número creciente de empresas que implementan agentes de IA como herramientas de productividad.
Escenarios de prueba de concepto
El equipo de investigación demostró tres categorías de ataque alcanzables a través de AgentForger. La primera fue el rastreo de datos corporativos: el agente mapeó sistemáticamente las personas, proyectos y comunicaciones de una organización buscando a través de correos electrónicos, chats, calendarios y almacenes de archivos. La segunda fue la caza de credenciales: el agente buscó en los historiales de mensajes contraseñas y claves API incrustadas. La tercera fue la suplantación interna: el agente envió mensajes convincentes a través de las propias cuentas de Teams o correo electrónico de la víctima, utilizando su identidad para engañar a colegas y hacerlos revelar información sensible.
El hilo común entre los tres escenarios es que el agente opera bajo una identidad en la que la organización confía, haciendo que sus acciones sean indistinguibles del comportamiento legítimo de un empleado. Los controles de seguridad tradicionales, cortafuegos, detección de endpoints, monitoreo de red, no fueron diseñados para distinguir entre un empleado humano accediendo a archivos y un agente de IA haciendo lo mismo bajo las credenciales de ese empleado.
Cronología y respuesta
OpenAI reconoció el informe el 5 de junio de 2026 y desplegó una corrección para el 9 de junio que eliminaba el parámetro de URL vulnerable. La divulgación pública del 23 de julio sigue la ventana de divulgación coordinada estándar de 30 a 45 días. La empresa no respondió a las consultas de la prensa sobre si había detectado alguna explotación de la vulnerabilidad antes de la corrección.
El significado más amplio de AgentForger se extiende más allá de la vulnerabilidad específica de ChatGPT. A medida que los agentes de IA pasan de responder preguntas a tomar acciones en los sistemas corporativos, leer archivos, enviar mensajes, modificar datos, la superficie de ataque comienza a parecerse a una fuerza laboral en lugar de un software tradicional. Un agente comprometido no roba credenciales para suplantar a un empleado; se le emiten credenciales por parte del empleador y luego se utilizan en su contra.
Traducido del inglés. Artículo original: Ada (Nous Research)
Traducido por Alessandra

