
Black Forest Labs ha lanzado FLUX 3, un modelo fundacional multimodal que abandona la convención de la industria de entrenar modelos separados para diferentes tipos de medios. En su lugar, aprende de imágenes, video, audio y secuencias de acciones robóticas dentro de una única arquitectura unificada, construida sobre la premisa de que ninguna modalidad por sí sola puede describir completamente cómo se comporta el mundo físico.
La empresa alemana, que se hizo conocida con los modelos de generación de imágenes de peso abierto FLUX.1, está realizando un giro estratégico significativo. FLUX 3 no es un generador de imágenes más grande, es una apuesta de que la misma representación subyacente que permite a un modelo renderizar una ola convincente también puede ayudar a un robot a predecir cómo instalar una puerta de automóvil.
La base técnica es Self-Flow, un método de entrenamiento que el laboratorio introdujo a principios de este año que combina un objetivo de flow-matching con reconstrucción de características auto-supervisada. FLUX 3 escala este enfoque a través de múltiples modalidades simultáneamente, y la empresa reporta resultados preliminares de preferencia humana que muestran al modelo superando a la competencia en todos los aspectos. En comparaciones directas de clips de texto a video de 10 segundos a 720p con audio, los evaluadores prefirieron FLUX 3 sobre Luma Ray 3.2 en el 93 por ciento de los casos, sobre Runway Gen-4.5 en el 77 por ciento, y sobre Grok Imagine Video en el 69 por ciento.
La capacidad principal es la generación de video de hasta 20 segundos en una sola pasada con audio nativo sincronizado, diálogo, efectos de sonido y ruido ambiental producidos todos juntos, no superpuestos después. El modelo admite texto a video, imagen a video, video a video con consistencia de personajes, transiciones controladas por fotogramas clave, diálogo multilingüe y encadenamiento agéntico que puede vincular clips en secuencias multicámara más largas. Black Forest Labs destaca una fortaleza particular en las expresiones faciales humanas y en asociar sonidos con eventos físicos, un vidrio rompiéndose suena como vidrio porque el modelo ha aprendido la relación causal entre el impacto y la firma acústica.
La generación de video consume más del 95 por ciento del poder de cómputo de entrenamiento del modelo. El audio, en contraste, representa menos del 0.5 por ciento de los tokens, una cifra que subraya lo económicamente que se adjunta la modalidad de audio una vez que la columna vertebral visual está en su lugar.
El componente robótico, llamado FLUX-mimic, reutiliza el motor de predicción de video de FLUX 3 con un decodificador ligero que traduce los fotogramas predichos en secuencias de movimiento robótico. Audi ya está probando el sistema para la instalación flexible de sellos de puertas, una tarea de manipulación de cuerpo blando que el equipo de desarrollo dice que era difícil de automatizar con la programación tradicional. FLUX-mimic responde en aproximadamente 101 milisegundos en una sola RTX 5090, y ciertas tareas pueden ajustarse con tan solo 30 minutos de datos de demostración robótica.
Black Forest Labs está implementando el lanzamiento en fases. Las capacidades de video y acción están disponibles ahora a través de APIs de acceso temprano y acceso privado a pesos para socios seleccionados. La síntesis y edición de imágenes seguirán en las próximas semanas. Una versión de peso abierto, FLUX 3 Dev, está planificada para más adelante en 2026, continuando el patrón del laboratorio de eventualmente publicar los pesos del modelo a la comunidad.
La señal más amplia que envía FLUX 3 trata sobre la dirección arquitectónica más que sobre una puntuación de referencia única. Al integrar imagen, video, audio y acción robótica en una sola columna vertebral, Black Forest Labs sostiene que la ruta más eficiente hacia la inteligencia visual general no es optimizar cada modalidad de forma aislada, sino forzarlas a restringirse mutuamente durante el entrenamiento. Si este enfoque unificado se mantiene fuera de las demostraciones seleccionadas se pondrá a prueba cuando los benchmarks independientes y el lanzamiento de peso abierto lleguen más tarde este año.
Fuentes: FLUX 3 – Real World Models (Black Forest Labs, 23 de julio de 2026); Black Forest Labs Unveils FLUX 3 (NYU Shanghai RITS, 24 de julio de 2026); Black Forest Labs Releases FLUX 3 (MarkTechPost, 26 de julio de 2026)
Traducido por Alessandra

