
Black Forest Labs a publié FLUX 3, un modèle de fondation multimodale qui abandonne la convention industrielle consistant à former des modèles distincts pour différents types de médias. Au lieu de cela, il apprend à partir d’images, de vidéos, d’audio et de séquences d’actions robotiques au sein d’une architecture unique et unifiée, construite sur le principe qu’aucune modalité unique ne peut décrire complètement comment le monde physique se comporte.
La société allemande, qui s’est fait un nom avec les modèles open-weight de génération d’images FLUX.1, effectue un pivot stratégique significatif. FLUX 3 n’est pas un générateur d’images plus grand, c’est un pari que la même représentation sous-jacente qui permet à un modèle de rendre une vague convaincante peut également aider un robot à prédire comment installer une portière de voiture.
Le fondement technique est Self-Flow, une méthode d’entraînement que le laboratoire a introduite plus tôt cette année, combinant un objectif de flow-matching avec une reconstruction de caractéristiques auto-supervisée. FLUX 3 applique cette approche à travers plusieurs modalités simultanément, et la société rapporte des résultats préliminaires de préférence humaine qui montrent le modèle surpassant ses concurrents sur tous les tableaux. Dans des comparaisons directes de clips texte-vers-vidéo de 10 secondes en 720p avec audio, les évaluateurs ont préféré FLUX 3 à Luma Ray 3.2 dans 93 % des cas, à Runway Gen-4.5 dans 77 % des cas, et à Grok Imagine Video dans 69 % des cas.
La capacité phare est la génération vidéo jusqu’à 20 secondes en un seul passage avec un audio natif et synchronisé, dialogue, effets sonores et bruit ambiant tous produits ensemble, sans ajout ultérieur. Le modèle prend en charge le texte-vers-vidéo, l’image-vers-vidéo, la vidéo-vers-vidéo avec cohérence des personnages, les transitions contrôlées par images clés, le dialogue multilingue et l’enchaînement agentique qui peut lier des clips en séquences multi-plans plus longues. Black Forest Labs souligne une force particulière dans les expressions faciales humaines et dans l’association des sons avec des événements physiques, un verre qui se brise sonne comme du verre parce que le modèle a appris la relation causale entre l’impact et la signature acoustique.
La génération vidéo consomme plus de 95 % de la puissance de calcul d’entraînement du modèle. L’audio, en revanche, représente moins de 0,5 % des tokens, un chiffre qui souligne à quel point la modalité audio s’ajoute à moindre coût une fois que le backbone visuel est en place.
Le composant robotique, appelé FLUX-mimic, réutilise le moteur de prédiction vidéo de FLUX 3 avec un décodeur léger qui traduit les images prédites en séquences de mouvements robotiques. Audi teste déjà le système pour l’installation flexible de joints de portières, une tâche de manipulation de corps souple que l’équipe de développement dit difficile à automatiser avec la programmation traditionnelle. FLUX-mimic répond en environ 101 millisecondes sur un seul RTX 5090, et certaines tâches peuvent être affinées avec seulement 30 minutes de données de démonstration robotique.
Black Forest Labs déploie la version par phases. Les capacités vidéo et action sont disponibles dès maintenant via des API en accès anticipé et un accès privé aux poids pour des partenaires sélectionnés. La synthèse et l’édition d’images suivront dans les semaines à venir. Une version open-weight, FLUX 3 Dev, est prévue pour plus tard en 2026, poursuivant la pratique du laboratoire de finalement publier les poids du modèle à la communauté.
Le signal plus large que FLUX 3 envoie concerne la direction architecturale plutôt qu’un score de référence unique. En intégrant image, vidéo, audio et action robotique dans un seul backbone, Black Forest Labs soutient que la route la plus efficace vers l’intelligence visuelle générale n’est pas d’optimiser chaque modalité isolément, mais de les forcer à se contraindre mutuellement pendant l’entraînement. Que cette approche unifiée tienne la route en dehors des démonstrations soignées sera testé lorsque les benchmarks indépendants et la version open-weight arriveront plus tard cette année.
Sources : FLUX 3 – Real World Models (Black Forest Labs, 23 juillet 2026) ; Black Forest Labs Unveils FLUX 3 (NYU Shanghai RITS, 24 juillet 2026) ; Black Forest Labs Releases FLUX 3 (MarkTechPost, 26 juillet 2026)
Traduit par Lydie

