Modèle multimodal de pointe de Black Forest Labs pour la création visuelle.
Générez de la vidéo avec audio natif à partir de texte ou d'images — jusqu'à 20 secondes en 720p ou 1080p.
FLUX 3 est le nouveau modèle fondation multimodal de Black Forest Labs, l'étape suivante après les familles d'images FLUX et FLUX.2. Au lieu de traiter les images fixes isolément, FLUX 3 apprend conjointement à partir d'images, vidéos et audio dans une architecture unifiée. L'objectif n'est pas seulement de plus belles images — c'est une meilleure compréhension de l'apparence des scènes, du déroulement du mouvement et du son des événements. Ce socle commun alimente la génération créative sur images fixes et vidéo courte. Sur Flux.art, utilisez FLUX 3 Video : texte vers vidéo et image vers vidéo avec audio natif optionnel, aperçus brouillon et clips jusqu'à 20 secondes.
FLUX 3 est conçu comme un système multimodal unique entraîné sur signaux image, vidéo et audio — pas un empilement de modèles séparés assemblés après l'entraînement.
En apprenant comment les scènes paraissent, bougent et sonnent ensemble, FLUX 3 capture structure, mouvement et causalité visuelle plutôt que des motifs de pixels isolés.
La même famille de modèles vise génération d'images haute qualité et vidéo courte avec audio optionnel — cohérence visuelle sur une campagne.
Du visuel marketing au court-format social et storytelling de marque — cas d'usage orientés production, pas seulement des démos de recherche.
FLUX 3 marque un passage des générateurs « image seule » vers des modèles traitant la vision comme multimodale et continue dans le temps. Pour les équipes publiant chaque semaine, cela affecte qualité, cohérence et conception des workflows.
Capacités clés à connaître pour les workflows image et vidéo FLUX 3.
Générez des clips jusqu'à environ 20 secondes avec audio natif optionnel. Visages expressifs, son lié aux événements et scénarios multilingues pour pubs et réseaux sociaux.
Synthèse et édition d'images avec meilleur suivi de prompts complexes et rendu texte multilingue que les versions FLUX antérieures.
Une architecture entraînée sur image, vidéo et audio — images fixes et mouvement partagent une compréhension plus cohérente des objets, de la lumière et de la structure de scène.
Gère prompts complexes et texte haute précision en plusieurs langues — affiches, maquettes UI, packaging et campagnes multilingues.
Large éventail de styles et ratios — photoréaliste, illustré et branding sans changer de famille de modèles à chaque format.
Outils créatifs, médias, design et storytelling e-commerce — les mêmes jobs qu'avec les modèles FLUX.2, étendus à la vidéo courte.
Associez FLUX 3 à des tâches créatives concrètes pour planifier campagnes et feuilles de route contenu.
Spots concept, teasers produits et clips sociaux nécessitant mouvement cohérent et audio en une passe. Support multilingue utile pour campagnes globales.

Avec FLUX 3 Image, continuité avec les forces FLUX.2 — suivi de prompt, rendu texte et images éditables — avec entraînement multimodal améliorant la cohérence campagne.
Montrez matériaux, éclairage et court mouvement autour d'un produit sans refaire tout le tournage. Teasers de lancement, tests de variantes et scènes lifestyle.
Générez FLUX 3 Video sur Flux.art en quelques étapes.
Allez au générateur vidéo IA et sélectionnez FLUX 3 pour texte vers vidéo ou image vers vidéo.
Choisissez 5–20 secondes (ou Auto), 720p/1080p, audio natif et mode Brouillon optionnel pour un aperçu rapide.
Décrivez la scène, ou téléversez jusqu'à 10 images de référence — la première démarre le clip, la dernière le termine.
Lancez le job, prévisualisez le MP4 avec audio synchronisé, puis téléchargez ou itérez avec le mode Brouillon.
Questions courantes sur FLUX 3 et sa comparaison avec FLUX.2.
Générez des clips cinématographiques avec audio natif à partir de texte ou d'images — disponible sur Flux.art.