DevNews

FLUX 3 réunit image, vidéo, audio et robotique en un modèle

Sur cette page
  1. Un modèle au lieu de quatre
  2. Ce que contient FLUX 3 Video
  3. La partie robotique, et l'affirmation qu'elle contient
  4. Ce que vous pouvez réellement utiliser aujourd'hui
  5. Au sujet des chiffres de comparaison
  6. Sources et pour aller plus loin

Black Forest Labs a publié FLUX 3 le jeudi vingt trois juillet, un modèle unique qui génère des images, de la vidéo avec audio synchronisé et des actions robotiques à partir du même jeu de poids. C'est ce dernier point qui surprend. FLUX était au départ un générateur d'images, et l'entreprise a replié la vidéo, le son et la prédiction d'action physique dans une seule architecture au lieu de livrer quatre modèles spécialisés. Les clips vidéo montent à vingt secondes, avec dialogues, effets et ambiance générés nativement. Une partie seulement de la famille est accessible aujourd'hui, en accès anticipé, et la version à poids ouverts est prévue pour plus tard cette année. Voici ce qui est livré, ce qui ne l'est pas, et les affirmations qui restent à vérifier.

The short answer

Le jeudi vingt trois juillet, Black Forest Labs a publié FLUX 3, son premier modèle nativement multimodal. Un seul jeu de poids couvre la génération et l'édition d'images, la vidéo jusqu'à vingt secondes avec dialogues, effets et ambiance synchronisés, et la prédiction d'action pour des robots. FLUX 3 Video et FLUX 3 Action sont en accès anticipé, FLUX 3 Image suit dans les prochaines semaines, et une version à poids ouverts FLUX 3 Dev est prévue pour plus tard en 2026. Audi teste la variante robotique, construite avec mimic, sur des tâches de manipulation en production. Les chiffres de comparaison avec d'autres modèles vidéo proviennent des évaluations internes de l'entreprise.

20 sdurée maximale des clips, audio natif inclus
4modalités dans un modèle : image, vidéo, audio, action
30 minde données robot annoncées pour un affinage, contre 30 heures
Carte réponse : le vingt trois juillet, Black Forest Labs a publié FLUX 3, un modèle multimodal unique couvrant l'image, la vidéo avec audio natif jusqu'à vingt secondes et la prédiction d'action robotique, avec FLUX 3 Video et Action en accès anticipé et une version à poids ouverts FLUX 3 Dev prévue plus tard en 2026.
Quatre modalités, un seul jeu de poids. Source : annonce Black Forest Labs du vingt trois juillet. PNG

Ce qui retient l'attention avec FLUX 3 n'est pas qu'il produise de la vidéo. Beaucoup de modèles produisent de la vidéo. C'est que l'entreprise derrière l'un des générateurs d'images à poids ouverts les plus utilisés ait décidé que sa prochaine publication piloterait aussi un bras robotisé, et ait livré les deux comportements à partir des mêmes poids. Black Forest Labs a annoncé FLUX 3 le jeudi vingt trois juillet, et c'est l'architecture qui fait l'actualité.

Un modèle au lieu de quatre

Les publications FLUX antérieures étaient des modèles d'image, et l'habitude du secteur est d'ajouter les modalités sous forme de systèmes séparés : un modèle pour les images, un autre pour les clips, une pile de synthèse vocale pour le son, et tout autre chose pour la robotique. FLUX 3 apprend l'image, la vidéo, l'audio et l'action ensemble dans une architecture unique, appuyée sur la méthode Self Flow de l'entreprise, qui maintient génération et compréhension alignées dans le même système.

L'argument pratique est que ces problèmes n'en sont pas vraiment quatre. Un modèle qui a appris comment les objets se déplacent, comment un son se rattache à l'événement qui l'a produit et comment une surface réagit au contact a appris une physique réutilisable pour les quatre sorties. Reste à savoir si cette généralisation tient, ce que seuls des tests indépendants trancheront, mais cela explique qu'une entreprise connue pour l'image fixe parle soudain de tâches de manipulation.

Ce que contient FLUX 3 Video

Les clips vont jusqu'à vingt secondes, et l'audio est généré en même temps que l'image plutôt qu'ajouté après coup, dialogues, effets sonores et ambiance compris. L'entrée peut être du texte, une image ou une vidéo existante, donc le texte vers vidéo, l'image vers vidéo et la vidéo vers vidéo passent par le même point d'entrée. La génération de dialogues est multilingue.

La fonction à signaler pour un vrai travail de production, ce sont les transitions pilotées par images clés. Pouvoir fixer la première et la dernière image d'un plan fait la différence entre un modèle que l'on monte dans une timeline et un modèle que l'on relance jusqu'à ce que quelque chose d'exploitable en sorte. C'est une petite ligne dans une annonce et une grosse ligne dans un budget.

Carte réponse résumant la disponibilité de FLUX 3 : FLUX 3 Video et FLUX 3 Action sont en accès anticipé, FLUX 3 Image se déploie dans les prochaines semaines, et la version à poids ouverts FLUX 3 Dev est prévue plus tard en 2026 sans date annoncée.
Lisez la ligne de disponibilité avant la ligne de performance. L'essentiel de la famille n'est pas encore accessible. PNG

La partie robotique, et l'affirmation qu'elle contient

FLUX 3 Action prédit ce qu'une machine doit faire plutôt que l'aspect d'une image. Black Forest Labs a construit une variante nommée FLUX-mimic avec la société de robotique mimic, et Audi la teste sur des tâches de manipulation en production.

Le chiffre associé mérite attention. L'entreprise indique que, selon la difficulté de la tâche, le modèle peut être affiné pour une manipulation précise avec seulement trente minutes de données robot, contre trente heures ou plus pour les approches antérieures. Si cela se confirme en dehors d'un déploiement partenaire, l'économie de l'apprentissage robotique change, car la collecte de démonstrations est d'ordinaire la partie coûteuse. Pour l'instant, c'est une affirmation de l'éditeur portant sur quelques sites, publiée le jour du lancement, et elle mérite le scepticisme habituel réservé aux chiffres de lancement.

Ce que vous pouvez réellement utiliser aujourd'hui

Moins que ce que le titre laisse croire, et autant le dire clairement. FLUX 3 Video et FLUX 3 Action sont en accès anticipé. FLUX 3 Image a été présenté comme se déployant dans les semaines suivantes. Des sociétés comme Canva, Krea, Picsart, Burda et Magnific sont citées comme partenaires de test, ce qui indique une liste d'accès courte.

La date qui intéresse le plus nos lecteurs est justement celle qui n'a pas été donnée. FLUX 3 Dev, la variante à poids ouverts, est prévue pour plus tard en 2026, sans jour annoncé. Black Forest Labs a gagné sa place chez les développeurs en partie en mettant des poids exploitables entre les mains du public, et tant que cette version n'est pas là, FLUX 3 reste un aperçu hébergé. Si votre projet suppose de le faire tourner sur vos propres GPU, le statut honnête est : vous attendez.

Au sujet des chiffres de comparaison

Black Forest Labs indique que FLUX 3 Video a été préféré à Luma Ray 3.2 dans 93 pour cent des comparaisons directes et à Runway Gen-4.5 dans 77 pour cent. Les résultats complets sont promis pour l'ouverture plus large du modèle.

Ce sont les évaluations internes de l'entreprise, diffusées avec son propre lancement, donc à lire comme un positionnement plutôt que comme une mesure. Les taux de préférence en vidéo générative varient fortement selon le choix des invites et selon les juges, et le domaine ne dispose d'aucun banc d'essai public faisant autorité. Le chiffre qui comptera pour vous est celui que vous obtiendrez avec vos propres invites, sur vos propres images, une fois l'accès ouvert.

Sources et pour aller plus loin

Questions fréquentes

Qu'est ce que FLUX 3 et en quoi diffère t il de FLUX.2 ?

FLUX 3 est la première architecture nativement multimodale de Black Forest Labs. Les familles FLUX précédentes étaient des modèles d'image. FLUX 3 apprend conjointement sur l'image, la vidéo, l'audio et la prédiction d'action, dans un seul système, de sorte qu'un unique jeu de poids peut produire une image, générer un clip vidéo avec sa bande son, modifier une image existante et prédire les mouvements que devrait faire un bras robotisé. L'entreprise décrit l'objectif comme l'apprentissage conjoint de la structure spatiale, du mouvement, du son et de l'interaction physique, plutôt que comme quatre tâches séparées, en s'appuyant sur sa méthode Self Flow qui aligne génération et compréhension dans le même modèle.

Que sait faire concrètement FLUX 3 Video ?

FLUX 3 Video génère des clips allant jusqu'à vingt secondes, avec un audio produit en même temps que l'image plutôt que rajouté ensuite, couvrant les dialogues, les effets sonores et l'ambiance. L'entrée peut être du texte, une image ou une vidéo existante, donc le texte vers vidéo, l'image vers vidéo et la vidéo vers vidéo passent par le même modèle. Il prend aussi en charge les transitions pilotées par images clés, ce qui compte quand un plan doit commencer et finir sur des images précises au lieu d'espérer que le modèle tombe juste, et l'entreprise indique que la génération de dialogues est multilingue.

Quand les poids ouverts arrivent ils ?

Black Forest Labs annonce une variante à poids ouverts, FLUX 3 Dev, prévue pour plus tard en 2026, ainsi que des versions plus rapides du modèle. À la date de l'annonce du vingt trois juillet, aucun élément de la famille FLUX 3 n'a de poids ouverts. FLUX 3 Video et FLUX 3 Action sont en accès anticipé, et FLUX 3 Image a été présenté comme se déployant dans les semaines suivantes. Pour qui prévoit de l'héberger soi même, la date utile n'est donc pas annoncée, et la publication actuelle doit être considérée comme un aperçu hébergé, pas comme quelque chose que vous pouvez faire tourner sur votre propre matériel.

Qu'est ce que FLUX 3 Action et pourquoi Audi est il impliqué ?

FLUX 3 Action applique le même modèle à la robotique, en prédisant les actions qu'une machine doit exécuter plutôt que les pixels qu'elle doit dessiner. Black Forest Labs a co-développé une variante nommée FLUX-mimic avec la société de robotique mimic, et Audi la teste sur des tâches de manipulation en production. L'affirmation à retenir porte sur l'efficacité en données. L'entreprise indique que, selon la difficulté de la tâche, le modèle peut être affiné pour une manipulation donnée avec seulement trente minutes de données robot, là où les approches antérieures en demandaient trente heures ou plus. C'est une affirmation de l'éditeur issue d'un déploiement limité, pas un résultat reproduit de façon indépendante.

Quelle confiance accorder aux chiffres de comparaison ?

Considérez les comme déclaratifs tant que personne d'autre ne les a reproduits. Black Forest Labs indique que ses tests internes placent FLUX 3 Video devant Luma Ray 3.2 dans 93 pour cent des comparaisons directes et devant Runway Gen-4.5 dans 77 pour cent. Ce sont les évaluations de l'entreprise, publiées avec son propre lancement, les résultats complets étant promis à l'ouverture plus large du modèle. Les taux de préférence en vidéo générative dépendent aussi beaucoup du choix des invites et de l'identité des juges. Ces chiffres indiquent raisonnablement où l'entreprise pense se situer, et remplacent mal un test sur vos propres invites une fois l'accès ouvert.

Advertisement