FLUX 3 veut réunir images, vidéo, audio et même actions robotiques dans un seul modèle
L’allemand Black Forest Labs a dévoilé FLUX 3, un modèle unique entraîné à générer des images et de courtes vidéos sonores, et destiné à s’étendre à la vision robotique. L’accès sera limité au lancement.
Black Forest Labs, le laboratoire de Fribourg à l’origine des populaires modèles d’image FLUX, a annoncé FLUX 3 le 23 juillet. Son ambition : un modèle unique, entraîné simultanément sur plusieurs médias, capable de créer des images, de produire des vidéos avec son natif jusqu’à 20 secondes, de retoucher des photos, de rendre du texte lisible et même de prédire les actions de robots. Le mot clé est « multimodal » : le modèle traite plusieurs types de données, images, vidéo, audio, et pas seulement du texte.
L’affirmation technique importante concerne sa conception. De nombreux outils « tout-en-un » assemblent en réalité plusieurs modèles derrière une interface. Black Forest Labs affirme que FLUX 3 est au contraire entraîné conjointement sur l’image, la vidéo et l’audio avec un seul ensemble de poids. Les poids sont les nombres internes appris pendant l’entraînement ; en partager un seul jeu signifie que le même système réalise toutes les tâches sans les transmettre à des spécialistes. En théorie, les résultats gagnent ainsi en cohérence entre les formats.
Il s’agit d’une course au territoire dans l’IA créative. Pendant quelques années, la génération d’images et celle de vidéos vivaient dans des outils distincts proposés par différentes entreprises. La nouvelle frontière est un modèle unique qui fait tout, et voir un laboratoire européen s’y positionner compte pour ceux qui ne veulent pas dépendre uniquement de fournisseurs américains. À plus long terme, l’extension du même modèle à la vision et aux actions robotiques vise « l’IA physique », où le logiciel qui imagine une image et celui qui pilote une machine commencent à converger.
Quelques réserves concrètes : FLUX 3 est déployé par étapes. FLUX 3 Video est actuellement en accès anticipé ; FLUX 3 Image et FLUX 3 Action arriveront dans les prochaines semaines. Une version à poids ouverts, FLUX 3 Dev, que l’on pourra exécuter et personnaliser sur son propre matériel, est prévue plus tard en 2026, mais n’existe pas encore. Les capacités annoncées sont donc réelles mais verrouillées, et la version attendue par les amateurs reste une promesse.
Ce que cela signifie pour vous : Si vous créez des images, de courtes vidéos ou des contenus pour les réseaux sociaux, FLUX 3 mérite d’être surveillé : un outil réunissant image, vidéo et son pourrait remplacer plusieurs applications. Si vous êtes simplement curieux, le signal le plus intéressant est la direction : les outils de médias par IA fusionnent en modèles uniques, et l’un des leaders est européen. Pour la plupart d’entre nous, le moment concret viendra lorsque FLUX 3 Dev sortira avec ses poids ouverts et pourra être essayé sans file d’attente. D’ici là, gardez des attentes raisonnables et considérez les démonstrations comme telles.
Sources
ChatGPT peut désormais lire vos dossiers médicaux : pratique, mais à considérer avec soin
OpenAI a lancé Health dans ChatGPT le 23 juillet pour les adultes américains, qui peuvent connecter leurs dossiers médicaux et Apple Health. La fonction est réellement utile, mais des experts soulignent un vrai compromis en matière de vie privée.