CourionAI
IT
Newsletter
← Tutte le notizie
ai-video 2 min di lettura

FLUX 3 vuole essere un unico modello per immagini, video, audio e persino azioni robotiche

La tedesca Black Forest Labs ha presentato FLUX 3, un unico modello addestrato per generare immagini e brevi video con audio, destinato anche alla visione robotica. All’inizio l’accesso sarà limitato.

Illustrazione in stile risograph di un prisma di vetro che divide la luce in una cornice, una pellicola, onde sonore e un piccolo braccio robotico

Black Forest Labs, il laboratorio di Friburgo dietro i popolari modelli di immagini FLUX, ha annunciato FLUX 3 il 23 luglio. La proposta è ambiziosa: un solo modello, addestrato contemporaneamente su più tipi di media, capace di generare immagini, produrre video con audio nativo lunghi fino a 20 secondi, modificare fotografie, rendere testo leggibile e persino prevedere azioni robotiche. La parola chiave è «multimodale»: gestisce più tipi di dati, immagini, video e audio, anziché soltanto testo.

L’affermazione tecnica da capire riguarda la struttura. Molti strumenti «tutto in uno» sono in realtà più modelli separati collegati dietro un’interfaccia. Black Forest Labs sostiene invece che FLUX 3 sia addestrato congiuntamente su immagini, video e audio, condividendo un solo insieme di pesi. I pesi sono i numeri interni appresi durante l’addestramento; un unico insieme significa che lo stesso sistema svolge tutti i compiti senza passarli a specialisti. In teoria, i risultati diventano più coerenti tra i diversi formati.

Dietro c’è una corsa al territorio nell’IA creativa. Per alcuni anni, generazione di immagini e video hanno vissuto in strumenti separati di aziende diverse. La nuova frontiera è un modello unico che faccia tutto, e il fatto che un laboratorio europeo pianti lì la propria bandiera conta per chi non vuole dipendere soltanto da fornitori statunitensi. C’è anche un obiettivo più lontano: estendere lo stesso modello alla visione e alle azioni robotiche punta all’«IA fisica», dove il software che immagina un’immagine e quello che guida una macchina iniziano a convergere.

Alcune precisazioni concrete. FLUX 3 viene distribuito per fasi. FLUX 3 Video è ora in accesso anticipato; FLUX 3 Image e FLUX 3 Action arriveranno nelle prossime settimane. Una versione a pesi aperti chiamata FLUX 3 Dev, eseguibile e personalizzabile sul proprio hardware, è prevista più avanti nel 2026 ma non è ancora disponibile. Le capacità annunciate sono quindi reali ma limitate, e la versione desiderata dagli appassionati resta per ora una promessa.

Cosa significa per te: Se create immagini, brevi video o contenuti social, vale la pena seguire FLUX 3: uno strumento per immagini, video e suono potrebbe sostituire diverse app. Per chi è soltanto curioso, il segnale più interessante è la direzione: gli strumenti multimediali di IA stanno convergendo in singoli modelli e uno dei protagonisti è europeo. Per la maggior parte di noi, il momento pratico arriverà quando FLUX 3 Dev sarà pubblicato con pesi aperti e potrà essere provato senza coda. Fino ad allora, mantenete aspettative realistiche e trattate le demo come demo.

Fonti

Fonti: https://www.globenewswire.com/news-release/2026/07/23/3332364/0/en/black-forest-labs-unveils-flux-3-a-new-multimodal-frontier-model-for-visual-intelligence.html

Articolo successivo

ChatGPT ora può leggere le vostre cartelle cliniche: è comodo e merita una riflessione

OpenAI ha lanciato Health in ChatGPT il 23 luglio per gli adulti statunitensi, permettendo di collegare cartelle cliniche e Apple Health. È davvero utile, ma gli esperti segnalano un concreto compromesso sulla privacy.

Illustrazione in stile risograph di un cuore con una linea del battito accanto a una cartella clinica, uno smartphone e un piccolo scudo protettivo