CourionAI
IT
Newsletter
← Tutte le notizie
ai-basics 2 min di lettura

La nuova IA per immagini di Alibaba sa disegnare un’intera pagina di giornale, con tanto di testo minuscolo leggibile

Qwen-Image-3.0 costruisce layout densi, come infografiche e pagine intere, in un solo passaggio con testo leggibile di dieci pixel. Ma questa volta Alibaba non condivide apertamente il modello.

Illustrazione in risografia di un foglio stampato riempito da una griglia tre per tre di piccoli pannelli infografici e grafici

Il team Qwen di Alibaba ha rilasciato Qwen-Image-3.0, un generatore di immagini costruito meno per le belle immagini e più per layout densi e ricchi di informazioni: infografiche, storyboard, fogli d’esame, persino un’intera finta pagina di giornale. Il suo trucco è produrre tutto questo in un singolo passaggio, con testo abbastanza piccolo da essere davvero leggibile.

La caratteristica che spicca è il testo. La maggior parte delle IA per immagini è famosa per trasformare le parole in nonsense, ma Qwen afferma che questa riesce a rendere testo leggibile fino a dieci pixel di altezza, gestisce formule matematiche e scrive in dodici lingue. Accetta prompt fino a 4.500 token, all’incirca alcune pagine di istruzioni, e questo le dà abbastanza spazio per disporre scene complesse in un solo colpo invece di assemblarle. In una dimostrazione ha inserito nove infografiche separate in una griglia 3×3, ognuna con testo, diagrammi e formule propri, su argomenti dalla sicurezza nei tunnel alla biologia cellulare. Un’altra mostrava una pagina intera di un fittizio compito di matematica con equazioni su più righe. Qwen riassume l’obiettivo di questa versione in una parola: “Reale”.

Ora la parte importante per chi segue il lato open source dell’IA. Alibaba si è costruita una reputazione anche pubblicando modelli “open-weight”, cioè modelli che chiunque poteva scaricare ed eseguire gratuitamente. Il Qwen-Image originale era uscito così, con licenza permissiva e un rapporto tecnico che spiegava il funzionamento. Qwen-Image-3.0 non lo fa. Per ora è disponibile solo tramite accesso API su invito, senza pesi aperti, benchmark o rapporto tecnico. È un cambiamento notevole e vale la pena ricordarlo prima di entusiasmarsi troppo: per quanto impressionanti siano le demo, non puoi ancora eseguirlo da solo né verificarne in modo indipendente le affermazioni. C’è anche una domanda legittima sull’utilità. Una pagina di giornale o di ricerca resa come immagine piatta è bella da vedere, ma non si può modificare o cercare come un vero documento; gli usi migliori potrebbero quindi essere mockup e bozze visive, non lavoro finito.

Cosa significa per te: Se realizzi presentazioni, poster o grafiche esplicative, strumenti come questo si avvicinano alla promessa di trasformare “descrivilo e ottieni un layout utilizzabile” in realtà, testo compreso. Se ti interessa eseguire l’IA sul tuo hardware o verificare come funziona, questo rilascio è una piccola delusione e forse il segnale che anche i laboratori più vicini all’apertura stanno diventando più protettivi verso i modelli migliori. Per la maggior parte delle persone non c’è nulla da installare oggi, ma è un’anteprima chiara della direzione degli strumenti per immagini.

Fonti

Fonti: https://the-decoder.com/alibabas-qwen-image-3-0-renders-full-infographic-grids-and-readable-ten-pixel-text-in-a-single-pass/

Articolo successivo

Barare con l’IA diventa più facile e più difficile da dimostrare

La diffusione degli strumenti IA ha circa raddoppiato i casi di frode nei test online e nelle selezioni, mentre i rilevatori sono meno affidabili di quanto sembrino.

Una lente d’ingrandimento esamina un foglio d’esame bianco su un tavolo circondato da cerchi radar, con una bilancia inclinata fra bandiera di avviso e punto interrogativo