CourionAI
FR
Newsletter
← Toutes les actus
ai-basics 2 min de lecture

Alibabas neue Bild-KI zeichnet ganze Zeitungsseiten, inklusive winziger lesbarer Schrift

Qwen-Image-3.0 erstellt dichte Layouts wie Infografiken und ganze Seiten in einem Durchlauf, mit lesbarer Zehn-Pixel-Schrift. Diesmal veröffentlicht Alibaba das Modell jedoch nicht offen.

Risografie-Illustration eines bedruckten Blatts mit einem Drei-mal-drei-Raster kleiner Infografikfelder und Diagramme

L’équipe Qwen d’Alibaba a publié Qwen-Image-3.0, un générateur d’images conçu moins pour les jolies images que pour les mises en page denses : infographies, storyboards, feuilles d’examen et même une fausse page de journal complète. Son astuce est de tout produire en un seul passage, avec un texte assez petit pour être lisible.

La fonction phare est le texte. Alors que la plupart des IA d’image transforment les mots en charabia, Qwen affirme que son modèle rend du texte lisible jusqu’à dix pixels de haut, gère les formules mathématiques et écrit dans douze langues. Il accepte des prompts allant jusqu’à 4 500 tokens, soit environ quelques pages d’instructions, assez pour composer une scène complexe sans assemblage. Une démonstration regroupait neuf infographies dans une grille 3 × 3, avec textes, schémas et formules ; une autre montrait une page entière d’article mathématique fictif. Qwen résume l’objectif en un mot : « Real ».

Le point important pour l’open source est que Qwen-Image-3.0 n’est pas ouvert. Le Qwen-Image original était disponible en open weights sous licence permissive, avec un rapport technique. Cette nouvelle version n’est pour l’instant accessible que par API sur invitation : pas de poids ouverts, de benchmarks ni de rapport technique. Vous ne pouvez donc pas encore l’exécuter ni vérifier ses affirmations. Une image plate d’un journal ou d’un article est belle, mais ne se modifie ni ne se recherche comme un vrai document ; les meilleures applications pourraient être les maquettes et brouillons visuels.

Ce que cela signifie pour vous: Pour les présentations, affiches et graphiques explicatifs, ce type d’outil rapproche la promesse « décrivez-le et obtenez une mise en page utilisable », texte compris. Si vous tenez à exécuter l’IA sur votre matériel ou à comprendre son fonctionnement, cette sortie déçoit un peu et montre peut-être que même les laboratoires proches de l’open source protègent davantage leurs meilleurs modèles. Pour la plupart des gens, rien à installer aujourd’hui, mais un aperçu net de la direction prise par les outils d’image.

Sources

Sources: https://the-decoder.com/alibabas-qwen-image-3-0-renders-full-infographic-grids-and-readable-ten-pixel-text-in-a-single-pass/

Article suivant

La triche avec l’IA devient plus facile et plus difficile à prouver

La triche aux tests en ligne et aux évaluations d’embauche a environ doublé avec la diffusion des outils d’IA, tandis que les détecteurs censés l’attraper sont moins solides qu’ils n’en ont l’air. Ce que cela change pour étudier, recruter ou être évalué.

Une loupe examine une feuille d’examen blanche sur un bureau entouré de cercles radar, une balance inclinée pèse un drapeau d’alerte contre un point d’interrogation et une oreille apparaît faiblement au bord