CourionAI
DE
Newsletter
← Alle News
xai 3 Min. Lesezeit

Das neue Bildmodell von xAI belegt den zweiten Platz in der Arena-Rangliste und bietet Bearbeitung im Photoshop-Stil für Grok

Imagine Image 2.0 liegt in beiden öffentlichen Bestenlisten knapp hinter GPT-Image-2 von OpenAI. Der interessantere Teil sind die Bearbeitungswerkzeuge, die zeigen, wohin die Bild-KI tatsächlich geht.

Eine leere Leinwand auf einer Staffelei mit einem kleinen quadratischen Fleck, der mit einem feinen Pinsel in Koralle neu bemalt wurde, dahinter sind Referenzfarbkarten aufgefächert

xAI hat Imagine Image 2.0 veröffentlicht, einen neuen Bildgenerator, der als „Qualitätsmodus“ auf grok.com/imagine und in den Grok-Apps für iOS und Android verfügbar ist. Der API-Zugriff kommt, sagt das Unternehmen, ohne Datum. In den öffentlichen Arena-Ranglisten vom 7. August belegt die schnellere „Low“-Variante in beiden Kategorien weltweit den zweiten Platz.

Ein Wort zur Bedeutung dieser Rankings, denn sie werden häufig zitiert. Die Arena-Bestenlisten funktionieren, indem sie den Leuten zwei Bilder von zwei anonymen Models zeigen und fragen, welches besser ist. Tausende dieser Stimmen ergeben eine Elo-Bewertung, das gleiche System, das zur Rangfolge von Schachspielern verwendet wird. Imagine 2.0 erzielt in der Image Edit Arena 1.439 Punkte gegenüber 1.463 von GPT-Image-2 und 1.320 Punkte bei Text-to-Image gegenüber 1.380. Reve 2.1, Metas Muse-Image, Alibabas Qwen-Image-3.0-Pro, Googles Gemini und ByteDances SeedDream rangieren alle darunter. Daraus ergeben sich zwei Dinge: Der zweite Platz liegt hier wirklich nahe am ersten, und das gesamte Ranking misst, welches Bild die Leute auf den ersten Blick bevorzugen, nicht die Genauigkeit, nicht die Nützlichkeit und nicht, ob das Modell Ihnen das gegeben hat, was Sie verlangt haben.

Die Bearbeitungswerkzeuge sind der Teil, den es zu beachten gilt. Der Zauberstab verändert nur einen ausgewählten Bereich eines Bildes, anstatt das Ganze neu zu generieren. Mit einer Segmentierungsfunktion können Sie präzise Bereiche auswählen und durch Hintergrundentfernung wird ein Motiv in Transparenz exportiert. Multi-Ref Editing kombiniert bis zu fünf Eingabebilder in einer Generation und Smart Resize wandelt ein vorhandenes Bild in ein anderes Seitenverhältnis um, indem das Modell den neuen Raum ausfüllt. xAI liefert außerdem Vorlagen, vorkonfigurierte Ausgangspunkte für gängige Aufgaben wie Produktfotografie, Marketingmaterial, Spielressourcen und Streaming-Emojis sowie eine Funktion, die Charaktere, Orte und Requisiten separat generiert und gleichzeitig den visuellen Stil für alle gleich hält. Das Unternehmen rahmt das Letzte als Grundlage für die Videoproduktion ein.

Dieser Wandel ist die wahre Geschichte im gesamten Bereich. In den ersten Jahren der Bild-KI ging es um die Qualität einer einzelnen Generation aus einer einzigen Eingabeaufforderung, bei der es sich um eine Demo handelt. Die tatsächliche Arbeit ist iterativ: Man kommt etwas näher, ändert dann eine Sache, dann eine andere und behält die Teile, die funktioniert haben. Werkzeuge zum Auswählen, Maskieren und Wiederverwenden von Referenzen machen aus einer Neuheit etwas, mit dem Sie Ihre Arbeit abschließen können, und sie sind wichtiger als eine Elo-Lücke von 24 Punkten.

Was das für dich bedeutet: Wenn Sie bereits Bilder mit KI erstellen und immer wieder an die Wand stoßen, bei der eine kleine Korrektur bedeutet, alles neu zu generieren und das zu verlieren, was Ihnen gefallen hat, sind dies die Funktionen, die helfen, und die Konsistenzwerkzeuge sind die nützlichsten der Reihe für alles mit einem sich wiederholenden Charakter oder Produkt. Wenn Sie neu in diesem Bereich sind, wählen Sie ein Tool nicht anhand der Position in der Bestenliste aus. Die Platzierungen zwischen den Top-Modellen liegen so nah beieinander, dass der Arbeitsablauf, der Preis und die Verfügbarkeit für Sie ausschlaggebend sein können. Ein fairer Vorbehalt: Hierbei handelt es sich um die eigene Ankündigung von xAI und die Ranglistenergebnisse Dritter, nicht um unabhängige Tests, und die API-Preise sind noch nicht öffentlich.

Quellen

Quellen: https://x.ai/news/grok-imagine-image-2

Nächster Artikel

Fünf große Technologieunternehmen einigen sich auf ein Format für KI-Agent-Add-Ons. Anthropic gehört nicht dazu

Amazon, Cursor, Microsoft, OpenAI und Vercel haben Agent Plugins eingeführt, ein gemeinsames Paketformat für AI-Agent-Erweiterungen. Es bündelt Agent Skills und MCP-Server in einem Ordner.

Fünf verschiedene mechanische Werkzeuge, die jeweils an einem identischen Steckersockel befestigt sind und entlang einer gemeinsamen Schiene aufgereiht sind, wobei eine einzige Buchse leer bleibt