Der GLM-5.3-Flash von Z.ai kommt zu einem Zehntel des Preises in die Nähe von Opus
Ein offenes Gewichtungsmodell mit 320 Milliarden Parametern und einem Millionen-Token-Kontextfenster, veröffentlicht unter einer MIT-Lizenz für 0,15 US-Dollar pro Million Eingabe-Token. Es verbrachte eine Woche lang unter einem falschen Namen in den Bestenlisten.
Das chinesische Labor Z.ai hat GLM-5.3-Flash herausgebracht, das günstigste leistungsfähige Codierungsmodell, das es je ausgeliefert hat, und das erste in der GLM-5-Familie, das Bilder und Videos nativ und nicht über einen angeschraubten Konverter verarbeitet. Die Gewichte liegen auf Hugging Face unter einer MIT-Lizenz, die ungefähr so freizügig ist wie Softwarelizenzen, und die gehostete Version kostet 0,15 US-Dollar pro Million Eingabe-Tokens und 0,50 US-Dollar pro Million Ausgabe-Tokens.
Die Spezifikationen: 320 Milliarden Gesamtparameter mit 18 Milliarden aktiven pro Token und ein Kontextfenster von 1.048.576 Token. Parameter sind die internen Zahlen, die ein Modell während des Trainings lernt; Ein Token ist ungefähr ein Wortfragment. Das Kontextfenster gibt an, wie viel Text das Modell gleichzeitig speichern kann, und eine Million Token ist bequem ein langer Roman oder eine sehr große Codebasis. Die Lücke zwischen 320 Milliarden gespeicherten und 18 Milliarden verwendeten ist ein Mix-of-Experts-Design, bei dem das Modell viele spezialisierte Subnetzwerke beibehält und nur die Handvoll aktiviert, die für jedes Textstück relevant sind.
Bei den Benchmarks meldet Z.ai 84,3 auf Terminal-Bench 2.1 gegenüber 85,0 von Claude Opus 4.8 und 87,4 von GPT-5.6 Terra sowie 63,4 auf DeepSWE v1.1 gegenüber 46,2 von GLM-5.2. Unabhängige Tests von Artificial Analysis ergeben auf ihrem Intelligenzindex einen Wert von 57, deutlich über dem Mittelwert von 27 für Open-Weight-Modelle vergleichbarer Größe, obwohl es mit 48,7 Ausgabetokens pro Sekunde langsam und auffallend ausführlich ist. Vision ist die Schwachstelle: Bei Bild-Benchmarks liegt es hinter Gemini 3.7 Flash zurück.
Was hier eigentlich vor sich geht: Das Modell verbrachte seine erste Woche damit, anonym als „Ox Alpha“ auf OpenCode und OpenRouter zu laufen, was eine mittlerweile gängige Methode ist, ehrliche Reaktionen zu erhalten, bevor das Branding einsetzt. Interessanter ist, wo es lief. Laut Z.ai wurde die gesamte Vorschau auf im Inland hergestellten chinesischen KI-Chips bereitgestellt, mit einer benutzerdefinierten Bereitstellungs-Engine, die eine dreifache End-to-End-Verbesserung meldet. Das ist der sehenswerte Teil. In der Geschichte der Exportkontrolle wurde immer davon ausgegangen, dass chinesische Labore einen Engpass bei Nvidia-Hardware haben, und dieses Labor behauptet, es habe ein grenznahes Modell ohne Nvidia-Hardware ausgeliefert. Behandeln Sie die Behauptung als gemeldet und nicht als verifiziert, und denken Sie daran, dass alle Benchmark-Zahlen in den Schlagzeilen von Z.ai stammen und die Setups pro Test unterschiedlich sind.
Was das für Sie bedeutet: Wenn Sie KI über ein Chatfenster nutzen, ist der praktische Effekt überall ein Abwärtsdruck auf die Preise, der Sie schließlich erreicht. Wenn Sie für den API-Zugriff bezahlen, ist dies angesichts der Qualität wirklich günstig: etwa 0,045 $ pro Aufgabe im ermäßigten Tarif. Wenn Sie gehofft haben, es zu Hause laufen zu lassen, mildern Sie es. Der standardmäßige FP8-Checkpoint liegt bei etwa 306 GiB vor dem Speicher, den das Modell während der Ausführung benötigt, und der aktuelle Bereitstellungspfad erfordert Nvidia Hopper-Chips oder neuer, es handelt sich also um ein Modell mit acht GPU-Knoten und nicht um ein Desktop-Modell. Für die meisten Menschen ist die API die realistische Tür, und die offene Lizenz ist vor allem deshalb wichtig, weil sie bedeutet, dass Ihnen später niemand das Modell wegnehmen kann.
Quellen
Quellen: https://z.ai/blog/glm-5.3-flash
Google hat ein kleines KI-Modell entwickelt, das Glukosespuren liest
GlucoFM verfügt über 720.000 Parameter, etwa ein Millionstel der Größe eines Chat-Modells, und übertrifft größere Konkurrenten bei der Erkennung von Stoffwechselmustern in kontinuierlichen Glukosemonitordaten.