Le GLM-5.3-Flash de Z.ai se rapproche d'Opus à un dixième du prix
Un modèle ouvert de 320 milliards de paramètres avec une fenêtre contextuelle d'un million de jetons, publié sous une licence MIT à 0,15 $ par million de jetons d'entrée. Il a d'abord passé une semaine dans les classements sous un faux nom.
Le laboratoire chinois Z.ai a publié GLM-5.3-Flash, le modèle de codage le moins cher qu’il ait livré et le premier de la famille GLM-5 à gérer les images et les vidéos de manière native plutôt que via un convertisseur intégré. Les poids sont sur Hugging Face sous une licence MIT, qui est à peu près aussi permissive que les licences logicielles, et la version hébergée coûte 0,15 $ par million de jetons d’entrée et 0,50 $ par million de jetons de sortie.
Les spécifications : 320 milliards de paramètres au total avec 18 milliards actifs par token et une fenêtre contextuelle de 1 048 576 tokens. Les paramètres sont les nombres internes qu’un modèle apprend pendant la formation ; un jeton est à peu près un fragment de mot ; la fenêtre contextuelle indique la quantité de texte que le modèle peut garder à l’esprit à la fois, et un million de jetons constitue confortablement un long roman ou une très grande base de code. L’écart entre 320 milliards stockés et 18 milliards utilisés est une conception mixte d’experts, dans laquelle le modèle conserve de nombreux sous-réseaux spécialisés et n’active que quelques-uns pertinents pour chaque morceau de texte.
Sur les benchmarks, Z.ai rapporte 84,3 sur Terminal-Bench 2.1 contre 85,0 pour Claude Opus 4.8 et 87,4 pour GPT-5.6 Terra, et 63,4 sur DeepSWE v1.1 contre 46,2 pour GLM-5.2. Des tests indépendants réalisés par Artificial Analysis lui donnent un score de 57 sur leur indice d’intelligence, bien au-dessus de la médiane de 27 pour des modèles à poids ouvert de taille comparable, bien qu’il soit lent à 48,7 jetons de sortie par seconde et visiblement verbeux. La vision est le point faible : elle est derrière Gemini 3.7 Flash sur les benchmarks d’image.
Que se passe-t-il réellement ici : le modèle a passé sa première semaine à fonctionner de manière anonyme sous le nom de “Ox Alpha” sur OpenCode et OpenRouter, ce qui est désormais un moyen courant d’obtenir des réactions honnêtes avant que la marque n’entre en vigueur. Le plus intéressant est l’endroit où il a été exécuté. Z.ai indique que l’intégralité de l’aperçu a été diffusée sur des puces d’IA chinoises produites dans le pays, avec un moteur de service personnalisé qui rapporte une triple amélioration de bout en bout. C’est la partie qui mérite d’être regardée. L’histoire du contrôle des exportations a toujours supposé que les laboratoires chinois étaient confrontés à des goulots d’étranglement en matière de matériel Nvidia, et ce laboratoire prétend avoir expédié un modèle proche de la frontière sans celui-ci. Traitez l’affirmation comme rapportée plutôt que vérifiée, et rappelez-vous que tous les chiffres de référence principaux appartiennent à Z.ai avec des configurations par test qui diffèrent.
Ce que cela signifie pour vous : si vous utilisez l’IA via une fenêtre de discussion, l’effet pratique est une pression à la baisse sur les prix partout, qui finit par vous atteindre. Si vous payez pour l’accès à l’API, c’est vraiment bon marché pour la qualité : environ 0,045 $ par tâche sur le niveau réduit. Si vous espériez le faire fonctionner à la maison, tempérez cela. Le point de contrôle FP8 par défaut est d’environ 306 Gio avant la mémoire dont le modèle a besoin lors de son exécution, et le chemin de service actuel nécessite des puces Nvidia Hopper ou plus récentes, il s’agit donc d’un modèle à huit nœuds GPU plutôt que d’un modèle de bureau. Pour la plupart des gens, l’API est la porte réaliste, et la licence ouverte est surtout importante car elle signifie que personne ne pourra vous retirer le modèle plus tard.
Sources
Sources: https://z.ai/blog/glm-5.3-flash
Google a construit un petit modèle d'IA qui lit les traces de glucose
GlucoFM possède 720 000 paramètres, soit environ un millionième de la taille d'un modèle de chat, et bat ses concurrents plus importants en matière de détection des schémas métaboliques dans les données continues d'un glucomètre.