CourionAI
FR
Newsletter
← Toutes les actus
nvidia 3 min de lecture

Le nouveau rack de Nvidia est 10x, 30x ou 67x meilleur, selon celui qui compte

De nouveaux chiffres pour le Vera Rubin NVL72 sont arrivés cette semaine de Nvidia et de SemiAnalysis, et les multiplicateurs varient énormément. Cette propagation n’est pas de la malhonnêteté, c’est une leçon sur la façon dont les allégations d’efficacité sont construites.

Trois règles de longueurs et d'échelles différentes appuyées contre le même bloc haut

De nouveaux chiffres de performances pour le Vera Rubin NVL72 de Nvidia, le système de la taille d’un rack qui exécutera une grande partie de l’IA mondiale au cours des deux prochaines années, sont arrivés cette semaine. Nvidia affirme qu’il offre un débit par mégawatt jusqu’à 30 fois supérieur à celui du GB300 NVL72 qu’il remplace, et un coût par million de jetons jusqu’à 35 fois inférieur, mesuré sur une charge de travail de codage agent basée sur DeepSeek V4-Pro. Les analystes de SemiAnalysis ont publié leur propre analyse du même matériel sous le titre de performances par dollar 67 fois supérieures. En juillet, CoreWeave a mesuré 10 fois le nombre de jetons par mégawatt par rapport à un ancien rack Blackwell sur un modèle différent. Le propre PDG de Nvidia en a déjà parlé à trois reprises en public.

Le débit par mégawatt est le chiffre qui compte le plus à l’heure actuelle, car les centres de données IA sont limités par l’électricité disponible plutôt que par l’argent ou la surface au sol. Dix, trente et soixante-sept sont des nombres très différents, et aucun d’eux n’est un mensonge. Ils diffèrent car chacun est mesuré dans un cadre différent. Le chiffre 30x de Nvidia s’applique à 160 jetons par seconde et par utilisateur, ce qui signifie la vitesse que chaque utilisateur ou agent expérimente pendant que le modèle fonctionne. Poussez cet objectif de réactivité vers le haut ou vers le bas et le rapport évolue, parfois beaucoup, car une puce qui peut servir de nombreux utilisateurs lents à la fois se comporte différemment de celle qui est invitée à en servir quelques-uns très rapides. CoreWeave a été comparé à une génération plus ancienne, sur un modèle différent, en juillet. Et les chiffres de Nvidia ont été mesurés par Nvidia, sur une suite de référence de SemiAnalysis, l’examen par SemiAnalysis étant toujours en attente.

Qu’est-ce qu’il y a derrière ça

Il y a une habitude utile enfouie ici. Lorsqu’une affirmation relative à un matériel ou à un modèle apparaît comme un multiplicateur unique, trois questions la résument généralement en quelque chose de significatif : par rapport à quoi, dans quel contexte et mesuré par qui. Dans ce cas, par rapport à la génération immédiatement précédente ou à deux pas en arrière, la réactivité est ciblée par le fournisseur ou par un tiers. L’amélioration sous-jacente est réelle, tous ceux qui ont mesuré ce matériel conviennent que le gain est important, et pour les fournisseurs d’IA, cela se traduit directement par une inférence moins chère, ce qui représente le coût de fonctionnement pour répondre à vos questions. Cela ne se traduit tout simplement pas par un seul chiffre.

Ce que cela signifie pour vous : Indirectement, c’est pourquoi le prix de l’IA ne cesse de baisser. Un matériel qui produit plusieurs fois plus de texte par unité d’électricité est la principale raison pour laquelle une demande qui coûtait des centimes il y a deux ans coûte désormais des fractions de centime, et cela se reflète dans ce que vous payez pour un abonnement ou un appel API. Directement, ce qui est transférable, c’est l’habitude. La prochaine fois qu’une page produit vous indique que quelque chose est “10 fois plus rapide”, demandez par rapport à quoi, à quel paramètre et qui l’a mesuré. Cette seule question distingue une réelle amélioration d’un graphique bien choisi dans presque toutes les annonces sur l’IA que vous lirez cette année.

Sources

Sources: https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/

Article suivant

La société derrière les modèles GLM vient de lever 5 milliards de dollars en un jour

Z.AI, anciennement Zhipu, a levé environ 5 milliards de dollars grâce à un placement d'actions à prix réduit et à des obligations convertibles à coupon zéro. Soixante pour cent sont consacrés à la prochaine génération de modèles GLM et aux ordinateurs pour les former.

Une fontaine de pièces de monnaie en arc de cercle se déversant dans un large récipient déjà débordant