El nuevo rack de Nvidia es 10, 30 o 67 veces mejor, dependiendo enteramente de quién cuenta
Esta semana llegaron nuevos números para el Vera Rubin NVL72 de Nvidia y de SemiAnalysis, y los multiplicadores varían enormemente. El diferencial no es deshonestidad, es una lección sobre cómo se construyen las afirmaciones de eficiencia.
Esta semana llegaron nuevas cifras de rendimiento para Vera Rubin NVL72 de Nvidia, el sistema de tamaño rack que ejecutará una gran parte de la IA del mundo durante los próximos años. Nvidia dice que ofrece hasta 30 veces el rendimiento por megavatio del GB300 NVL72 al que reemplaza, y hasta 35 veces menos costo por millón de tokens, medido en una carga de trabajo de codificación agente basada en DeepSeek V4-Pro. Los analistas de SemiAnalysis publicaron su propio análisis del mismo hardware bajo el título 67 veces mejor rendimiento por dólar. En julio, CoreWeave midió 10 veces los tokens por megavatio en comparación con un bastidor Blackwell más antiguo en un modelo diferente. El propio director ejecutivo de Nvidia ha hablado anteriormente de ello 3 veces en público.
El rendimiento por megavatio es la cifra que más importa en este momento, porque los centros de datos de IA están limitados por la electricidad disponible y no por el dinero o el espacio. Diez, treinta y sesenta y siete son números muy diferentes, y ninguno de ellos es mentira. Se diferencian porque cada uno se mide en una configuración diferente. La cifra de 30x de Nvidia se aplica a 160 tokens por segundo por usuario, es decir, la velocidad que experimenta cada usuario o agente individual mientras el modelo funciona. Si se aumenta o disminuye ese objetivo de capacidad de respuesta, la proporción se mueve, a veces mucho, porque un chip que puede atender a muchos usuarios lentos a la vez se comporta de manera diferente a uno al que se le pide que atienda a unos pocos muy rápidos. CoreWeave se comparó con una generación anterior, en un modelo diferente, en julio. Y los números de Nvidia fueron medidos por Nvidia, en un conjunto de pruebas de SemiAnalysis, con la revisión por parte de SemiAnalysis aún pendiente.
¿Qué hay detrás de esto?
Hay un hábito útil enterrado aquí. Cuando una afirmación de hardware o modelo llega como un multiplicador único, tres preguntas generalmente lo convierten en algo significativo: comparado con qué, en qué entorno y medido por quién. En este caso, en comparación con la generación inmediatamente anterior o dos pasos atrás, en la que la capacidad de respuesta se dirige, ya sea por el proveedor o por un tercero. La mejora subyacente es real, todos los que han medido este hardware están de acuerdo en que la ganancia es grande y, para los proveedores de IA, eso se traduce directamente en una inferencia más barata, que es el costo operativo de responder a sus preguntas. Simplemente no se traduce en un número.
Qué significa esto para ti: Indirectamente, esta es la razón por la que el precio de la IA sigue cayendo. El hardware que produce varias veces más texto por unidad de electricidad es la razón principal por la que una solicitud que costaba centavos hace dos años ahora cuesta fracciones de centavo, y eso se refleja en lo que se paga por una suscripción o una llamada API. Directamente, lo transferible es el hábito. La próxima vez que la página de un producto le diga que algo es “10 veces más rápido”, pregunte en comparación con qué, en qué configuración y quién lo midió. Esa única pregunta separa una mejora real de un gráfico bien elegido en casi todos los anuncios de IA que leerá este año.
Fuentes
La empresa detrás de los modelos GLM acaba de recaudar 5 mil millones de dólares en un día
Z.AI, anteriormente Zhipu, recaudó alrededor de 5 mil millones de dólares mediante una colocación de acciones con descuento y bonos convertibles de cupón cero. El sesenta por ciento se destina a la próxima generación de modelos GLM y a las computadoras para entrenarlos.