El nuevo modelo gratuito de Nvidia no es el más inteligente. Es muy, muy rápido
Nemotron 3.5 Lightning iguala al gpt-oss-120b de OpenAI en puntuaciones de inteligencia con una cuarta parte de los parámetros y produce alrededor de 670 tokens por segundo, el más rápido en su grupo de comparación.
Nvidia lanzó Nemotron 3.5 Lightning el martes, un modelo de open weights que puedes descargar y ejecutar tú mismo. No se trata de ser el modelo más inteligente de la sala. Intenta ser el más rápido y, según esa medida, actualmente gana su categoría.
Los números, a través del sitio independiente de evaluación comparativa Artificial Analysis: Lightning obtienen una puntuación de 24 en su Intelligence Index, un salto de nueve puntos sobre su predecesor y exactamente al mismo nivel que el gpt-oss-120b de OpenAI, un modelo aproximadamente cuatro veces su tamaño. Donde se aleja es la velocidad. Lightning produce cerca de 670 tokens por segundo, que es el rendimiento medido más alto en toda la comparación y casi el doble de rápido que el Gemini 3.5 Flash-Lite de Google con 386. Una tarea benchmark típica lleva aproximadamente medio minuto. Qwen3.6 35B A3B necesita alrededor de 3,5 minutos para el mismo trabajo y Gemma 4 31B aproximadamente 5,8.
El truco está en la arquitectura. Lightning tiene 31,6 mil millones de parámetros en total, pero solo 3,6 mil millones de ellos están activados en un paso determinado. Los parámetros son los números ajustables que un modelo aprende durante el entrenamiento, y este diseño de “mixture of experts” significa que el modelo conlleva una gran cantidad de conocimiento y solo paga el costo de computación de un modelo pequeño cada vez que responde. Solo maneja texto, lee hasta un millón de tokens de contexto a la vez y se envía bajo la permisiva licencia OpenMDW-1.1.
¿Qué hay detrás?
Nvidia lleva más de un año defendiendo este caso. En un artículo ampliamente discutido, sus investigadores afirmaron que los modelos con 10 mil millones de parámetros podrían manejar la mayoría de las cargas de trabajo de los agentes tan bien como modelos de diez a treinta veces más grandes, a una fracción del costo. Lightning es el producto más claro basado en ese argumento hasta ahora. Y los benchmarks agentes lo respaldan: en GDPval-AA v2 alcanza una calificación Elo de 824, superando tanto a gpt-oss-120b con 800 como al Nemotron 3 Super más grande de Nvidia con 698.
Sin embargo, es una buena advertencia. Existen modelos pequeños más inteligentes. Qwen3.6 35B A3B obtiene una puntuación de 32 y Muse Glimmer de Meta 35, ambos muy por delante de Lightning 24. Los modelos propietarios están aún más por delante. Lightning está diseñado para un solo trabajo: realizar muchos pasos pequeños de forma rápida y económica, que es exactamente lo que hace un agente de IA que trabaja en una tarea larga durante todo el día.
Qué significa esto para ti: Si nunca has ejecutado un modelo por tu cuenta, hoy no cambia nada, y no pasa nada. Si ya estás experimentando, merece la pena echarle un vistazo, porque la velocidad es lo que hace que los agentes parezcan útiles en vez de lentos. Los pesos están en Hugging Face y varios proveedores, entre ellos DeepInfra, Fireworks, Nebius y CoreWeave, ya lo ofrecen por si prefieres no alojarlo tú mismo. Eso sí, no esperes que razone como un frontier model. No está diseñado para eso.
Fuentes
Los investigadores encontraron una manera de leer los pensamientos ocultos de Claude, ChatGPT y Gemini
Un artículo publicado en robado-pensamientos.com muestra cómo los bloques de razonamiento cifrados de los modelos fronterizos podrían reproducirse en modelos hermanos más débiles y decodificarse. Los tres proveedores ya lo han solucionado.