CourionAI
FR
Newsletter
← Toutes les actus
ai-basics 3 min de lecture

Le nouveau modèle gratuit de Nvidia n'est pas le plus intelligent. C'est juste très, très rapide

Nemotron 3.5 Lightning correspond au gpt-oss-120b d'OpenAI en termes de scores d'intelligence avec un quart des paramètres et produit environ 670 tokens par seconde, le plus rapide de son groupe de comparaison.

Une petite locomotive courant loin devant trois locomotives de fret beaucoup plus grosses sur des voies parallèles, des lignes rapides derrière elle

Nvidia a publié mardi Nemotron 3.5 Lightning, un modèle à open weights que vous pouvez télécharger et exécuter vous-même. Il ne s’agit pas d’être le modèle le plus intelligent de la pièce. Il essaie d’être le plus rapide et, grâce à cette mesure, il remporte actuellement sa catégorie.

Les chiffres, via le site d’analyse comparative indépendant Artificial Analysis : Lightning obtient un score de 24 sur son Intelligence Index, un bond de neuf points par rapport à son prédécesseur et exactement au même niveau que le gpt-oss-120b d’OpenAI, un modèle environ quatre fois sa taille. Là où il s’éloigne, c’est la vitesse. Lightning produit près de 670 tokens par seconde, ce qui représente le débit mesuré le plus élevé de toute la comparaison et presque deux fois plus rapide que le Gemini 3.5 Flash-Lite de Google à 386. Une tâche benchmark typique prend environ une demi-minute. Qwen3.6 35B A3B a besoin d’environ 3,5 minutes pour le même travail, et Gemma 4 31B environ 5,8.

L’astuce réside dans l’architecture. Lightning possède 31,6 milliards de paramètres au total, mais seulement 3,6 milliards d’entre eux sont activés à une étape donnée. Les paramètres sont les nombres ajustables qu’un modèle apprend au cours de la formation, et cette conception « mixture of experts » signifie que le modèle contient une grande quantité de connaissances tout en ne payant que le coût de calcul d’un petit modèle à chaque fois qu’il répond. Il gère uniquement le texte, lit jusqu’à un million de tokens de contexte à la fois et est livré sous la licence permissive OpenMDW-1.1.

Qu’est-ce qu’il y a derrière

Nvidia défend cette cause depuis plus d’un an. Dans un article largement discuté, ses chercheurs ont affirmé que des modèles de moins de 10 milliards de paramètres pourraient gérer la plupart des charges de travail des agents aussi bien que des modèles dix à trente fois plus volumineux, pour une fraction du coût. Lightning est jusqu’à présent le produit le plus clair basé sur cet argument. Et les benchmarks agents le confirment : sur GDPval-AA v2, il atteint une note Elo de 824, battant à la fois gpt-oss-120b à 800 et le plus grand Nemotron 3 Super de Nvidia à 698.

Une bonne mise en garde, cependant. Des petits modèles plus intelligents existent. Qwen3.6 35B A3B obtient un score de 32 et le Muse Glimmer de Meta 35, tous deux bien devant les 24 de Lightning. Les modèles propriétaires sont encore plus avancés. Lightning est conçu pour une seule tâche : effectuer de nombreuses petites étapes rapidement et à moindre coût, ce qui est exactement ce que fait un agent d’IA travaillant sur une longue tâche toute la journée.

Ce que cela signifie pour vous: Si vous n’avez jamais exécuté de modèle vous-même, rien ne change aujourd’hui, et ce n’est pas un problème. Si vous êtes déjà en train d’expérimenter, cela vaut le coup d’œil, car la vitesse est ce qui fait que les agents se sentent utilisables plutôt que lents. Les poids sont sur Hugging Face, et plusieurs fournisseurs, dont DeepInfra, Fireworks, Nebius et CoreWeave, le proposent déjà si vous préférez ne pas l’héberger vous-même. Ne vous attendez pas à ce qu’il raisonne comme un frontier model. Ce n’est pas à cela que ça sert.

Sources

Sources: https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/

Article suivant

Des chercheurs ont trouvé un moyen de lire les pensées cachées de Claude, ChatGPT et Gemini

Un article publié sur stolen-thoughts.com montre comment les blocs de chain-of-thought cryptés des frontier models pourraient être rejoués dans des modèles frères plus faibles et décodés. Les trois fournisseurs ont maintenant corrigé le problème.

Deux portes de tailles très différentes partageant un même trou de serrure, une enveloppe scellée s'échappant de la plus petite et de légers gribouillages s'en échappant