Un modèle de diffusion écrit désormais 1 100 mots par seconde et cela ne coûte presque rien
Inception Labs a publié Mercury 2.5, un modèle de langage construit de la même manière que les générateurs d'images sont construits plutôt que comme ChatGPT. Il produit 1 107 jetons par seconde sur les cartes Nvidia ordinaires à 20 cents par million de jetons d'entrée.
Inception Labs a publié Mercury 2.5 lundi, et le chiffre que tout le monde cite est de 1 107 jetons par seconde. Les jetons sont les petits morceaux de texte qu’un modèle lit et écrit, environ trois quarts de mot chacun, ce qui représente environ 800 mots par seconde provenant d’un seul modèle sur du matériel Nvidia largement disponible. À titre de comparaison, la plupart des modèles de chat que vous utilisez aujourd’hui semblent rapides, entre 50 et 150 jetons par seconde.
La société affirme que Mercury 2.5 est environ 40 % plus performant que Mercury 2 sur ses mesures internes, et qu’il se situe dans la même gamme de qualité que les niveaux bon marché et rapides des grands laboratoires : GPT-5.6 Luna sur son réglage bas, Gemini 3.5 Flash-Lite, Claude Haiku 4.5. Il est livré avec une fenêtre contextuelle de 260 000 jetons, ce qui correspond à la quantité de texte que le modèle peut garder à l’esprit à la fois, ainsi qu’un effort de raisonnement réglable, des appels d’outils parallèles et une sortie JSON qui suit un schéma que vous définissez. Le prix standard est de 0,20 dollar par million de jetons d’entrée et de 0,75 par million de sortie, avec une remise de lancement de 80 % qui les ramène à 0,04 et 0,15. Inception revendique également un temps inférieur à 170 ms pour obtenir le premier jeton pour les pipelines vocaux, ce qui correspond au délai avant le retour du premier mot.
Qu’est-ce qu’il y a derrière ça
Presque tous les modèles de langage que vous avez utilisés fonctionnent de gauche à droite. Il écrit un jeton, regarde tout ce qu’il a écrit, puis écrit le suivant. Cette séquence explique pourquoi la génération a un plafond de vitesse : le modèle ne peut littéralement pas démarrer le jeton 200 avant que le jeton 199 n’existe.
Un modèle de langage de diffusion fonctionne de la même manière que les générateurs d’images comme Stable Diffusion. Cela commence par une ébauche grossière et bruyante de la réponse complète, puis l’affine par passes, en affinant de nombreux jetons en même temps. Le raffinement étant effectué en parallèle, le même GPU produit beaucoup plus de texte par seconde. Historiquement, le compromis a été la qualité, car un modèle qui s’engage très tôt sur une forme approximative a plus de mal à faire face à de longues chaînes de raisonnement minutieux. Mercury 2.5 est l’argument d’Inception selon lequel l’écart s’est suffisamment réduit pour être important pour le travail quotidien, et de leur propre chef, il s’agit du plus grand modèle de langage de diffusion que quiconque ait formé. Cette affirmation n’a pas encore été vérifiée de manière indépendante, ce qui mérite d’être gardé à l’esprit.
Ce que cela signifie pour vous : Si vous êtes simplement curieux de connaître l’IA, rien ne change aujourd’hui, mais c’est une chose utile à savoir : la vitesse et le prix ne sont pas des propriétés fixes de l’IA, ils dépendent de la façon dont le modèle est construit, et quelqu’un vient de trouver un raccourci. Si vous construisez des choses, le cas intéressant est celui où l’attente est le problème plutôt que la brillance : la saisie semi-automatique dans un éditeur, un assistant vocal qui doit répondre avant que la pause ne devienne gênante, un nettoyage en masse de quelques milliers de documents. À 15 cents par million de jetons de sortie pendant la remise de lancement, les tâches trop coûteuses pour exécuter une archive entière ne le sont soudainement plus. Une mise en garde juste : effectuez votre propre comparaison avant de changer quoi que ce soit d’important, car “comparable au niveau bon marché d’un modèle frontière” est une affirmation du vendeur, pas un verdict du terrain.
Sources
Sources: https://www.inceptionlabs.ai/blog/introducing-mercury-2-5
Meta arrête de noter les ingénieurs sur la quantité d'IA qu'ils utilisent
Après que les employés se soient affrontés dans un classement interne des jetons, Meta a déclaré aux ingénieurs que les tableaux de bord d'utilisation de l'IA et le nombre de jetons ne seraient plus pris en compte dans les évaluations de performances. L'épisode a désormais un nom : tokenmaxxing.