Inférence
Exécuter un modèle d'IA entraîné pour obtenir une réponse, plutôt que l'entraîner initialement.
L’inférence est l’acte d’utiliser un modèle d’IA entraîné : lui fournir un prompt et obtenir une réponse. Elle se distingue de l’entraînement, processus unique et bien plus coûteux qui construit les poids du modèle.
Cette distinction aide à comprendre les coûts. Entraîner un modèle frontier peut demander des mois et un immense calcul, mais ce coût n’est payé qu’une fois. L’inférence, elle, coûte à chaque utilisation, d’où une facturation généralement au token et l’importance des progrès qui la rendent plus rapide ou moins chère.
C’est aussi pourquoi les petits modèles peuvent fonctionner localement : même un bon portable peut assurer l’inférence de nombreuses tâches, alors qu’il n’aurait jamais pu entraîner le modèle.
-
La Grande-Bretagne ouvre une porte de 100 millions de livres sterling aux petites entreprises d’IA et leur permet de conserver la propriété intellectuelle
-
Tencent Open-Sources Hy4, un modèle de 770 milliards de paramètres conçu pour le travail de bureau
-
OpenAI a construit sa propre puce et les premiers benchmarks sont bons
-
Anthropic a embauché l'homme qui a construit les puces IA de Google, et la raison n'est pas subtile
-
Une spin-out d'Oxford a vendu à Anthropic 250 millions de dollars de puces qui n'existent pas encore
-
Regarder son propre modèle coûte désormais 20 % de plus à OpenAI, et il a suspendu une session de formation pour le faire
-
Donnez à un modèle frontière uniquement une bibliographie et demandez l’idée. Il y arrive 3 à 15 pour cent du temps
-
Anthropic aurait payé 7 milliards de dollars pour un logiciel permettant aux puces d'aller plus loin
-
Une start-up de puces a doublé sa valeur en un mois en étant délibérément inflexible
-
We Are Building an Invention Meant to Outgrow Its Inventors
-
The Most Valuable AI Skill Is Not Prompting. It Is Verification.
-
Someone Else Is Paying for Your AI, Just Not the Part You Think
-
AMD achète Taalas, une startup qui intègre un modèle d'IA complet dans la puce
-
Cloudflare veut donner à votre agent IA un portefeuille et à vous la limite de dépenses
-
Quelqu'un a fait fonctionner DeepSeek V4 Flash en production sur une seule carte AMD et a publié tous les correctifs nécessaires
-
AMD entraîne un modèle entièrement ouvert sur ses propres puces, mais réserve les poids à la recherche
-
Amazon cesse discrètement de développer la plupart de ses propres modèles d’IA
-
AMD et Cerebras s’associent pour accélérer les réponses de l’IA
-
Les prochaines puces d’IA de Nvidia tireraient dix fois plus de travail de la même énergie
-
Kimi K3 est devenu trop populaire : Moonshot suspend les nouveaux abonnements
-
DeepSeek cherche de nouveaux milliards quelques semaines après sa première levée : l’IA bon marché coûte cher
-
DeepSeek conçoit sa propre puce d’IA, et lève des fonds externes pour la première fois