Inférence
Exécuter un modèle d'IA entraîné pour obtenir une réponse, plutôt que l'entraîner initialement.
L’inférence est l’acte d’utiliser un modèle d’IA entraîné : lui fournir un prompt et obtenir une réponse. Elle se distingue de l’entraînement, processus unique et bien plus coûteux qui construit les poids du modèle.
Cette distinction aide à comprendre les coûts. Entraîner un modèle frontier peut demander des mois et un immense calcul, mais ce coût n’est payé qu’une fois. L’inférence, elle, coûte à chaque utilisation, d’où une facturation généralement au token et l’importance des progrès qui la rendent plus rapide ou moins chère.
C’est aussi pourquoi les petits modèles peuvent fonctionner localement : même un bon portable peut assurer l’inférence de nombreuses tâches, alors qu’il n’aurait jamais pu entraîner le modèle.
-
AMD et Cerebras s’associent pour accélérer les réponses de l’IA
-
Les prochaines puces d’IA de Nvidia tireraient dix fois plus de travail de la même énergie
-
Kimi K3 est devenu trop populaire : Moonshot suspend les nouveaux abonnements
-
DeepSeek cherche de nouveaux milliards quelques semaines après sa première levée : l’IA bon marché coûte cher
-
DeepSeek conçoit sa propre puce d’IA, et lève des fonds externes pour la première fois