vLLM
Le serveur open source le plus largement utilisé pour exécuter efficacement un modèle téléchargé, en particulier lorsque plusieurs personnes l'interrogent en même temps.
Télécharger les poids d’un modèle est une chose, les proposer rapidement à de nombreux utilisateurs en est une autre. vLLM est un logiciel gratuit qui se situe entre les pondérations et votre application : il charge le modèle, regroupe les requêtes entrantes, gère soigneusement la mémoire GPU et expose une interface qui imite l’API d’OpenAI, de sorte que les outils existants fonctionnent sans changement.
Si vous lisez une fiche de modèle qui dit “nous recommandons d’utiliser ce modèle avec vLLM”, voici ce que cela signifie. Les principales alternatives sont SGLang, qui rivalise sur un terrain similaire, et llama.cpp, qui cible les petites machines et les ordinateurs portables plutôt que les serveurs.