vLLM
Il server open source più utilizzato per eseguire in modo efficiente un modello scaricato, soprattutto quando molte persone lo interrogano contemporaneamente.
Scaricare i pesi di un modello è una cosa, servirli rapidamente a molti utenti è un’altra. vLLM è un software gratuito che si colloca tra i pesi e l’applicazione: carica il modello, raggruppa insieme le richieste in arrivo, gestisce attentamente la memoria della GPU ed espone un’interfaccia che imita l’API di OpenAI, quindi gli strumenti esistenti funzionano invariati.
Se leggi una scheda modello che dice “consigliamo di utilizzare questo modello con vLLM”, ecco cosa significa. Le principali alternative sono SGLang, che compete su un terreno simile, e llama.cpp, che prende di mira piccole macchine e laptop piuttosto che server.