vLLM
Il server open source più utilizzato per eseguire in modo efficiente un modello scaricato, soprattutto quando molte persone lo interrogano contemporaneamente.
Scaricare i pesi di un modello è una cosa, servirli rapidamente a molti utenti è un’altra. vLLM è un software gratuito che si colloca tra i pesi e l’applicazione: carica il modello, raggruppa insieme le richieste in arrivo, gestisce attentamente la memoria della GPU ed espone un’interfaccia che imita l’API di OpenAI, quindi gli strumenti esistenti funzionano invariati.
Se leggi una scheda modello che dice “consigliamo di utilizzare questo modello con vLLM”, ecco cosa significa. Le principali alternative sono SGLang, che compete su un terreno simile, e llama.cpp, che prende di mira piccole macchine e laptop piuttosto che server.
-
Un modello da 2,5 miliardi di parametri che batte quelli più grandi e funziona sul tuo laptop
-
K2 Horizon fornisce sei modelli aperti e con essi i dati di addestramento
-
DeepSeek apre un modello da 305 miliardi di parametri che finalmente può vedere
-
Meta ha messo un modello 30B sul tuo laptop e Zuckerberg ha utilizzato il lancio per combattere
-
Qualcuno ha fatto funzionare DeepSeek V4 Flash in produzione su una singola scheda AMD e ha pubblicato tutte le patch necessarie