vLLM
El servidor de código abierto más utilizado para ejecutar con eficiencia un modelo descargado, sobre todo cuando muchas personas lo consultan a la vez.
Descargar los pesos de un modelo es una cosa; servirlo con rapidez a muchos usuarios es otra. vLLM es software gratuito situado entre los pesos y la aplicación. Carga el modelo, agrupa solicitudes entrantes, administra con cuidado la memoria de la GPU y ofrece una interfaz que imita la API de OpenAI. Así, las herramientas existentes pueden utilizarlo sin cambios.
Cuando una ficha de modelo dice «recomendamos usar este modelo con vLLM», se refiere a este software. Las principales alternativas son SGLang, que compite en un terreno parecido, y llama.cpp, orientado a máquinas pequeñas y portátiles en vez de servidores.