vLLM
El servidor de código abierto más utilizado para ejecutar con eficiencia un modelo descargado, sobre todo cuando muchas personas lo consultan a la vez.
Descargar los pesos de un modelo es una cosa; servirlo con rapidez a muchos usuarios es otra. vLLM es software gratuito situado entre los pesos y la aplicación. Carga el modelo, agrupa solicitudes entrantes, administra con cuidado la memoria de la GPU y ofrece una interfaz que imita la API de OpenAI. Así, las herramientas existentes pueden utilizarlo sin cambios.
Cuando una ficha de modelo dice «recomendamos usar este modelo con vLLM», se refiere a este software. Las principales alternativas son SGLang, que compite en un terreno parecido, y llama.cpp, orientado a máquinas pequeñas y portátiles en vez de servidores.
-
Un modelo de 2.500 millones de parámetros que supera a los más grandes y se ejecuta en su computadora portátil
-
K2 Horizon envía seis modelos abiertos y los datos de entrenamiento con ellos
-
DeepSeek abre un modelo de 305 mil millones de parámetros que finalmente puede ver
-
Meta puso un modelo 30B en su computadora portátil y Zuckerberg usó el lanzamiento para buscar pelea
-
Alguien ejecutó DeepSeek V4 Flash en producción en una sola tarjeta AMD y publicó todos los parches necesarios