CourionAI
DE
Newsletter
← Glossar Begriff

vLLM

Der am weitesten verbreitete Open-Source-Server zum effizienten Ausführen eines heruntergeladenen Modells, insbesondere wenn viele Leute es gleichzeitig abfragen.

Die Gewichte eines Modells herunterzuladen ist eine Sache, sie schnell vielen Benutzern zur Verfügung zu stellen, eine andere. vLLM ist eine kostenlose Software, die zwischen den Gewichten und Ihrer Anwendung liegt: Sie lädt das Modell, bündelt eingehende Anfragen, verwaltet den GPU-Speicher sorgfältig und stellt eine Schnittstelle bereit, die die API von OpenAI imitiert, sodass vorhandene Tools unverändert dagegen arbeiten.

Wenn Sie eine Modellkarte lesen, auf der steht: „Wir empfehlen die Verwendung dieses Modells mit vLLM“, bedeutet dies Folgendes. Die wichtigsten Alternativen sind SGLang, das auf einem ähnlichen Gebiet konkurriert, und llama.cpp, das eher auf kleine Maschinen und Laptops als auf Server abzielt.