CourionAI
DE
Newsletter
← Alle News
local-ai 3 Min. Lesezeit

KoboldCpp 1.120 bietet eine neue Möglichkeit zum Laden von Modellen und Unterstützung für die neuesten offenen Modelle

Eine ruhige Samstagsveröffentlichung für eine der benutzerfreundlichsten Möglichkeiten, KI-Modelle auf Ihrem eigenen Computer auszuführen. Neu in dieser Version: ein DirectIO-Lademodus, Unterstützung für Qwen3.8-Flash-Next und Ling-3.0-flash vom ersten Tag an sowie benutzerdefinierte JavaScript-Tools.

Ein Desktop-Computerturm mit offener Vorderseite und einem breiten Bandband, das direkt von einer Spule auf dem Boden zugeführt wird

KoboldCpp, eine der einfachsten Möglichkeiten, ein KI-Modell auf Ihrem eigenen Computer auszuführen, wurde am Samstag in Version 1.120 ausgeliefert. Wenn Sie es noch nie verwendet haben: Es handelt sich um eine einzelne herunterladbare Datei, kein Installationsprogramm und keine Python-Umgebung, mit der Sie sich herumschlagen müssen, die ein geöffnetes Modell von der Festplatte lädt und Ihnen ein Chat-Fenster in Ihrem Browser anzeigt. Diese Veröffentlichung ist klein, aber nützlich, und sie ist ein guter Vorwand, um ein paar Dinge zu erklären, die einschüchternd klingen, es aber nicht sind.

Der Hauptzusatz ist ein DirectIO-Modelllademodus, der mit --usedirectio aktiviert wird. Das Laden eines Modells bedeutet, dass Sie mehrere Gigabyte von Ihrem Laufwerk in den Speicher kopieren müssen, bevor etwas passieren kann. Standardmäßig versucht das Betriebssystem, dabei geschickt vorzugehen, indem es diese Bytes zwischenspeichert. DirectIO überspringt diese mittlere Schicht und liest direkt vom Laufwerk, was auf vielen Systemen einen schnelleren Start und weniger Speicherverschwendung für einen Cache bedeutet, den Sie nicht benötigen. Verwandt: mlock und mmap können jetzt kombiniert werden, zwei ältere Optionen, die steuern, ob das Modell im Speicher fixiert oder träge von der Festplatte zugeordnet wird. Die Veröffentlichung bietet außerdem ab dem ersten Tag Unterstützung für zwei brandneue offene Modelle, Alibabas Qwen3.8-Flash-Next und Ling-3.0-flash, und der Betreuer fügt eine Warnung hinzu, die es wert ist, wiederholt zu werden: Es sind schlechte Quantisierungen dieser Modelle im Umlauf, also nehmen Sie die Dateien von einer Quelle, der Sie vertrauen. Abgerundet wird das Ganze durch benutzerdefinierte, vom Benutzer konfigurierbare JavaScript-Tools in der integrierten Kobold Lite-Schnittstelle, die mit dem Standard-Tool-Aufrufformat kompatibel sind, sowie Korrekturen bei der Bildgenerierung und die üblichen Zusammenführungen aus der Upstream-Datei llama.cpp.

Was hier eigentlich los ist: Veröffentlichungen wie diese sind die unrühmliche Hälfte der lokalen KI, und sie sind wichtiger als die Modellankündigungen. Ein neues offenes Modell ist nur dann nützlich, wenn etwas auf Ihrem Computer es tatsächlich laden kann, und die Lücke zwischen „auf Hugging Face veröffentlichten Gewichten“ und „läuft auf einem normalen Laptop“ wird durch Projekte wie dieses, darunter llama.cpp, und die Leute, die quantisierte Versionen erstellen, gefüllt. Quantisierung, wenn das ein neues Wort ist, ist der Trick, die Zahlen eines Modells mit geringerer Präzision zu speichern, damit sie bei geringem Qualitätsverlust in weniger Speicher passen. Die Unterstützung am ersten Tag für ein Modell, das drei Tage zuvor veröffentlicht wurde, ist die Art von Sache, die im Stillen darüber entscheidet, ob offene Gewichte eine echte Alternative oder nur eine Pressemitteilung sind.

Was das für Sie bedeutet: Wenn Sie neugierig sind, ein Modell vor Ort zu betreiben, ist dies ein wirklich aufwandsarmer Ausgangspunkt. Laden Sie eine Datei für Ihr System herunter, holen Sie sich ein quantisiertes Modell und schon haben Sie einen privaten Assistenten, der offline arbeitet und nichts pro Nachricht kostet. Es wird nicht mit einem Frontier-Modell aus einem großen Labor mithalten können, und Sie sollten damit rechnen, dass es langsamer und weniger leistungsfähig ist, aber zum Entwerfen, Zusammenfassen und Fragen von Dingen, die Sie lieber nicht an den Server eines anderen senden möchten, reicht es oft aus. Wenn Sie KoboldCpp bereits verwenden, sind die beiden neuen Modelle und bei Maschinen mit schnellen Laufwerken und wenig Speicher das DirectIO-Flag der praktische Grund für ein Update. Alle anderen können dies einfach ignorieren und auf die nächste Veröffentlichung warten.

Quellen

Quellen: https://github.com/LostRuins/koboldcpp/releases/tag/v1.120

Nächster Artikel

Keine KI-Freitage: Der Vorschlag eines Entwicklers, den Assistenten einmal pro Woche auszuschalten

Htmx-Erfinder Carson Gross veröffentlichte ein einseitiges Manifest, in dem er Teams aufforderte, an einem Tag in der Woche ohne KI-Assistenten zu programmieren. Es landete ganz oben in den Hacker-News und das Argument ist leicht zu übernehmen, auch wenn Sie nie Code schreiben.

Ein Kalendergitter, aus dem eine Säule herausgerissen ist und aus dessen Lücke sich ein abgezogenes Stromkabel windet