CourionAI
DE
Newsletter
← Alle News
local-ai 3 Min. Lesezeit

Ein 125-Milliarden-Parameter-Modell auf einer gewöhnlichen Grafikkarte

Tim Dettmers gab einen Ausblick auf die Open-Source-Woche seines Labors: ein Inferenz-Framework, auf dem Qwen 3.8 Flash Next auf einer einzelnen 24-GB-GPU läuft, DeepSeek V4.1 auf einem MacBook und eine Komprimierungstechnik, die seiner Meinung nach die Agentenkosten halbiert.

Eine riesige Kugel, die zusammengedrückt und verformt wird, um in eine kleine Schreibtischbox zu passen

Tim Dettmers, der Forscher hinter der weit verbreiteten Quantisierungsbibliothek bitsandbytes, veröffentlichte am Montag eine Vorschau dessen, was sein Universitätslabor diese Woche veröffentlicht: zwei Open-Source-Projekte und vier Artikel, die bewusst zusammen versendet werden. Die darin enthaltenen Zahlen verändern die Möglichkeiten auf Hardware, die Menschen bereits besitzen. Sein Inferenz-Framework führt Qwen 3.8 Flash Next, ein 125-Milliarden-Parametermodell, auf einer einzigen 24-GB-Grafikkarte aus, wie sie in einem gewöhnlichen Desktop zu finden ist. Mit einer AMD Strix-Maschine, einem Nvidia DGX Spark oder einem MacBook mit 128 GB Speicher könne man DeepSeek V4.1 seiner Meinung nach mit 550 Milliarden Parametern ausführen. Auf dem Mac läuft ein Qwen 3.6 35B-Modell mit 450 Token pro Sekunde bei 1,5 Bit pro Gewicht.

Die letzte Zahl verdient es, ausgepackt zu werden. Jeder Parameter in einem Modell ist eine Zahl, die normalerweise in 16 Bit Speicher gespeichert wird. Durch die Quantisierung werden diese Zahlen auf weniger Bits komprimiert, und bei 1,5 Bits benötigt ein Modell etwa ein Zehntel des Speichers, den es sonst benötigen würde. Das Handwerk ist Präzision, weshalb es schwierig ist, dies zu tun, ohne die Qualität des Ergebnisses zu beeinträchtigen, und weshalb der Name Dettmers mit einem Großteil dieser Arbeit verbunden ist. Das andere Stück ist CliffCompaction, eine automatische Verdichtungstechnik, die sein Labor seit Monaten intern verwendet. Bei der Komprimierung arbeitet ein Agent weiter, nachdem sein Gespräch übergelaufen wäre: Es fasst zusammen, was passiert ist, damit er weitermachen kann. Er sagt, dass Sitzungen für Millionen von Token laufen, einige seiner letzten hundert Millionen, und dass dadurch die Kosten etwa um die Hälfte gesenkt werden. Ein Partnerunternehmen verzeichnete eine Reduzierung seines gesamten KI-Budgets um 45 Prozent.

Was steckt dahinter

Dettmers formuliert die gesamte Veröffentlichung als Argument dafür, dass die KI-Forschung nicht nur demjenigen gehört, der die meisten GPUs besitzt, und dass kleine Universitätslabore genau deshalb im Vorteil sind, weil sie an Problemen arbeiten müssen, deren Angriffe kostengünstig sind. Das ist ein schöner Gedanke, und die interessantere technische Behauptung dahinter ist, dass die Obergrenze für lokale KI nicht durch die Modelle erreicht wurde. Offene Gewichte, die gut genug sind, um nützlich zu sein, können seit einiger Zeit heruntergeladen werden. Das Hindernis bestand darin, dass ein Modell mit 125 Milliarden Parametern nicht in eine normale Maschine passen würde, sodass die meisten Leute kleine Modelle verwendeten und zu dem Schluss kamen, dass die lokale KI enttäuschend sei.

Der faire Vorbehalt: Dies sind Vorschau-Behauptungen aus einem Blog-Beitrag, der Code landet in den kommenden Tagen und niemand außerhalb des Labors hat etwas davon reproduziert. Insbesondere Quantisierungsergebnisse sehen auf den zur Demonstration ausgewählten Benchmarks tendenziell besser aus als auf Ihrer eigenen Arbeit.

Was das für Sie bedeutet: Wenn das Ausführen von Modellen auf Ihrem eigenen Computer jemals attraktiv war, aus Datenschutz-, Kosten- und Offline-Arbeitsgründen, ist dies die Woche, in der Sie noch einmal nachschauen sollten, da die Größenbeschränkungen, an die Sie sich erinnern, möglicherweise nicht mehr gelten. Für alle anderen ist die entsprechende Nummer die Kostennummer. Wenn eine Verdichtungstechnik die Ausgaben eines Agenten halbieren kann und die Methode öffentlich ist, wird sie nicht lange ein Forschungskuriosum bleiben. Billigere Wirkstoffe sind der Mechanismus, über den all dies in gewöhnliche Produkte gelangt.

Quellen

Quellen: https://timdettmers.com/2026/09/21/dlab-open-source-week/

Nächster Artikel

Ein Mac-Fehler ermöglicht es jeder App, das, was Sie diktieren, an den Assistenten von Meta umzuleiten

Der Sicherheitsforscher Patrick Wardle hat in Metas Muse für Mac einen Zero-Day enthüllt: eine undokumentierte Einstellung, die jeder lokale Prozess umdrehen kann, diktierte Eingabeaufforderungen an den Server eines Angreifers sendet und das Konto-Token offenlegt.

Ein Mikrofon, dessen Kabel die Steckdose umgeht und in einer versteckten Seitenklappe verschwindet