CourionAI
DE
Newsletter
← Alle News
local-ai 2 Min. Lesezeit

Ein 80-Milliarden-Parameter-Modell läuft jetzt auf einem normalen Mac mit 4,3 GB Speicher und ein 35-B-Modell läuft auf einem iPhone

Swiftlet ist eine offene Laufzeit, die die Expertengewichte eines Modells von der SSD streamt, anstatt sie in den Speicher zu laden. Ein Qwen-Modell mit 80 Milliarden Parametern erreicht auf einem Mac maximal 4,3 GB RAM. Der Kompromiss besteht in der Geschwindigkeit und einem großen Download.

Ein Laptop und ein Telefon, die durch ein dünnes Band mit einem riesigen Schubladenlager verbunden sind, wobei eine Schublade bei Bedarf herausgezogen wird

Ein Entwickler hat Swiftlet veröffentlicht, eine Open-Source-Laufzeitumgebung, die sehr große offene Modelle auf gewöhnlicher Apple-Hardware ausführt, indem sie sich weigert, den Großteil des Modells überhaupt in den Speicher zu laden. Die Schlagzeilen: Qwen3-Next-80B, ein Modell mit 80 Milliarden Parametern, benötigt 42 GB auf der Festplatte, erreicht aber auf einem M5-Mac maximal 4,3 GB RAM und produziert etwa 5 Wörter Text pro Sekunde. Ein 35-Milliarden-Parameter-Qwen läuft auf einem iPhone 17 in etwa 2,5 GB. Der Code ist für Apache 2.0 lizenziert.

Der Trick ist die Architektur des Modells. Bei diesen Qwen-Modellen handelt es sich um ein sogenanntes mixture of experts, was bedeutet, dass das Modell in Hunderte von spezialisierten Subnetzwerken aufgeteilt ist und nur eine Handvoll für ein bestimmtes Wort verwendet wird. Das 80B-Modell leitet jeden Token an 10 seiner 512 Experten weiter, sodass nur etwa 3 Milliarden Parameter tatsächlich gleichzeitig arbeiten. Swiftlet behält diesen kleinen, permanent aktiven Kern, etwa 2,5 GB, im Speicher und ruft die einzelnen Experten genau dann von der SSD ab, wenn sie benötigt werden. Es packt sie in einer festen Größe, sodass ein Experte einem Lesevorgang auf der Festplatte entspricht, und speichert die beliebtesten im Cache. Apple SSDs sind schnell genug, dass die Fehlschläge kaum schaden.

Was dahinter steckt. Zwei Jahre lang galt für die lokale Ausführung von KI eine einfache Faustregel: Das Modell muss in Ihren Speicher passen, ein 70B-Modell bedeutete also eine teure Maschine. Experten-Streaming verstößt stillschweigend gegen diese Regel für eine bestimmte Modellfamilie. Die Idee ist nicht neu, der Autor verweist auf frühere Projekte TurboFieldfare und ANEMLL, aber dies ist die erste Version, die als Bibliothek, als Befehlszeilentool, als OpenAI-kompatibler lokaler Server und als fertige iPhone-App ausgeliefert wird. Der Autor weist auch gleich zu Beginn auf die ehrliche Einschränkung hin, und es ist der nützlichste Satz in der gesamten Readme-Datei: Da pro Token nur etwa 3B Parameter aktiv sind, „chatten und schreiben diese Modelle wie große Modelle, erinnern sich aber an Fakten wie kleine.“ Die Größe auf der Festplatte ist kein Wissen in Ihrer Tasche.

Was das für dich bedeutet: Wenn Sie einen Apple Silicon Mac besitzen und neugierig sind, KI auf Ihrem eigenen Computer auszuführen, ohne dass etwas an einen Server gesendet wird, senkt dies die Hardware-Grenze erheblich. Planen Sie den Speicherplatz ein, 18 GB für die 35B und 42 GB für die 80B, und erwarten Sie eher Lesegeschwindigkeit als sofortige Antworten. Auf dem iPhone schafft das 35B derzeit etwa ein Wort pro Sekunde, was eher eine Demo als ein tägliches Tool ist. Wenn Sie nicht basteln, können Sie daraus eine richtungsweisende Erkenntnis ziehen: Die Kluft zwischen dem, was ein Rechenzentrum betreibt, und dem, was Ihr Laptop betreibt, wird immer kleiner, und es wird immer schwieriger, datenschutzfreundliche lokale KI als Hobby abzutun.

Quellen

Quellen: https://github.com/leonickson1/Swiftlet

Nächster Artikel

Eine Rekordzahl von acht Pulitzer-Gewinnern und Finalisten, die mithilfe von KI bekannt gegeben haben, und der interessante Teil ist, wofür sie sie eingesetzt haben

Acht Pulitzer-Preisträger gaben in diesem Jahr den Einsatz von KI an, die meisten seit Einführung der Offenlegungspflicht im Jahr 2024. In fast allen Fällen wurde das Tool zum Durchsuchen oder Übersetzen großer Dokumentenstapel und nicht zum Schreiben verwendet.

Ein riesiger Stapel Dokumentenboxen wird von einer Vergrößerungslinse erfasst, während eine leere Schreibmaschinenplatte unberührt daneben steht