CourionAI
DE
Newsletter
← Alle News
open-source 2 Min. Lesezeit

Qwen3.8-27B ist da und läuft auf einer einzigen Gaming-Grafikkarte

Alibaba hat endlich die kleinere Hälfte seines Qwen3.8-Versprechens veröffentlicht. Das Modell mit 27 Milliarden Parametern erreichte Platz eins bei Hacker News, weil Menschen es tatsächlich zu Hause betreiben können.

Ein kleiner Desktop-Computer leuchtet warm auf einem Schreibtisch neben der dunklen Silhouette eines riesigen Serverschranks

Alibaba hat heute Qwen3.8-27B veröffentlicht. Innerhalb weniger Stunden stand das Modell mit 893 Punkten an der Spitze von Hacker News. Der Grund ist einfach: Anders als das riesige Qwen3.8-Max, dessen Gewichte vor drei Tagen erschienen, passt diese Version auf Hardware, die normale Menschen besitzen. Eine einzelne RTX 4090 oder ein Mac Studio genügt, sofern eine komprimierte Modelldatei verwendet wird.

Das Modell ist dicht. Das bedeutet, dass bei jedem erzeugten Wort alle 27 Milliarden Parameter verwendet werden. Es verarbeitet Bilder ebenso wie Text. Der native Kontext, also die Textmenge, die das Modell gleichzeitig im Blick behalten kann, beträgt 262.144 Tokens und entspricht ungefähr einem sehr langen Buch. In der Diskussion bei Hacker News reichen die gemeldeten Geschwindigkeiten von etwa 10 Tokens pro Sekunde bei starker Komprimierung bis zu rund 160 auf einem Nvidia DGX Spark mit spekulativer Dekodierung. Dabei entwirft ein kleines Modell Wörter, die das große anschließend gesammelt prüft.

Bei den Benchmarks ist Vorsicht nötig. Alibabas eigene Modellkarte nennt für Qwen3.8-27B einen Wert von 61,7 bei SWE-bench Pro, einem Test zum Beheben echter Softwareprobleme. Für eine Claude-Opus-Konfiguration werden 53,4 angegeben. Diese einzelne Zeile trägt fast alle Schlagzeilen, das Modell konkurriere mit Claude Opus. Bei den vier anderen Tests in derselben Tabelle, darunter Terminal-Bench und Humanity’s Last Exam, liegt das kleine Modell zurück, teilweise deutlich. Bei letzterem sind es 30,8 gegenüber 40,0.

Was viele Überschriften auslassen: Anbieter-Benchmarks sind ebenso Marketingdokumente wie Messungen. Kommentatoren wiesen darauf hin, dass beide Seiten mit unterschiedlichen Agentengerüsten, Temperatureinstellungen und Prompts getestet wurden. Ein direkter Vergleich ist dadurch unsicher. Hinzu kommt die bekannte Sorge, dass Labore ihre Modelle gezielt auf bekannte Tests abstimmen. Das macht die Veröffentlichung nicht weniger beeindruckend. Dass ein lokal betreibbares Modell mit 27 Milliarden Parametern einem kommerziellen Spitzenmodell überhaupt nahekommt, wäre vor einem Jahr absurd erschienen.

Ein gemeldeter Nachteil ist vor dem Download wichtig: Das Modell besitzt einen Regler für den Denkaufwand. Auf der höchsten Stufe xhigh dauerten einfache Anfragen bei mehreren Nutzern 20 bis 90 Minuten. Für den Alltag sind medium oder low sinnvoller.

Was das für dich bedeutet: Wenn du noch nie ein Modell auf dem eigenen Rechner betrieben hast, ist dies ein guter Zeitpunkt zum Ausprobieren. LM Studio führt die komprimierten Varianten auf. Du kannst eine passende Größe auswählen und die Einrichtung ohne Kommandozeile durchklicken. Nichts verlässt deinen Computer, was bei Kundendokumenten oder privaten Notizen wichtig ist. Wenn du bereits einen gehosteten Assistenten zum Programmieren verwendest, sollten die Erwartungen ruhig bleiben: Lokale Modelle holen auf, bei schwierigen Aufgaben mit vielen Schritten ist der Unterschied aber weiterhin sichtbar. Für die meisten Menschen lautet die ehrliche Zusammenfassung, dass die kostenlose und private Option diese Woche spürbar besser geworden ist.

Quellen

Quellen: https://huggingface.co/Qwen/Qwen3.8-27B-FP8

Nächster Artikel

Ein KI-Protokollant machte 181.874 Meetings für jedes kostenlose Konto zugänglich

Ein Sicherheitsforscher entdeckte, dass tl;dv, ein KI-Meetingrekorder mit mehr als zwei Millionen Nutzern, jedem angemeldeten Konto die Auflistung aller Meetings erlaubte, einschließlich laufender Gespräche.

Ein leerer Besprechungsraum ist durch eine angelehnte Tür mit übergroßem Schlüsselloch zu sehen, Licht fällt durch den Spalt