CourionAI
DE
Newsletter
← Alle News
ai-basics 3 Min. Lesezeit

TikTok-Besitzer ByteDance trainiert Berichten zufolge Chinas bisher größtes KI-Modell

Drei Insider sagten der Financial Times, dass ByteDance ein Modell mit bis zu zehn Billionen Parametern im Vortraining hat, dreimal so groß wie Kimi K3.

Eine riesige Gitterkuppel aus miteinander verbundenen Knotenpunkten im Bau, die die Kräne und Gerüste um sie herum winzig erscheinen lässt

ByteDance, das Unternehmen hinter TikTok, trainiert ein KI-Modell mit bis zu zehn Billionen Parametern, heißt es in einem Bericht der Financial Times unter Berufung auf drei mit der Arbeit vertraute Personen. Wenn die Zahl zutrifft, wäre es ungefähr dreimal so groß wie der Kimi K3 von Moonshot, das derzeit größte chinesische Modell, und würde ByteDance in die gleiche Gewichtsklasse wie den Mythos 5 von Anthropic einordnen, der nach Branchenschätzungen bei etwa acht Billionen liegt. Anthropic hat nie eine eigene Figur veröffentlicht.

Parameter sind die einstellbaren Zahlen innerhalb eines Modells, die Einstellungen, die es während des Trainings anpasst, um das Gelernte zu kodieren. Mehr Parameter bedeuten mehr Platz zum Speichern von Mustern, daher ist die Anzahl ein grober Indikator für die Kapazität. Rau ist das entscheidende Wort. Datenqualität, Trainingsmethode und die Dauer der Modellzüge sind mindestens genauso wichtig, und in der Branche hat es immer wieder kleinere, besser trainierte Modelle gegeben, die größere, schlampige Modelle besiegten. Behandeln Sie die Parameteranzahl so, wie Sie die Motorgröße in einem Auto behandeln würden: informativ, nicht entscheidend.

Berichten zufolge befindet sich das Modell im Vortraining, der ersten und rechenintensivsten Phase, in der es enorme Textmengen durcharbeitet, bevor eine Fine-Tuning erfolgt. Diese Phase dauert normalerweise drei bis sechs Monate, eine Veröffentlichung würde also noch in weiter Ferne liegen. Eine Quelle fügte ein erwähnenswertes Detail hinzu: ByteDance vermeidet seit über einem Jahr die Destillation. Destillation bedeutet, dass Sie Ihr Modell anhand der Ergebnisse eines anderen Modells trainieren, eine Abkürzung, mit der Sie zu einem günstigen Preis eine anständige Qualität erhalten und zwischen Laboren zu einem wunden Punkt geworden ist. Die Entscheidung, es nicht zu verwenden, ist eine Behauptung darüber, dass man die teure Sache richtig macht, obwohl es sich eher um eine Behauptung einer anonymen Quelle als um eine veröffentlichte Tatsache handelt.

Das Gesamtbild ist eine Rückkehr des reinen Maßstabs als Wettbewerbshebel. Berichten zufolge forderte Gründer Zhang Yiming das 2.000-köpfige Seed-Team von ByteDance auf, langfristig weltweit führende Modellfähigkeiten anzustreben. Laut Elon Musk trainiert xAI Grok-Varianten mit sechs und zehn Billionen Parametern auf seinem Colossus-2-Cluster. Nach ein paar Jahren, in denen Effizienz und cleveres Training in Mode waren, wetten mehrere Labore erneut darauf, dass größere Geräte mit enormen Kosten immer noch gewinnen.

Was das für dich bedeutet: Im Moment nichts Praktisches. Dieses Modell existiert nicht als Produkt, darf niemals außerhalb Chinas auf den Markt kommen und wäre in der EU mit Export- und Regulierungsfragen konfrontiert, wenn es so wäre. Es ist nützlich für die Kalibrierung. Wenn Sie das nächste Mal lesen, dass ein Modell über eine atemberaubende Parameteranzahl verfügt, wissen Sie jetzt, dass die Zahl die Kapazität und nicht die Qualität beschreibt und dass die interessante Frage darin besteht, worauf und wie trainiert wurde. Wenn Sie Open-Weight-Modellen folgen, behalten Sie dieses auf jeden Fall im Auge: ByteDance hat bereits Open-Weights veröffentlicht, und ein chinesisches Labor mit zehn Billionen Parametern würde die Erwartungen für alle zurücksetzen.

Quellen

Quellen: https://www.ft.com/content/9b8383b1-a28d-4940-8c4e-2f0cd21556ef

Nächster Artikel

Ein OpenAI-Entwickler sagt, dass jetzt ein guter Zeitpunkt wäre, Ihre offengelegten Passwörter zu bereinigen

Die Warnung ist unverblümt: Alles, was vertraulich auf GitHub oder Pastebin in der Öffentlichkeit liegt, wird viel schneller gefunden, weil die Modelle billig genug sind, um überall gleichzeitig suchen zu können.

Ein einzelner Messingschlüssel, der in einem Lichtkegel auf einer Türschwelle lag, dahinter eine dunkle Hecke voller winziger, wachsamer Augen