Pretraining
Die erste und teuerste Trainingsphase, in der ein Modell riesige Textmengen durcharbeitet und allgemeine Muster lernt.
Im Pretraining lernt ein Sprachmodell überhaupt erst Sprache. Es liest sich durch einen enormen Berg Text, immer wieder, und justiert dabei seine internen Zahlen so, dass es besser vorhersagt, was als Nächstes kommt. Noch sagt ihm niemand, es solle hilfreich sein, und es hat keine Vorstellung davon, was ein Chat ist. Es saugt bloß Muster auf: Grammatik, Fakten, Code, die Form einer Argumentation. Diese Phase frisst den größten Teil des Rechenbudgets und läuft üblicherweise drei bis sechs Monate auf einem großen Cluster.
Alles, was ein Modell angenehm im Gespräch macht, kommt danach, im Fine-Tuning und verwandten Schritten, die viel billiger sind. Diese Trennung erklärt einiges an Branchennachrichten. Wenn Sie lesen, ein Modell sei “im Pretraining”, ist eine Veröffentlichung noch Monate entfernt. Und wenn ein Labor das Verhalten verbessern will statt des reinen Wissens, fängt es meist nicht von vorn an, sondern justiert die späteren Stufen.
-
Ein Modell mit 2,5 Milliarden Parametern, das größere Modelle übertrifft und auf Ihrem Laptop läuft
-
LAION veröffentlicht 10 Millionen Stunden Video für Open AI Research
-
TikTok-Besitzer ByteDance trainiert Berichten zufolge Chinas bisher größtes KI-Modell
-
Ein offenes deutsches Modell hatte Testantworten in den Trainingsdaten, und dank Offenheit wissen wir es
-
Soofi S: Deutschland hat nun ein offenes KI-Modell, das die Open-Source-Charts anführt