Pretraining
Die erste und teuerste Trainingsphase, in der ein Modell riesige Textmengen durcharbeitet und allgemeine Muster lernt.
Im Pretraining lernt ein Sprachmodell überhaupt erst Sprache. Es liest sich durch einen enormen Berg Text, immer wieder, und justiert dabei seine internen Zahlen so, dass es besser vorhersagt, was als Nächstes kommt. Noch sagt ihm niemand, es solle hilfreich sein, und es hat keine Vorstellung davon, was ein Chat ist. Es saugt bloß Muster auf: Grammatik, Fakten, Code, die Form einer Argumentation. Diese Phase frisst den größten Teil des Rechenbudgets und läuft üblicherweise drei bis sechs Monate auf einem großen Cluster.
Alles, was ein Modell angenehm im Gespräch macht, kommt danach, im Fine-Tuning und verwandten Schritten, die viel billiger sind. Diese Trennung erklärt einiges an Branchennachrichten. Wenn Sie lesen, ein Modell sei “im Pretraining”, ist eine Veröffentlichung noch Monate entfernt. Und wenn ein Labor das Verhalten verbessern will statt des reinen Wissens, fängt es meist nicht von vorn an, sondern justiert die späteren Stufen.